同一引擎上,十个决策读成单 token 约 92 ms。生成 JSON 约 1.57 s,级联还要另加约 411 ms 转写。
研究 · 投稿 ICASSP 2027
DuplexJev
DuplexJev 把冻结的语音大模型变成全双工语音 Agent 的决策引擎:轮次是否结束、该播哪句垫词、谁在说话,都读成选项字母上的单 token 分布。不解码 ASR,也不生成正文。产品名是 Speech-to-Decision。
论文已投稿 IEEE ICASSP 2027,录用结果尚未公布。arXiv 上线后,预印本链接会改到 arXiv。
结果
92 ms
约 90%
90% / 91%
不解码,也能做决策
交叉注意力 connector 上,性别与情绪都到约 90%。只做转写蒸馏时,两者大约停在 55% 和 28%。
末层 connector 的口语问答是 90%,直接读转写稿是 91%。交叉注意力版本的口语问答只降 1 个点(83% → 82%)。
方法
一次前向,读出全部问题
- 01 音频 当前这句话,或一批通话。
- 02 冻结 ASR 编码器 Qwen3-ASR 等现成编码器,权重不动。
- 03 Connector 唯一训练的部分。末层,或三层交叉注意力融合。
- 04 冻结 LLM 一次前向。共享前缀,零解码步。
- 05 单 token 选项分布 每个问题在自己的字母上给出概率,最大概率即置信度。
编码器与大模型可以更换,中间只接一个小 connector。监督落在被读出的那个答案 token 上,内容理解仍保留转写蒸馏,所以模型能听见转写稿里没有的说话人信息。
发布
代码、权重与产品体验
代码、训练配方、批推理管线和双语口语问答集 qa100 已开源。可部署的完整模型是 DuplexJev-4B。
全双工语音体验是产品入口,不是这篇论文的在线复现。