想象一场跨国视频会议:对方话说完,你的耳机里过了两秒才慢悠悠出译文。内容没错,但节奏全断了——你刚想接话,发现对面已经讲到下一段。
同声传译这门生意,卖的从来不是"翻译得准",而是"几乎不占时间"。9月19日,阿里千问正式发布同声传译大模型 Qwen3.8-LiveTranslate,直接冲着这个"几乎"去的。
0.5秒,为什么值得专门发一场发布会
新模型的字均延迟(LAAL)从上代的 2.8 秒降到 2.3 秒。听起来只是个小数点后的数字,但对同传来说,这半秒决定了听感是"自然"还是"别扭"。
延迟来源不是翻译能力不够,而是流程太长:先听完一句、再识别文字、再翻译、再合成语音,四个环节排队走。字均延迟压缩,本质是把这条流水线拧成一股绳。
翻译出来的声音,还是你原本的声音
底座是 Hybrid MoE 的 Thinker–Talker 双模块设计,用 Interleave 架构把流式理解、文本输出和语音生成串成一条因果序列。
Thinker 负责"听懂"和"译出"——它把视频、音频、原文、译文编排进同一条序列,按时序交替排列、端到端产出。Talker 接过译文和源音频,把译文合成为保留原说话人音色的语音。
也就是说,对方在耳机里听到的,仍是你的音色在说外语。
在支持 60 种语言的基础上,这次补了三块让同传真正能落地的拼图:
- 实时说话人分离:多人交替发言时,每句话归到对应的人头上,音色复刻更稳
- 原文译文同帧同出:双语同屏显示,能边听边核对原文
- 长上下文消歧:联系前文理解当下,人名、术语这类最容易翻错的地方精准度提升
据官方发布的信息,在覆盖 14 个语向的多说话人长音频评测集 Omnilingua-MSpeaker 上,翻译忠实度、流畅度、简洁度与说话人分离错误率四个维度均优于当前主流实时同传系统;公开 FLEURS 测试集的 70 个语言方向同样领先。
谁最先用上
不是国际会议,而是那些"请不起同传、又必须跨语言"的场景:
- 出海企业的日常跨时区会议,以前靠会后纪要,现在可以当场对话
- 跨境直播和客服,字幕和语音能同步产出,不必等后期
- 线上课程与培训,讲师说中文,学员听母语,且保留讲师音色
模型 API 已在千问 AI 平台上线,尝鲜入口同步开放。
三个值得盯的观察点
1. 真实多人会议的表现:评测集是实验室口径,饭桌上三个人抢话才是真考卷
2. 术语与口音的边界:法律、医疗这类高精度场景,错一个词成本很高,敢不敢用取决于错误率
3. 成本曲线:同传过去是稀缺的人工服务,一旦按 token 计价,定价方式会重新定义这门生意
技术替代的从来不是"人",而是"人对时间的要求"。同传译员真正的护城河,正在从"听得快"转向"担得起责任"——这一层,模型还没接过去。