你有没有算过,你上一次跟人工客服说话,是什么时候?
订机票是机器人,查快递是机器人,连银行催还款的都是机器人。但你可能没发现,这些"机器人"背后,一直是按分钟、按字数在烧钱的——语音识别的价格,长期是藏在账单里的一笔隐形开支。
一觉醒来,价格表全改了
9月23日,阿里千问发布 Qwen-Audio-3.1 系列语音大模型,一口气推出五款模型,覆盖语音识别、语音合成、实时交互、音频理解与音频创作。模型更新不算稀奇,真正扎眼的是随附的那行价格公告:全线语音模型降价,其中语音识别(ASR)降幅达95%,实时交互(Realtime)降约85%,语音合成(TTS)降约70%。
95%是什么概念?原来100块钱能干的事,现在5块钱办完。据财联社报道,新版识别模型支持30种语言和16种中文方言,流式识别首字响应约160毫秒,在公开方言测试集上的平均字错误率低至4.55%——温州话、粤语这些"拼音打不出来"的场景,正在被正面攻克。
谁最该紧张,谁最该高兴
先说该高兴的。开小店做本地生意的老板,以前想给店里配个"24小时接电话的AI前台",光识别和合成服务的成本就够呛;现在成本砍到零头,一个能听懂方言、能办事的语音助理,可能就是一个月一顿饭钱。
再说该紧张的。大量人工坐席干的就是"听懂—查—回答"这三步,当AI听懂方言的成本趋近于零,没有判断力和情感浓度的岗位,议价空间只会越来越小。但反过来看,能处理投诉情绪、能兜住复杂纠纷的人,反而更值钱了——机器越便宜,"会处理麻烦"的人越贵。
价格战背后的真算盘
这已经不是大模型第一次打价格战,但语音这一刀砍得最狠,原因不难猜:语音是AI走进电话、音箱、眼镜、机器人这些实体设备的"耳朵和嘴",谁能把语音用成白菜价,谁就卡住了下一个入口。
对普通人,我的建议有三条:第一,如果你的工作高度依赖标准话术,现在就开始往"复杂问题处理"转;第二,做小生意的,可以认真试试给店铺配一个AI接电话的助手,把漏接的电话捞回来;第三,做内容的朋友注意,这次的TTS-Next已经能统一生成人声、音效和环境音,有声书、播客的制作门槛又降了一截。
技术降价从不等人,先学会用的人,先省下真金白银。
这次发布里还有两个容易被忽略的细节。一是新的TTS-Next不再只是"念稿机",它把人声、音效和环境音统一生成,支持多角色音色复刻和48kHz输出,播客、有声书、广告配音这些活儿,一条模型全包了。二是Realtime升级成全双工交互,可以随时插话、被打断,还能在对话中主动调用搜索、查询等工具——用起来更像打电话,而不是对着机器喊口令。
顺带一提,千问办公同天还发了两款硬件:磁吸在手机背面的AI助理QwenNote A2,能脱离手机独立录音转写;桌面机器人Eva内置千问办公,能语音交互帮你跑任务。模型降价和硬件铺货同时进行,语音这件事,明显是要往千家万户里塞。
---

扫码逛脑机网国内中文站,AI 情报每天更新不断档。