过去一周,中国大模型圈像是约好了似的,三家在同一时间窗口甩出「全模态」牌。
8月5日,字节跳动宣布推出原生音视频全双工大模型SeedRealtime,用统一架构融合音频、视频与文本,能在连续的多模态信息流上实时交互,实现「边看、边听、边说」,目前已上线豆包App全量。同一天,京东开源自研的实时流式视频编辑模型JoyAI-Video-Edit,用户能一边看视频一边改人物与场景,把创作从「先有素材再改」变成实时互动,更妙的是它能把手部操作视频转成机械臂训练素材。再往前,阿里Qwen3.8-Max以2.4万亿参数、95B激活、100万上下文窗口登场,并预告下周开源。
三件事看似各做各的,指向同一个拐点:大模型竞争的主轴,正从「谁参数更大、谁榜单更高」,转向「能不能像人一样在同一时空里看、听、说、做」。
全双工(full-duplex)是关键词。传统对话式AI是「你一句我一句」的轮替,SeedRealtime要的是打断、接话、边走边聊都不掉线。这背后是抗干扰与环境感知,意味着AI助手第一次有了「在场感」。京东那条线则把多模态从「生成内容」伸向「理解并操控物理世界」——视频编辑只是表象,具身智能数据合成才是真意图。
对普通人来说,最直观的变化是:豆包不再只是「回答问题」,而是一个能「看见你、听见你、陪你聊」的伴侣。对产业来说,全模态实时交互一旦成熟,客服、教育、直播、远程协作的工作流都会被重写。想象一下:直播带货时AI实时看懂观众表情调整话术,远程维修时AI边看设备边口述步骤,语言学习时AI像真人一样随时插话纠正发音——这些场景过去要多个系统拼,现在一个全双工模型就能扛。
这也是OPC(一人公司)能跑通的地基。一个人配一个会看会听的Agent,就能完成过去一个小组的产出。当创作与执行的门槛同时被压低,超级个体的想象空间才真正打开。
当然,全双工不等于全搞定。实时交互对延迟、对端侧算力的要求极高,豆包全量上线只是第一步,真正考验在大规模并发下的稳定与成本。但可以肯定的是,2026下半场,「会看会听」的模型,会比「只会写」的模型值钱。
这一周的中国全模态三连发,更像一个信号:当海外还在卷文本推理的性价比,国内已经把战场推到了「感官」这一层。谁先在实时多模态上跑通商业闭环,谁就拿到下一代入口的钥匙。
脑机派对 · 2026.08.06