---
title: "中国全模态「一周三连发」：字节SeedRealtime、京东JoyAI、Qwen3.8同周亮剑"
date: 2026-08-06
category: AI大模型
site: 脑机网
canonical: https://aiai.cafe/a/njw-05079a
language: zh-CN
---

# 中国全模态「一周三连发」：字节SeedRealtime、京东JoyAI、Qwen3.8同周亮剑

> 过去一周，中国大模型圈像是约好了似的，三家在同一时间窗口甩出「全模态」牌。

过去一周，中国大模型圈像是约好了似的，三家在同一时间窗口甩出「全模态」牌。

8月5日，字节跳动宣布推出原生音视频全双工大模型SeedRealtime，用统一架构融合音频、视频与文本，能在连续的多模态信息流上实时交互，实现「边看、边听、边说」，目前已上线豆包App全量。同一天，京东开源自研的实时流式视频编辑模型JoyAI-Video-Edit，用户能一边看视频一边改人物与场景，把创作从「先有素材再改」变成实时互动，更妙的是它能把手部操作视频转成机械臂训练素材。再往前，阿里Qwen3.8-Max以2.4万亿参数、95B激活、100万上下文窗口登场，并预告下周开源。

三件事看似各做各的，指向同一个拐点：大模型竞争的主轴，正从「谁参数更大、谁榜单更高」，转向「能不能像人一样在同一时空里看、听、说、做」。

全双工（full-duplex）是关键词。传统对话式AI是「你一句我一句」的轮替，SeedRealtime要的是打断、接话、边走边聊都不掉线。这背后是抗干扰与环境感知，意味着AI助手第一次有了「在场感」。京东那条线则把多模态从「生成内容」伸向「理解并操控物理世界」——视频编辑只是表象，具身智能数据合成才是真意图。

对普通人来说，最直观的变化是：豆包不再只是「回答问题」，而是一个能「看见你、听见你、陪你聊」的伴侣。对产业来说，全模态实时交互一旦成熟，客服、教育、直播、远程协作的工作流都会被重写。想象一下：直播带货时AI实时看懂观众表情调整话术，远程维修时AI边看设备边口述步骤，语言学习时AI像真人一样随时插话纠正发音——这些场景过去要多个系统拼，现在一个全双工模型就能扛。

这也是OPC（一人公司）能跑通的地基。一个人配一个会看会听的Agent，就能完成过去一个小组的产出。当创作与执行的门槛同时被压低，超级个体的想象空间才真正打开。

当然，全双工不等于全搞定。实时交互对延迟、对端侧算力的要求极高，豆包全量上线只是第一步，真正考验在大规模并发下的稳定与成本。但可以肯定的是，2026下半场，「会看会听」的模型，会比「只会写」的模型值钱。

这一周的中国全模态三连发，更像一个信号：当海外还在卷文本推理的性价比，国内已经把战场推到了「感官」这一层。谁先在实时多模态上跑通商业闭环，谁就拿到下一代入口的钥匙。

脑机派对 · 2026.08.06

---

来源：脑机网（https://aiai.cafe/）｜原文：https://aiai.cafe/a/njw-05079a
本内容仅供参考，不构成投资建议。
