脑机网 脑机网LOGIC.WANG
ESC

视频模型不比谁画得好了,要开始比谁来得快?

生数科技正式发布 Vidu S2,两个模型在发布当天就全量开放了在线体验和 API:S2-Avatar 面向持续交互的数字角色,实时输出从此前的 540p 提升到 720p;S2-Editing 面向输入的视频流做实时编辑。

2026-09-19 · 1483 字 · 脑机网

生数科技正式发布 Vidu S2,两个模型在发布当天就全量开放了在线体验和 API:S2-Avatar 面向持续交互的数字角色,实时输出从此前的 540p 提升到 720p;S2-Editing 面向输入的视频流做实时编辑。

真正值得注意的不是分辨率,而是那两个字:实时。

两个模型,两条路

S2-Avatar 是实时数字人。给它一张图,就能生成一个可以对话的化身——跟它说话、换衣服、拿东西、换场景。

其中有个设计很有意思,叫"动态参考":允许在对话过程中随时注入参考图,更新角色、道具、服装。也就是说,不用重新开始生成,模型能在连续视频流里接受"中途插话"。

支撑它的是一层 VLMAgent,职责是维护状态一致性——生成后续片段时显式保留先前状态(比如"还拿着那个杯子"),只改动你要求改变的部分。视频模型负责生成,Agent 负责记住。

这解决的是长视频生成里最烦人的问题:生成到第三十秒,人物手里的杯子没了,衣服换了颜色。

S2-Editing 则是实时视频编辑:输入一段连续视频流,用文本驱动做风格迁移、虚拟试穿、角色替换或背景替换,动作由源视频提供。

它处理鬼影的方式也值得一提:Frame-Aligned Attention——目标帧只读取同一时间戳的源帧,保留姿态与时间顺序;参考图持续提供风格、服装、背景信息。效果就是"人换了但动作不飘"。

另外还有实时空间视频:为头显生成左右眼略有差异的画面,单目先生成再转立体,立体输入则横向拼接后联合编辑再拆分。

为什么"实时"突然重要了

过去两年,视频生成模型的竞争几乎全在画质、时长、一致性这几个维度。这个阶段的潜台词是:先把东西做出来,慢一点没关系,反正是离线渲染。

但一旦进入实时区间,整个使用场景就变了。

离线的视频生成,产品形态是"工具"——你写好提示词,等几十秒,拿到一段成片。实时的视频生成,产品形态是"交互"——你在跟一个会动的东西对话,它即时回应你。

前者替代的是剪辑师的一部分工作,后者替代的是摄像头前面的人。工具市场是专业人群,交互市场是所有有摄像头的人。

据生数科技公布的技术报告,S2-Avatar 在实时数字角色生成基准 StreamAV-Bench 的九项指标中,均取得报告所列对比模型的最优结果;S2-Editing 在多项视频编辑基准中也取得了超过离线与流式对比模型的总体得分。项目全链路研发由张金涛领衔,他是朱军教授的博士生、生数科技流式视频生成与推理负责人。

便宜、快、能用,是三件事

当然,实时化不是没有代价。

720p 距离影视级还有距离;实时生成对算力的消耗是持续的,不像离线渲染可以排队;流式模型只能依赖已生成的历史画面逐段推进,前一段的偏差会成为下一段的条件。

更现实的判断是:实时视频模型短期内的主战场不是影视,而是直播、客服、电商带货、远程会议这些"本来就在实时发生"的场景。

这些场景对画质容忍度高,对延迟容忍度极低。数字人客服卡顿两秒,体验就崩了;画质低一点,用户反而没那么在意。

实时视频模型把竞争维度从"质量"拉回了"体验"。而体验这个维度上,先跑通链路的人优势很大——它需要的是工程优化和数据反馈的积累,不只是参数堆砌。

顺带说一句

S2 的技术报告里有个细节叫 Self-Replay Forcing:把模型自己生成的长视频片段重新加噪,用于因果重放训练,减少连续生成中的误差累积。用模型自己的输出训练自己,这个思路在视频领域算是新尝试——区别在于视频的误差是可见的,糊了就是糊了,没法蒙混过关。

视频生成这条赛道走到今天,画质已经不是最稀缺的能力了。接下来谁能把延迟压下去、把状态记住、把成本摊薄,谁才可能真正把它变成一门生意。

查看「AI大模型」更多内容 → · 返回首页