脑机网 脑机网LOGIC.WANG
ESC

视频模型一口气拍出30秒长镜头,创作者该兴奋还是该紧张?

阿里云展示了全新升级的 Wan3.0 视频大模型,最关键的一条参数是:单条直出 30 秒长镜头,并且支持多达五条视频作为参考。

2026-09-18 · 945 字 · 脑机网

阿里云展示了全新升级的 Wan3.0 视频大模型,最关键的一条参数是:单条直出 30 秒长镜头,并且支持多达五条视频作为参考。

30 秒这个数字,值得单独拎出来说。

为什么偏偏是 30 秒

此前主流的视频生成模型,单次输出普遍在 4 到 10 秒。这个长度够做短视频素材,却撑不起一个完整的叙事单元——一条分镜、一段人物独白、一次产品展示的起承转合,都需要更长的连续时间。

为了凑长度,创作者只能分段生成再剪接,代价是光线、构图、人物一致性在接缝处断裂。观众也许说不出哪里怪,但就是觉得"假"。

30 秒单条直出,意味着一个镜头可以一口气拍完。对广告片、电商展示、剧情短片这类场景,这不是量变,是可用性上的质变。

支持五条视频参考,则解决了另一个痛点:风格一致性。过去要让生成的画面贴住某个品牌调性,只能靠文字描述反复试;现在可以直接喂参考片,让镜头语言、色调、节奏对齐。

能力上台阶,治理同步补位

有意思的是,同一时间段的另一条消息来自治理侧:抖音新增了"冒用声音"的专属举报入口,上线可核验的维权机制。原因很直接——AI 克隆音色的门槛已经低到不需要专业知识,相关投诉量一个月内翻倍。

这两条消息放在一起,勾勒出 AIGC 当前的一体两面:生成能力每上一个台阶,被滥用的风险同时放大一级。

声音是很特殊的一类个人信息。它不像照片可以打码,也不像文字可以改写,一个人的音色几乎无法更换。当克隆成本降到几十元、几分钟,治理就必须跑在前面。

创作者真正该关心什么

兴奋的理由是明确的:制作门槛下降意味着小团队也能做出过去只有专业棚拍才能达到的效果,成本结构被重写。

紧张的理由同样真实:当"能不能做"不再是壁垒,竞争的落点会迅速转移到"做什么"——选题、叙事、对受众的理解,这些反而变得更重要。工具越普及,工具本身越不值钱。

还有一个更现实的问题:当画面和声音都可以被低成本合成,真实性的证明成本会上升。内容行业可能要额外建立一整套"这个素材是真的"的验证机制,就像今天的版权登记一样。

对平台方来说还有一层更现实的压力:当生成成本继续下探,内容供给会指数级膨胀,而用户的注意力是恒定的。届时真正稀缺的不是产能,而是分发与筛选——谁能把对的 30 秒推到对的人面前,谁才拿走这一轮红利。

30 秒长镜头打开的是创作空间,同时关闭的,是"眼见为实"这个默认前提。

查看「AI大模型」更多内容 → · 返回首页