几天之内,三家中国公司先后把"世界模型"开源了。
京东探索研究院在 JDD 大会上放出 JoyAI-EchoWM,能在同一套框架里生成视频、环境音、音乐和语音,还能实时响应你的操作。蚂蚁灵波科技继7月开源 LingBot-World 2.0 之后,再开放三款模型,其中最小的只有 13亿参数——官方说法是,消费级单卡就能实时跑。
高德更夸张:ABot-Earth 0.7 从一张卫星图或一段文字出发,单块消费级显卡大约10分钟生成公里级的3D城市场景,效率号称提升千倍。
什么叫"世界模型",一句话讲清
大模型学的是"下一个字该说什么",世界模型学的是"下一秒画面该变成什么样"。
你往前走一步,画面要跟着变;你把一个杯子推下桌子,它得掉下去、碎掉。模型得懂物理、懂空间、懂因果。
这东西被认为是通往通用机器人的关键——机器人得先"脑补"出动作之后会发生什么,才敢动手。
为什么"1.3B"这个数字比什么都重要
过去一年,世界模型的参数竞赛和当年大模型一模一样:14B、30B、往上堆。堆的结果是,只有大厂和顶级实验室跑得起,个人开发者只能看论文。
13亿参数这个尺寸,是另一条思路:不追求最好,追求你能跑得起。
蚂蚁同时放出的另外两款——双向 Teacher 模型和因果预训练底座——一个用来给小模型做蒸馏,一个支持相机位姿加文本双输入。这套组合拳的意思很明显:让高校实验室和个人开发者能复现、能改、能搭原型。
开源这件事的杀伤力向来如此。当年 Stable Diffusion 把图像生成从机房搬到个人电脑,才有了后面三年的应用大爆发。世界模型正在走同一条路。
别被"实时"两个字骗了
京东那份开源说明里,坦白得有点可爱:在158个导航评测案例中拿到81.7的最高平均分,一致性89.8、交互性87.2,但目前没有显式持久三维记忆,长时生成仍可能漂移。
翻译一下:短时很稳,跑久了,你刚刚走过的那条街,模型可能记得不是原来那个样子。
这正是现在世界模型的真实水平——像一段很清晰的梦,细节逼真,但你回头找不一定找得到。
对普通人意味着三件具体的事
1. 做内容的人,成本结构要变了。 高德那套10分钟生成一个公里级3D场景,意味着短片、房产展示、文旅导览的背景搭建,从"建模师干一周"变成"渲一张图"。
2. 做游戏和仿真的团队,可以开始试水。 世界模型最适合的不是惊艳画面,而是无限生成可探索的环境,这对开放世界和机器人训练都是刚需。
3. 想入行的个人开发者,窗口就在现在。 消费级单卡能跑,意味着你不需要算力预算,只需要想法。这个阶段技术门槛最低、社区空缺最多,先做出来的人建立的是认知优势。
一个提醒
世界模型现在的热度,很像2022年底的生成式图像:能力已经可见,产品形态还没定型。这个阶段最贵的不是算力,是你在哪个场景里把它跑通。
先挑一个你熟悉的场景,做深,比追最新的模型版本有用得多。