---
title: "世界模型被塞进一张游戏显卡，普通人第一次能自己\"造世界\"了？"
date: 2026-09-11
category: AI大模型
site: 脑机网
canonical: https://aiai.cafe/a/njw-b6a44b
language: zh-CN
---

# 世界模型被塞进一张游戏显卡，普通人第一次能自己"造世界"了？

> 几天之内，三家中国公司先后把"世界模型"开源了。

几天之内，三家中国公司先后把"世界模型"开源了。

京东探索研究院在 JDD 大会上放出 JoyAI-EchoWM，能在同一套框架里生成视频、环境音、音乐和语音，还能实时响应你的操作。蚂蚁灵波科技继7月开源 LingBot-World 2.0 之后，再开放三款模型，其中最小的只有 13亿参数——**官方说法是，消费级单卡就能实时跑。**

高德更夸张：ABot-Earth 0.7 从一张卫星图或一段文字出发，单块消费级显卡大约10分钟生成公里级的3D城市场景，效率号称提升千倍。

## 什么叫"世界模型"，一句话讲清
大模型学的是"下一个字该说什么"，世界模型学的是"下一秒画面该变成什么样"。

你往前走一步，画面要跟着变；你把一个杯子推下桌子，它得掉下去、碎掉。模型得懂物理、懂空间、懂因果。

这东西被认为是通往通用机器人的关键——**机器人得先"脑补"出动作之后会发生什么，才敢动手。**

## 为什么"1.3B"这个数字比什么都重要
过去一年，世界模型的参数竞赛和当年大模型一模一样：14B、30B、往上堆。堆的结果是，只有大厂和顶级实验室跑得起，个人开发者只能看论文。

13亿参数这个尺寸，是另一条思路：不追求最好，追求**你能跑得起**。

蚂蚁同时放出的另外两款——双向 Teacher 模型和因果预训练底座——一个用来给小模型做蒸馏，一个支持相机位姿加文本双输入。这套组合拳的意思很明显：让高校实验室和个人开发者能复现、能改、能搭原型。

开源这件事的杀伤力向来如此。当年 Stable Diffusion 把图像生成从机房搬到个人电脑，才有了后面三年的应用大爆发。世界模型正在走同一条路。

## 别被"实时"两个字骗了
京东那份开源说明里，坦白得有点可爱：在158个导航评测案例中拿到81.7的最高平均分，一致性89.8、交互性87.2，但**目前没有显式持久三维记忆，长时生成仍可能漂移**。

翻译一下：短时很稳，跑久了，你刚刚走过的那条街，模型可能记得不是原来那个样子。

这正是现在世界模型的真实水平——**像一段很清晰的梦，细节逼真，但你回头找不一定找得到。**

## 对普通人意味着三件具体的事
1. **做内容的人，成本结构要变了。** 高德那套10分钟生成一个公里级3D场景，意味着短片、房产展示、文旅导览的背景搭建，从"建模师干一周"变成"渲一张图"。

2. **做游戏和仿真的团队，可以开始试水。** 世界模型最适合的不是惊艳画面，而是无限生成可探索的环境，这对开放世界和机器人训练都是刚需。

3. **想入行的个人开发者，窗口就在现在。** 消费级单卡能跑，意味着你不需要算力预算，只需要想法。这个阶段技术门槛最低、社区空缺最多，先做出来的人建立的是认知优势。

## 一个提醒
世界模型现在的热度，很像2022年底的生成式图像：能力已经可见，产品形态还没定型。这个阶段最贵的不是算力，是你在哪个场景里把它跑通。

先挑一个你熟悉的场景，做深，比追最新的模型版本有用得多。

---

来源：脑机网（https://aiai.cafe/）｜原文：https://aiai.cafe/a/njw-b6a44b
本内容仅供参考，不构成投资建议。
