脑机网 脑机网LOGIC.WANG
ESC

微信把每天调用十亿次的AI开源了,你发的内容会被重新"读懂"吗?

你有没有过这种感觉:刚在聊天里提了一句想买的东西,转头刷视频号就刷到了同款。

2026-09-09 · 1288 字 · 脑机网

你有没有过这种感觉:刚在聊天里提了一句想买的东西,转头刷视频号就刷到了同款。

你以为是巧合,其实背后有个一直在干活的小东西。

9月8日,腾讯微信视觉团队把这套东西的一部分,公开送了出来。

一、一个 2B 的小模型,打赢了 8B 的老大哥

这次开源的模型叫 WeMM-Embedding,一口气放出三个尺寸:2B、4B、9B。

它干的事不复杂——把文字、图片、视频,甚至这几样交错混在一起的内容,统统翻译成同一种"数学语言"。翻译完,机器就能判断:这条视频和那段话,是不是在说同一件事。

成绩是这样的:

  • 9B 版本在 MMEB-v2 榜单拿到 80.6 分,位列第一
  • 2B 版本拿到 77.9 分,超过了此前 8B 开源模型的水准

更值得留意的是后半句:这套模型已在视频号、公众号、朋友圈落地,日调用量达十亿量级

它不是实验室作品,是已经在给你我干活、每天干十亿次的基础设施。

二、"嵌入"这两个字,到底在改变什么

嵌入模型用户永远看不见,但它决定了你能看见什么。

以前平台理解一条视频,靠标题、标签、发布者填的分类。你写"周末爬山",系统就认为你在讲爬山,至于画面里有几条狗、路线难不难,它一概不知。

有了多模态嵌入,系统能"看"画面本身:你搜"适合带狗的徒步路线",它能从一堆没写这几个字的视频里,把画面里有狗、有山路的挑出来;你公众号配的九张图,它能理解图与图之间的顺序,而不只是当附件。

过去是"你告诉机器这是什么",现在是"机器自己看出来这是什么"。

对平台是搜索和推荐的精度跃迁;对普通人来说,内容终于不用再靠堆关键词博曝光。

三、微信为什么要把这个送出来

送掉一个跑在十亿级业务上的模型,看起来是亏本买卖。但把时间轴拉长,这一步很清楚。

现在的开源早就不只是技术理想主义。最近国产厂商动作密集到反常:面壁智能开源 MiniCPM5-2B 并附上完整训练配方,智谱把 753B 的 GLM-5.3 做成公开下载,DeepSeek 把多模态 MoE 模型以 MIT 许可放出权重。

这背后是一场标准之争——谁的模型被更多开发者用、被更多企业部署,谁的"理解方式"就成了事实标准。

开源在这里不是慈善,是抢地皮。微信的打法更聪明:先在十亿国民每天在用的场景里跑通,再开源,等于带着"已大规模验证过"的履历出场。

四、这对你意味着什么

短期你会感受到三件事:

搜索会更准。 尤其是那种"形容不出来但看到就认得"的需求,比如"那个背景有红色招牌的面馆"。

推荐会更窄也更贴。 好在对胃口,坏在信息茧房更结实。意识到这一点,本身就是防护。

普通创作者的机会反而变大。 过去小号拼不过大号,很大程度是拼不过关键词运营。平台真"看懂"内容后,质量权重会往上走。

一句可以直接记下来的话:当机器开始看懂画面,靠堆关键词博流量的时代就结束了。

五、现在能做的三件事

第一,从今天起认真对待封面图和首图。 它不再只是装饰,是被机器阅读的核心信息源,比标题还快被"看到"。

第二,给图片和视频补上真正描述画面的文字说明。 不是堆标签,是用一句人话说清"这张图里有什么、在干什么"。

第三,有意识地打破自己的信息流。 平台越懂你,越容易把你关进窄房间。

*(本文数据与事实来自微信视觉团队开源公告及公开媒体报道。)*

查看「AI大模型」更多内容 → · 返回首页