脑机网 脑机网LOGIC.WANG
ESC

字节被曝训练10万亿参数大模型,规模超Anthropic旗舰

8月7日,英国《金融时报》援引三位知情人士报道,字节跳动正在训练一款参数规模最高可达10万亿的AI模型,目前处于为期3至6个月的预训练早期阶段。若最终落地,其体

2026-08-11 · 1074 字 · 脑机网

8月7日,英国《金融时报》援引三位知情人士报道,字节跳动正在训练一款参数规模最高可达10万亿的AI模型,目前处于为期3至6个月的预训练早期阶段。若最终落地,其体量将超过Anthropic约8万亿参数的Mythos 5,成为目前公开披露的最大模型之一。消息经路透等媒体转载,到8月9日已在海外科技圈引发"能力越大、竞争越大"的热议。

把标尺摆上台面

作为参照,月之暗面Kimi K3约2.8万亿、阿里Qwen3.8-Max约2.4万亿,字节的新模型体量是其三倍以上。过去一年国产模型在榜单上快速追平GPT与Claude,但"规模赶超美国旗舰"这件事,此前只停留在行业猜测。字节用一纸爆料,把中国大模型的参数竞赛直接推到了全球第一梯队。

更有意思的是路线选择。与多数国产厂商走开放权重不同,字节是闭源打法:靠豆包拿下3.24亿月活,用Seedance守住视频生成头部,更被曝要求团队不使用"蒸馏"他人模型的方法,强调原创训练。这条路的代价是更慢,但张一鸣在Seed全员会上的一句话点明了意图——长期盯住"世界级模型能力",不必纠结短期落后。

参数从不是能力的全部

必须泼一盆冷水:参数规模只决定信息容量的上限,真实表现取决于数据质量、训练方法与推理效率。一个10万亿模型还没发布,就已经改写了推理的"算账逻辑"——更大的模型意味着更贵的算力与更长的训练周期,中小团队会被进一步甩开身位。

对做AI应用的创业者,这反而是利好。底座越卷,上层越便宜。当巨头在参数上贴身肉搏,应用层反而能用更低的成本调用更强的能力,把精力放在真实业务流和私域数据沉淀上。我们在AIGC沙龙里反复强调:下一波红利不在"谁模型大",而在"谁把模型塞进了客户的日常工作流"。

真正的分水岭,从来不在参数表上,而在谁能把模型变成客户离不开的生产力。对想搭建AI工作室的团队来说,盯紧字节这条闭源巨兽的溢出效应——它每压低一次调用成本,你的商业化窗口就打开一寸。

为什么是现在

参数竞赛的再次升温,并非偶然。2026年上半年,中国模型在OpenRouter全球周调用量中连续15周超过美国,DeepSeek-V4-Flash正式版登顶、环比增570%,说明国产模型的"性价比入口"已经打开。字节选择在此时亮出10万亿砝码,更像一种姿态——在能力被全球认真对待的窗口期,用规模巩固"默认底座"的心智。

对国内AI工作室而言,底座层的每一次军备竞赛,都是应用层的一次成本下移。你不必下场造模型,但要学会在巨头的阴影里找光:当调用越来越便宜,最值钱的位置,是离客户业务逻辑最近的那一环。

脑机派对

2026.08.11

查看「AI大模型」更多内容 → · 返回首页