脑机网 脑机网LOGIC.WANG
ESC

字节10万亿参数模型曝出:超越Anthropic Mythos,张一鸣为何同时禁蒸馏

8月7日,英国《金融时报》援引三名知情人士披露,字节跳动正在训练一个参数量最高可达10万亿的AI模型。如果最终落地,这将是全球已公开的最大参数规模模型,明显超过

2026-08-09 · 1206 字 · 脑机网

8月7日,英国《金融时报》援引三名知情人士披露,字节跳动正在训练一个参数量最高可达10万亿的AI模型。如果最终落地,这将是全球已公开的最大参数规模模型,明显超过月之暗面Kimi K3的2.8万亿和阿里Qwen3.8-Max的2.4万亿,甚至可能超越业内估计约8万亿参数的Anthropic Mythos 5。

这并非一次孤立的参数竞赛。几乎同步,另一条消息浮出水面:字节创始人张一鸣在Seed团队内部明确要求——停止用蒸馏技术从对手模型中"借力",宁可短期排行榜落后,也要走原始训练这条路。CEO梁汝波在8月6日年度全员会上坦承豆包大模型在AI Coding方面不算突出,还拿Anthropic的Claude Code做参照。两条信息放在一起,信号非常清晰:字节在AI上选择了一条"最重但最自主"的路径。

10万亿参数到底意味着什么

参数量决定模型的"记忆容量",但并非能力的全部。关键变量在于激活参数占比——当前主流超大模型几乎都采用混合专家(MoE)架构,每次推理只激活一小部分参数。DeepSeek V4-Pro总参数1.6万亿,每token仅激活490亿;Kimi K3总参数2.8万亿,激活1040亿,活跃比不到4%。

字节10万亿模型的具体架构尚未披露,FT也明确指出"最终参数量在后期阶段才能确定"。但一个合理推断是:如果以K3级别的激活比例运行,10万亿总参数意味着约4000亿活跃参数,这将是前所未有的推理规模。对算力的需求也将量级跳升——字节2026年资本开支已从1600亿元人民币原计划上调25%,内部讨论的上限高达700亿美元。

拒绝蒸馏:一场"反捷径"豪赌

蒸馏技术——用强模型的输出训练自己的模型——是2025年以来中国AI快速追赶的重要加速器。张一鸣主动放弃这条捷径,原因有三层。

第一层是技术自主。长期依赖蒸馏会让模型能力的天花板锁死在对手水平之下,永远做"二等公民"。第二层是合规护城河。Anthropic在2026年2月公开点名部分中国实验室使用蒸馏,字节恰好在被点名的名单之外——主动禁蒸馏,等于提前构建法律与声誉防火墙。第三层是商业谈判筹码。字节仍持有TikTok美国合资公司19.9%股权,在美国监管趋严的环境下,"原始训练"的标签比任何公关话术都更有说服力。

对创业者的启示

字节的策略选择对AI工作室和OPC创业者有直接启发:当行业出现一条"低成本快速追赶"的捷径时,敢于走难路的人反而能建立更深护城河。蒸馏在短期有效,但它让你永远活在别人的影子里。同理,做AI内容如果只靠搬运和重组,AI工具的普及会让你的"效率优势"迅速归零——真正不可替代的,是你用原始数据、独特视角和长期积累构建的认知壁垒。

项亮和沈科主导的Seed Foundation团队约2000人,预训练预计3到6个月。10万亿参数能否真正落地仍是未知数,但字节"拒绝走捷径"的态度本身,已经改写了竞争叙事。

脑机派对

2026.08.09

查看「AI大模型」更多内容 → · 返回首页