脑机网 脑机网LOGIC.WANG
ESC

张一鸣定调"拒绝蒸馏":字节承认大模型暂时落后,但选了最难的路

8月6日,字节跳动CEO梁汝波在2026年中全员会上坦承:自家大语言模型已经被海外领先模型拉开差距。同日,字节创始人张一鸣在内部会议上进一步定调——"即便See

2026-08-07 · 1350 字 · 脑机网

8月6日,字节跳动CEO梁汝波在2026年中全员会上坦承:自家大语言模型已经被海外领先模型拉开差距。同日,字节创始人张一鸣在内部会议上进一步定调——"即便Seed的模型能力暂时落后于国内主要竞争对手,字节也不会用蒸馏的方式来加快大模型训练的速度。"

一家以"快速迭代、数据驱动"著称的互联网巨头,公开承认落后,同时拒绝走捷径。这在AI大模型赛道,是一个非共识选择。

什么是"蒸馏"以及为什么诱惑巨大

蒸馏(Distillation)是大模型训练中一种常见的技术路径:用一个已经训练好的强大"教师模型"来指导一个"学生模型"的训练,学生模型通过学习教师的输出分布,可以在更短时间、更少算力下逼近教师的性能水平。

简单说,蒸馏就是"抄学霸的作业"——不用自己从头解题,而是学习学霸的解题思路和答案模式。这条路诱惑巨大:训练成本可能降低一个数量级,迭代周期从月级压缩到周级。行业内不少玩家事实上都在使用蒸馏,只是不愿公开承认。

张一鸣的"拒绝蒸馏"表态,意味着字节选择从数据预处理、模型架构、训练方法等最底层环节开始自研。这条路耗资更大、周期更长、不确定性更高——但掌控力也最强。用梁汝波的话说,字节要"做好基本功,接受短期落后,坚持优化长期"。

字节的"延迟满足感"实验

这个表态的深层含义,是字节正在经历一次组织文化的艰难转型。过去十年,字节的成功公式是"快速试错、数据驱动、敏捷迭代"——这套方法论在短视频、信息流、电商等领域几乎无往不利。但大模型研发的底层逻辑完全不同:训练周期以月计,单次实验成本以百万计,反馈不是即时的A/B测试数据,而是模糊的评测分数和人类偏好排序。

张一鸣和梁汝波强调的"延迟满足感",本质上是承认大模型研发需要一种与字节传统产品文化截然不同的节奏。这种转型能否成功,可能将决定字节在AGI终局中的位置。

同时在讨论5万亿参数模型

拒绝蒸馏并不意味着字节在技术路线上保守。恰恰相反,同日披露的消息显示,字节正在讨论训练一个参数规模超5万亿的模型——超过阿里Qwen3.8-Max(2.4万亿)和月之暗面K3(2.8万亿),是目前国内已知参数规模最大的模型计划。

"拒绝蒸馏"加"5万亿参数"的组合,描绘出一个清晰的技术路线图:字节不抄作业,但要把自己的作业做到最大。不过该计划仍处于早期阶段,并不代表最终一定会发布。大模型领域的"讨论"和"发布"之间,往往隔着一年以上的距离。

DeepSeek重启500亿融资的对照

在同一周,DeepSeek重启了第二轮融资,计划筹集约500亿元,投前估值约5000亿元。这家以极致性价比著称的公司同时在做两件看似矛盾的事:一边融资500亿,一边宣布API涨价。

但背后逻辑一致:当一家AI公司从"证明技术可能"走向"支撑全球用户规模",它必须面对越来越庞大的算力账单。字节和DeepSeek选择了不同的路径——前者坚持底层自研,后者以工程效率换成本优势——但共同点都是:在大模型赛道,没有捷径可走。

对行业观察者而言,字节"拒绝蒸馏"的表态提供了一个判断大模型公司长期价值的新的观察维度:不是看谁的参数更大、谁的API更便宜,而是看谁在训练方法论上有真正的原创性积累。蒸馏能买到短期性能,但买不到长期护城河。

脑机派对·2026年8月7日

脑机派对

2026.08.07

查看「AI大模型」更多内容 → · 返回首页