脑机网 脑机网LOGIC.WANG
ESC

DeepSeek后训练革命:模型没变,Agent能力暴涨6倍

8月1日,DeepSeek悄然上线了V4-Flash正式版API,在开发者社区瞬间炸了锅。一个2840亿参数的MoE模型,激活参数仅130亿,价格低至0.2元/

2026-08-01 · 1383 字 · 脑机网

8月1日,DeepSeek悄然上线了V4-Flash正式版API,在开发者社区瞬间炸了锅。一个2840亿参数的MoE模型,激活参数仅130亿,价格低至0.2元/百万tokens(缓存命中),却在多项Agent基准测试中,硬生生把三个月前的V4-Pro预览版摁在地上摩擦。

最让人细思极恐的是:模型结构、尺寸一点没变,只是重新做了一遍后训练。

这背后的含义远比性能提升深远。从DeepSWE得分从7.3飙升至54.4(暴涨超6倍),到Terminal Bench 2.1得分82.7逼近Opus-4.8的85.0——同一个骨架,同一套参数,只是后训练策略更精细了,就在Agent自主编程和命令行操作能力上产生了质变。

这件事打破了一个行业惯性认知:堆参数不是唯一出路。后训练阶段的优化空间,被严重低估了。

对开发者和企业而言,这轮更新的商业信号很明确。Agent才是大模型真正的战场——能聊天的AI已经够多了,能自主干活、能调用工具、能完成长周期多步骤任务的AI,才是生产力。DeepSeek用V4-Flash证明,不用烧千亿参数规模,通过精良的后训练,也能让模型在Agent能力上达到第一梯队。

价格更是杀手锏。以每百万tokens 0.2元的价格对标Claude Sonnet 5的$2,意味着一个独立开发者跑一套完整的Agent工作流,一天的成本可能只够买一瓶矿泉水。这直接拉低了AI Agent创业的门槛——过去动辄每月烧几万算力费才能跑通的智能体应用,现在三五百块就能起步验证。

更深一层的逻辑是:中国开源大模型正在重塑全球AI的定价体系。截至7月底,国产开源模型累计下载量已突破100亿次,居全球首位。全球每10次大模型下载中,就有6次来自中��模型。DeepSeek、Kimi K3、通义千问这些开源模型,不仅提供了技术能力,更通过极致性价比重新定义了"AI服务该值多少钱"。

当硅谷还在争论开源和闭源谁更安全时,中国模型已经用开源+低价+强Agent能力的三板斧,把AI从"少数人的特权"拉到了"人人可用的基础设施"。

对普通人来说,这意味着什么?意味着你不需要懂代码、不需要组建技术团队,借助这类低价高能的Agent模型,一个人+一套AI工具,就可能在细分领域搭建出能真正执行任务的智能体——无论是自动处理客服工单、批量生成行业报告,还是自动化运营社交媒体账号。

不过,也值得冷静看待。V4-Flash虽然Agent能力暴涨,但在通用对话和创意写作方面,与Pro版仍有差距。它更像一个"特种兵"而非"全能选手"——精准定位在需要强工具调用和自主执行能力的企业与开发者场景。对于普通用户来说,日常聊天问答用App端的免费模型就够了,Flash的价值在于让专业用户以极低成本把Agent能力嵌入自己的产品和业务。

有意思的是,在海外模型评测机构Artificial Analysis的智能指数测试中,V4-Flash拿下了50分,而同类可比模型的中位��仅为17分。这个差距说明,后训练优化的天花板远没到顶——不是"再堆一倍的卡",而是"把已有的卡用得更聪明"。在算力资源日趋紧张的当下,这种效率优先的思路,或许比追求更大的模型更有现实意义。

后训练革命提醒我们:大模型的竞争正从"谁参数更大"转向"谁更能干活"。而干活这件事,恰恰是中国模型的强项。

脑机派对

2026.08.01 · AI前沿观察

查看「AI大模型」更多内容 → · 返回首页