你有没有发现,最近打开手机上的AI助手,回答速度好像快了一截?这不是错觉。9月10日,DeepSeek正式发布V4.1 Flash模型——一个参数量更小的"小个子",却在多项基准测试中把自家旗舰V4 Pro按在地上摩擦。更离谱的是,价格又砍了。
一个"小个子"凭什么打赢旗舰?
DeepSeek V4.1 Flash的总参数是552B,听起来不小,但它用的是MoE(混合专家)架构,每次推理只激活8B到16B参数。打个比方,旗舰模型像全员出动的大公司,这个模型更像只派一个精锐小组出差——成本低、速度快、活儿还干得更好。
关键数据:在Agentic Benchmark(智能体能力评测)上,V4.1 Flash超越了V4 Pro、GLM-5.3、Kimi-K3等多款比它大得多的旗舰模型。它还原生支持视觉理解,1M上下文窗口,KV缓存每token压到890字节——比之前暴降88%。
价格到底便宜了多少?
闲时价格(鼓励用户错峰使用):
- 输入(缓存命中):0.02元/百万token,比之前降了60%
- 输入(缓存未命中):1.0元,降了约33%
- 输出:4.0元,降了约11%
高峰时段是闲时的2倍。如果你是个人开发者,原来每月API账单100块,合理利用闲时后可能降到三四十块。
为什么DeepSeek一个月内又降价?
8月13日V4 Pro上线时,DeepSeek其实涨过价。结果不少用户"用不起、求平替"的声音在社交平台刷屏。与此同时,智谱GLM-5.3-Flash以MIT协议开源、定价打到DeepSeek的1/3;阿里Qwen3.8-Flash更低到输入1元、输出3元。
DeepSeek不再是"性价比之王"的唯一选择,它必须回应竞争。
但更深的变化在于:企业用户开始算"成功成本"——模型能力不足带来的重复调用、返工、错误修复,同样推高Token消耗。便宜但不稳定的模型,总成本可能更贵。
国产大模型的"白菜价革命"
9月第一周,国产开源模型集中爆发,密度之大堪称"白菜价革命":
- 智谱GLM-5.3-Flash以MIT协议开源320B权重,定价$0.15/$0.50,是DeepSeek V4 Flash的1/3
- 阿里Qwen3.8-Max-0902在CodeArena前端编程榜以1691分登顶,力压Claude Opus 5和Kimi K3,2.4T参数MoE架构,5美元/百万Token
- DeepSeek V4 Pro在SWE-bench Verified拿到80.6%,但V4.1 Flash又超越了自己
这意味着什么?国产大模型已经从"能不能用"阶段进入"怎么选"阶段。 对普通用户来说,不同模型各有优势:编程用Qwen,推理用DeepSeek,开源商用用GLM——选模型就像选工具箱里的扳手,没有最好只有最合适。
开源才是真正的"降价"
V4.1 Flash采用MIT许可开源,支持商用。这意味着:有技术能力的团队可以直接在HuggingFace下载权重本地部署,彻底告别API计费。
腾讯WorkBuddy、CodeBuddy、OpenCode已全量接入V4.1 Flash。蚂蚁9月9日也开源了Ling-3.0-flash-VL,124B参数、单次推理仅激活5.5B、256K上下文。
当模型本身免费时,竞争的焦点就从"API单价"转向了"模型能力+稳定性+生态黏性"。这对消费者是好消息——选择更多、价格更低、能力更强。
普通人现在能做什么?
1. 如果你在用AI做内容创作或编程,试试错峰调用闲时价格,账单能省一半以上。
2. 不要只看单价选模型,先用小批量测试真实场景下的"一次成功率",这才是真正的成本变量——一个便宜但需要反复修改的模型,总成本可能比贵的还高。
3. 开源版本已上架HuggingFace和ModelScope,有技术能力的人可以本地部署,彻底告别API账单;没有技术能力的个人,可以关注已接入V4.1 Flash的平台(如WorkBuddy、CodeBuddy),间接享受新模型红利。