9月10日,DeepSeek 扔出 V4.1 Flash:5520亿参数的 MoE 模型,输入时只激活 80亿参数,输出时激活 160亿。更狠的是那句技术交底——对 HBM 显存的需求降到上一代的四分之一,对固态硬盘的需求降到八分之一。
同一天,官方还挂出一条公告:9月14日起,V4 Pro 下线,请求全部路由到 V4.1 Flash,按 Flash 的价格计费。
翻译成人话:更贵的那个,被更便宜的那个替代了。
参数 5520亿,跑起来只用 80亿,这中间发生了什么
过去两年,行业的默认动作是堆参数。参数越大力气越大,力气越大显卡越贵,显卡越贵账单越吓人。DeepSeek 这次走的是另一条路——非对称结构。
它把模型拆成"编码器"和"解码器"两截,两边不一样大:读你输入的部分做小,吐答案的部分做大。读 prompt 是重活但不需要太聪明,生成 token 是细活需要脑容量,那就把算力花在刀刃上。
配套的一刀砍在 KV Cache 上。这是大模型记上下文的"草稿纸",对话越长草稿纸越厚,显存越不够用。V4.1 Flash 把这块压下来,直接结果是 Agent 类任务(让 AI 连续干几十步活)的成本掉了一大截。
对普通用户的意义其实很朴素:你跟 AI 聊到第三十轮,它还没忘你在第一轮说过什么,而服务商不用为此多烧一张卡。
会员费会不会降?先看清价格是怎么定的
DeepSeek 这次明确继续玩峰谷定价,闲时价格是高峰时段的一半。也就是说,价格不再是一个数,而是一条曲线。
这给普通人留了三个真实可操作的空间:
- 把批量活挪到夜里。 整理一整个季度的会议纪要、批量翻译一批文档、让 Agent 跑一轮数据清洗,这类不急着要结果的任务,放在闲时提交,账单直接对折。如果你们公司按 API 用量结算,这一条最省。
- 别再迷信"旗舰"两个字。 V4 Pro 被自家下线,是很强的信号:官方测试认定 Flash 在性能、费用、速度、总用时上全面超过 Pro。很多人还在为"用最好的模型"付溢价,而最好那个已经改名了。
- 关注本地部署这条线。 显存需求砍到四分之一,意味着原本需要专业卡的模型,开始能塞进消费级设备。对想在公司内网跑、不想把数据传出去的团队,这是实质性松绑。
被挤掉的不只是价格,还有一层护城河
这件事真正被撼动的,是闭源厂商的定价权。
过去高端模型的定价逻辑是"我更聪明,所以我更贵",而更聪明需要用更多卡堆出来,成本摆在那儿,贵得有道理。现在有人证明:结构设计得好,可以用小成本输出接近的大智能。
那"贵"这件事,就不再是物理定律,而是商业选择。
硅谷那几家还能维持高价的理由,正在从"技术领先"滑向"生态绑定"。这也是为什么最近 OpenAI 开始限制竞品广告投放——当产品本身的价格优势被侵蚀,分发渠道就成了新的护城河。
给你的三条动作
1. 今天就把重复性的 AI 任务排一遍队,把不急的挪到闲时。省下来的不是几块钱,是重新理解"AI 也有早晚高峰"这件事。
2. 重新问一遍供应商:你现在给我接的是哪个模型?按什么价?如果答不上来,说明你在为信息差付钱。
3. 别急着追新模型。模型换代快到按周计,真正值钱的是你把哪段工作流改造成了 AI 能接手的样子——这个换不掉。
价格战的下半场,从来不是谁更便宜,而是谁先把成本结构改了。DeepSeek 这一刀砍在显存上,砍的其实是整个行业的定价底气。