---
title: "DeepSeek把V4.1 Flash开源了，5520亿参数模型为何主打\"省缓存\"？"
date: 2026-09-29
category: AI大模型
site: 脑机网
canonical: https://aiai.cafe/a/njw-defe5f
language: zh-CN
---

# DeepSeek把V4.1 Flash开源了，5520亿参数模型为何主打"省缓存"？

> 大模型圈有个怪现象：模型越聪明，跑起来越烧钱，尤其当你要让它当智能体、长时间记上下文的时候。9月10日，DeepSeek悄无声息地丢出一个开源新模型V4.1 Flash，最吸引工程师的不是它有多能聊，而是它把最贵的那块成本砍掉了大半。

大模型圈有个怪现象：模型越聪明，跑起来越烧钱，尤其当你要让它当智能体、长时间记上下文的时候。9月10日，DeepSeek悄无声息地丢出一个开源新模型V4.1 Flash，最吸引工程师的不是它有多能聊，而是它把最贵的那块成本砍掉了大半。

## 一、5520亿参数，但只"点亮"一小块
V4.1 Flash采用全新的因果编码器—解码器（Causal-Encoder-Decoder）非对称结构，总参数约5520亿，但每处理一个token输入只激活80亿参数、输出激活160亿参数。

打个比方：它不是每次都动用全部脑细胞，而是按任务只唤醒需要的"专家"，所以模型虽大，单次推理的算力开销却控制得很低，也因此它原生支持多模态视觉理解，能读图也能读文。

V4.1 Flash是DeepSeek这套新架构系列里的小尺寸型号，更大尺寸的V4.1 Pro也在后续上线计划中。这次先开源小号，明显是冲着"低成本落地"去的，而不是单纯秀肌肉。

## 二、真正的杀招是KV缓存压缩
长上下文智能体任务里，最贵的是KV缓存——模型要把历史对话存在显存里，越聊越满、越贵。

V4.1 Flash把全局KV缓存压到每token约890字节，HBM显存需求降到上一代的四分之一，持久化缓存SSD占用降到八分之一。这意味着同样一台机器，能服务的长会话数量翻了好几倍。模型以MIT许可开放权重，同步在HuggingFace、ModelScope等平台放出。

支撑这套压缩的，是V4.1 Flash新增的Engram条件记忆模块：它用查表方式调用一份很大的"记忆表"，并且可以把这张表放在CPU主机内存里，而不是昂贵的显存。换句话说，模型把"长期记忆"从GPU上卸了下来。这也是它能在保持多模态能力的同时，把智能体类任务的推理账单压下来的技术根因——省下的不是一点算力，而是长会话里反复累积的存储成本。

## 三、价格直接打到"闲时"档
API定价采用峰谷制：空闲时段每百万token输入低至0.02元、输出4元；高峰时段输入最高2元、输出8元。

官方还宣布，9月14日之后会把原有的V4 Pro请求临时路由到V4.1 Flash，说明它在基准上已经不输旗舰，却便宜得多——对要跑大量长对话的开发者来说，这才是实打实的吸引力。

## 四、普通人现在能做什么
第一，开发者：直接去HuggingFace或ModelScope拉V4.1 Flash权重本地部署，配一张消费级显卡就能跑多模态推理，适合做私有化知识库、文档问答这类对成本敏感的小项目，不用担心调用账单失控。

第二，产品经理：如果你的应用里"长对话+多轮工具调用"占比高，优先拿V4.1 Flash做成本压测。缓存压缩对智能体类场景的账单改善最明显，往往比换更便宜的显卡更直接。

第三，普通用户：不必追新名词，记住一条——当你用的AI工具开始"越聊越卡、越用越贵"，背后往往就是KV缓存成本。选型时多问一句"上下文怎么计费"，比看参数表更有用。

---

来源：脑机网（https://aiai.cafe/）｜原文：https://aiai.cafe/a/njw-defe5f
本内容仅供参考，不构成投资建议。
