9月15日,云知声正式发布新一代高密度智能模型 U2-Flash。一句话说明白它做了什么:总参数约 2660 亿,但每次推理只激活约 100 亿参数。在衡量编程能力的 DeepSWE v1.1 榜单上,它拿到 64.6 分,超过了 GLM-5.3-Flash 和 DeepSeek-V4-Pro-0813 等一众对手;TerminalBench 3.0 也涨到 24.3 分,把一些万亿参数的大模型甩在身后。
这不是又一场参数军备竞赛,而是另一条路:用更少的"算力胃口"干更重的活。
为什么"激活十个亿"值得大写一笔
大模型圈有个公开的秘密:模型越大,跑一次越贵。过去一年大家比的是谁的模型整体参数多,结果就是显卡不够用、电费扛不住、中小企业用不起。
云知声用的是稀疏混合专家架构(MoE)。打个比方,传统稠密模型像请一屋子专家全员到场才能回答一个问题;MoE 像有个调度台,只把跟这个问题相关的几位专家叫醒。总盘子还是 2660 亿,但每次只点亮约 100 亿——账单按"点亮的部分"算,不是按"全屋子的灯"算。
更关键的是,U2-Flash 已完成对主流国产算力平台的系统性适配。这意味着它不挑"洋显卡",在国内自主 AI 芯片上也能跑。在外部供应不确定的当下,这条适配线本身就是一道护城河。
它到底能帮你省什么
云知声给出的数字是:Agent 任务迭代步数减少 20% 至 30%,Token 消耗也减少 20% 至 30%。
对普通人来说,这串数字翻译成人话就是——你让 AI 帮你写代码、跑流程、调接口,同样的活儿,它少绕弯路、少费字数。当模型成本真正掉下来,AI 应用才敢从" demo 演示"走向"天天用"。
这也解释了 why 今年以来港股和 A 股的 AI 应用方向明显比硬件方向抗跌:硬件看的是资本开支的脸色,应用看的是用户肯不肯每天打开。推理效率每提升一截,应用端商业化的临界点就靠近一步。
一个被忽略的信号
值得玩味的是发布时机。就在同一周,大洋彼岸几家美国 AI 巨头罕见集体呼吁"踩刹车",担心前沿模型跑得太快。而国内这边,云知声、智谱等公司仍在密集加注——智谱刚在港交所公告募资约 393 亿港元,要把钱砸向下一代"完全自训练"体系。
两种节奏并不矛盾。美国巨头怕的是"失控",中国公司急的是"落地"。当对手在讨论安全边界时,我们把参数效率往下压、把成本往下打,反而可能在一件事上抢先:让 AI 变成中小企业也用得起的日常工具。
你该关注的三件事
1. 别只盯"参数多大",改盯"激活多大":以后看模型,先问每次推理点亮多少参数,这比总参数更影响你的钱包。
2. 国产算力适配是硬指标:能被国产芯片跑起来的模型,在供应链不确定性里更稳。
3. 应用落地看"单位成本":Token 消耗降 30%,意味着同样预算能多做 40% 的活,这是普通人能感知的 AI 进步。
大模型的下半场,比的不再是"我有多吓人",而是"你用不用得起"。