9 月 18 日午间,智谱在官方微信宣布上线 GLM-5.3-FlashX,API 同步全面开放。
两个数字值得记:推理速度最高可达 200 Tokens/s,较现有的 GLM-5.3-Flash 提升 5 倍;定价提升至原版本的 2.5 倍。
速度提 5 倍,价格涨 1.5 倍——这种"加价提速"的打法,在当前国内大模型普遍降价的背景下,是个反常操作。
为什么要做"更贵更快"
要理解这个决定,得先看它面对的是什么局面。
GLM-5.3-Flash 此前以"Ox Alpha"之名面向全球开发者上线,凭借性能和性价比获得了不错的口碑,调用量持续攀升。据智谱介绍,由 10 万张国产芯片组成的推理集群上线即被打满。
"打满"是个关键词。这意味着瓶颈不是需求,而是供给——想用的人用不上,因为算力不够。
在这种情况下,继续降价是没意义的。价格降下来只会让排队更长、体验更差。合理的做法是:把有限的算力分配给愿意付更高价格、对速度更敏感的场景,同时用更高的单价支撑算力扩容。
所以 FlashX 不是一次常规的版本升级,而是一次算力资源配置的调整。
算力是硬约束
智谱今年的融资节奏很能说明问题:7 月和 9 月分别完成 40 亿美元、50 亿美元再融资,用途明确写着持续扩容算力。
2026 年上半年,智谱的算力乘数指标同比增长了 14 倍。瑞银预计,该指标在未来 6 至 12 个月内可超过 1——这个"1"的含义是,算力供给将不再构成收入增长的硬约束。换句话说,现在是硬约束。
这也是为什么"10 万张国产芯片集群打满"这个细节重要。它既说明需求真实,也说明国产算力在大模型推理场景里已经能扛住生产级负载。
从生态投入到变现
另一条线更值得琢磨。
智谱近期已与海内外头部云服务商签署收入分成协议,相关收入将从 10 月起确认。这意味着 GLM 系列开源模型不再只是纯粹的生态投入——通过第三方云基础设施和企业销售渠道扩大模型分发,能快速提升变现能力。
这条路 Anthropic 走过。它目前已覆盖 AWS Bedrock、Google Cloud Vertex AI 和 Microsoft Azure Foundry 三大云平台。到 2026 年春季,其年化收入已超过 300 亿美元,而 2025 年底仅约为 90 亿美元。
半年翻三倍多,云渠道的分发能力是主要推手之一。
智谱的动作也很直接:把年末 ARR(年度经常性收入)指引由 24 亿美元上调至 30 亿美元,上调幅度 25%。截至当前,公司全业务口径 ARR 已达到 18 亿美元。
一个值得注意的转折
开源大模型的商业模式,一直是行业里的老大难。
模型开源意味着任何人都能免费拿去用,那钱从哪来?过去几年主流答案是"开源换生态、生态换其他收入",逻辑成立但链条太长。
现在出现了一条更短的链路:开源模型通过云厂商分发,云厂商按调用量付费给模型方。模型方不用自己建销售团队,云厂商不用自己从头训模型,各取所需。
这条路能不能走通,取决于两件事:一是模型的竞争力是否强到云厂商不得不接,二是分成比例是否划算。
从智谱敢上调 ARR 指引 25% 来看,至少它自己认为第一件事已经成立了。
风险在哪
当然也有隐忧。
速度提到 200 Tokens/s 是个体验改进,但它不解决模型能力本身的问题。如果竞品在同等速度下能力更强,或者同等能力下更便宜,FlashX 的溢价就撑不住。
更根本的是,依赖云厂商分发意味着把自己的用户关系交出去一部分。模型方离最终用户越远,议价能力就越弱。这是一个需要用持续的技术领先来平衡的结构性风险。
不过就眼下而言,智谱的这道题解得挺清楚:算力不够就融资扩容,扩容的钱从愿意为速度付费的客户身上赚,同时把开源模型变成云渠道里的分发资产。
在所有人都在降价的时候选择提价,需要的不是勇气,而是对自己稀缺性的判断。市场会很快给出答案。