在地铁里、飞机上、地下车库,你想问 AI 一句话,屏幕上转了半天圈,最后弹出"网络异常"。
这个体验,可能要开始改变了。
9 月 8 日,华为发布麒麟 9050 Pro 和 Mate XT 2 三折叠。这颗芯片最硬的一条指标是:达芬奇 NPU 支持总参数 300 亿、激活 20 亿的端侧 MoE 全模态大模型直接跑在手机上。
300 亿参数是什么概念?三年前,这个规模的模型得放在机房里,用一整排显卡伺候。
一、真正的关键不是算力,是功耗
先别急着看跑分。移动端最难的从来不是"能不能跑",是"跑起来手机烫不烫、掉电快不快"。
这次公布的几个数字,重点其实都在这儿:
- 关键任务功耗最高降低 66%
- 晶体管密度比上一代提升 55%
- 自研 9 核灵犀 CPU 多核性能提升 52%
功耗砍掉三分之二,比性能涨一半重要得多。因为端侧 AI 的真正门槛不是峰值算力,是持续可用——你不能为了问一句话,把手机烫成暖手宝、电量掉 20%。
芯片层面还落地了所谓的逻辑折叠技术,本质上是在有限的面积里塞进更多晶体管、同时让它们更省电。
端侧 AI 的竞争,已经从"能不能跑"转向"能跑多久"。
二、300 亿参数进手机,会改变什么
三个变化,跟每个用手机的人都有关。
第一,断网也能用。 飞机上、山里、地铁里,翻译、总结、识图、语音转写这些事不用再等信号。这不是方便不方便的问题,是"有没有"的问题。
第二,数据可以不出手机。 你让它总结的合同、整理的病历、写的私密文档,不必再上传到别人的服务器。对普通人来说,这一条的分量会在未来几年越来越重。
第三,响应速度的质感不一样。 云端往返几百毫秒的延迟消失了,对话会变得像跟人说话一样自然——这一点一旦习惯就回不去。
三、云端不会消失,但角色会变
当然要说清楚:端侧跑 300 亿参数,不等于以后不需要云。
大模型的训练、超长上下文的处理、需要实时联网信息的任务,仍然得靠云端。更可能的格局是小活本地干、大活交给云:日常对话、隐私内容、实时交互在手机上完成;复杂推理、大规模生成调用云端。
这也是各家现在都在抢的方向:谁能把"必须上云"的那部分缩到最小,谁就掌握了体验的主动权。
四、普通人现在能做什么
第一,换机时把"端侧 AI 能力"纳入考虑。 别只看跑分和摄像头,问一句:它本地能跑多大的模型?没网的时候还能用哪些功能?这两条会越来越影响日常体验。
第二,重新审视你手机里的隐私设置。 端侧能力越强,你越应该搞清楚:哪些 App 在把你的数据传出去、传给了谁。技术给了你不上传的可能,前提是你得主动去关。
第三,别为"云端会员"提前囤年卡。 随着本地能力上来,一部分原本要付费的云端服务会被本地替代。按需续费,比一次性买三年更划算。
真正的智能,不该等你找到信号才开始。