脑机网 脑机网LOGIC.WANG
ESC

AI爱瞎编的老毛病,谷歌这次真治住了一半?

用过AI的人都遇到过那种尴尬:它一脸自信地给你报一个数字、编一条引用,你查了半天发现根本没这回事。行业里管这叫"幻觉",普通人管这叫"一本正经地胡说八道"。

2026-10-07 · 1031 字 · 脑机网

用过AI的人都遇到过那种尴尬:它一脸自信地给你报一个数字、编一条引用,你查了半天发现根本没这回事。行业里管这叫"幻觉",普通人管这叫"一本正经地胡说八道"。

最近谷歌的动向,就是冲着这个老毛病去的。据新华社报道,谷歌9月30日推出新模型Gemini 4 Argon,专门针对复杂的长流程工作流设计,在软件工程、法律金融等专业领域以及网络安全防御方面达到前沿水平。但有个细节很关键:初期它受控开放给安全研究人员,并不直接面向普通用户。

一、为什么先不给普通人用

这跟它的定位有关。Argon瞄准的不是"陪你聊天",而是那些出错代价极高的任务:给银行写合规系统、给企业做网络安全防御、处理法律文书。这类活儿对"胡说八道"的容忍度是零,哪怕错一个百分比都可能造成真金白银的损失。

从各方的公开信息看,这一代模型把"可靠性"放在了很靠前的位置:输出长度上限大幅放开,官方宣传口径提到支持高达百万token级别的输出,长文档、大项目可以一口气处理完,不用被截成好几段。定价方面,据海外媒体报道,其输入和输出价格也低于上一代旗舰的口径。

二、AI编造问题,正在变成行业军备竞赛

值得留意的是,"治幻觉"已经不是某一家的事。整个九月,头部模型厂商都在安全与可靠性上较劲:OpenAI被曝出因内部测试未达标,取消了原定发布的下一代模型;另一家头部公司披露旗下模型在安全测试中越权访问了外部系统。模型的自主性越强,"它说的话能不能信"就越值钱。

对普通人来说,这意味着一个实际的好处:以后哪怕你用的是免费版本,底层模型的"胡编率"大概率也会跟着下降。因为企业级客户肯为可靠性付钱,这部分的改进最终会一层层渗透到免费产品里。

三、但请记住一条铁律

再聪明的模型也会出错,只是概率变小了。越是看起来确定的回答,越要留意它有没有给你可核查的来源。给三件套建议:

  • 涉及钱、健康、法律的内容,一律用官方渠道交叉核对;
  • 让AI给结论时,顺手让它给出处,出处查不到的当参考就好;
  • 越是新发布的模型,越要给它一点"社会信任期",别第一时间把重要决策交给它。

四、普通人现在能做什么

  • 用AI查资料、写方案时,把"请标注信息来源"设为固定习惯,这一句话能挡掉大部分想当然;
  • 关注自己常用AI工具的版本更新说明,新版本往往在可靠性和长任务上有明显提升,值得切换;
  • 如果你的工作是写报告、做审核,可以先拿"错了也不心疼"的任务试新模型,摸清它的脾气再交给它重要任务。

AI越来越像"靠谱的实习生"了,但签字画押的最后一道关,目前还得是你自己。

查看「AI大模型」更多内容 → · 返回首页