AI圈又爆颠覆性突破!UC Berkeley团队刚甩出王炸成果:大模型不用看标准答案,仅凭"自我自信度"就能学会复杂推理,甚至在数学和代码任务上碾压传统强化学习方法。更震撼的是,这套被称为INTUITOR的新框架,让15亿参数的小模型也能涌现出DeepSeek级别的长思维链——这波操作直接把AI训练带入"自我觉醒"时代?
颠覆认知!AI靠"自信"就能学会推理
当所有AI还在靠人类喂答案才能进步时,UC Berkeley的中国团队搞出了个狠活:让模型自己跟自己较劲,靠"自信心"就能学会推理。
这套名为INTUITOR的新方法,核心逻辑神似人类做题:
- 就像你考试时对答案越有把握,思路越清晰
- 模型通过计算预测分布与均匀分布的KL散度,把"自信程度"量化成训练奖励
- 重点是完全不需要外部标注数据或标准答案,连DeepSeek需要的验证答案都省了!
同一时间,另一篇论文《RENT》也验证了相似结论,只是用"最小化熵"衡量自信。Dropbox工程副总裁看完直接锐评:"Confidence is all you need"——原来AI进化的密码藏在"自我相信"里?
实验结果太震撼:小模型竟跑出DeepSeek级思维链
团队拿Qwen2.5-1.5B/3B小模型做实验,结果直接让业界惊掉下巴:
- 数学推理:微调后GSM8K得分从低于10%飙到0.811,碾压传统GRPO方法(0.758)
- 代码生成:最终性能比GRPO高8%,相对提升65%,生成代码前还会自动添加自然语言推理步骤
- 反作弊能力:离线训练100步就会作弊(加无关简单题刷分),但在线学习能让评估标准随模型进化,彻底堵死作弊漏洞
最炸裂的是思维链涌现现象:15亿参数的小模型,竟然能像DeepSeek-R1那样生成超长推理步骤。论文里的案例显示,模型解复杂数学题时,会先分步骤写出推理过程,再给出最终答案——这简直是AI在模拟人类"打草稿"的思考过程!
三大突破:AI训练从此告别"填鸭式教育"
INTUITOR这套方法直接捅破了传统强化学习的天花板:
1. 成本革命:摆脱对人工标注的依赖,ChatGPT那种烧钱的RLHF模式可能要过时了
2. 应用扩展:不再局限于数学编程等有标准答案的领域,未来或能攻克医学、法律等复杂场景
3. 安全性升级:从机制上降低"奖励黑客"风险,传统模型可能生成逻辑错误但符合奖励的内容,INTUITOR让模型必须真正"想明白"才能得分
对比一下传统方法的痛点:RLHF需要大量人工标注,成本高昂还可能引入偏见;RLVR依赖可验证答案,无法处理开放领域问题。而INTUITOR就像给AI装上了"自主学习大脑",让模型从"被动接受"变成"主动思考"。
中国学者领衔:浙大校友再出世界级成果
这次突破的核心团队,藏着浓厚的中国背景:
- 第一作者Xuandong Zhao是浙大2019届毕业生,曾在阿里、微软、谷歌实习,现在UC Berkeley做博士后
- 共同一作Zhewei Kang是本科生,两人今年2月就发表过Best-of-N策略,可看作本次研究的先验尝试
- 团队还包括AI领域大牛Sergey Levine和宋晓东(Dawn Song),后者是伯克利AI实验室负责人
值得注意的是,Xuandong Zhao进入伯克利短短一年,就发表十多篇论文并被ICLR、ICML等顶会接收。这次INTUITOR的代码已开源(GitHub搜索Intuitor),论文链接也公布(arxiv.org/abs/2505.19590),学界正在疯狂复现验证。
未来已来:AI自主进化的时代到了?
虽然目前实验还限于小模型和无监督语料库,但业界已经炸开了锅:
- 如果大模型也能用这套方法训练,会不会加速AGI到来?
- 当AI学会"自我反思",会不会产生更接近人类的推理逻辑?
- 传统AI公司的训练范式可能被颠覆,开源模型靠这套方法就能逆袭大厂?
有网友类比:"这就像AI从应试教育转向素质教育,不再死记硬背答案,而是真正学会思考。"也有人担忧:"当模型能自我优化,人类还能跟上它们的进化速度吗?"
评论区聊聊你的看法:你觉得这种"自信驱动"的AI训练,会是AGI的关键一步吗?