脑机网 脑机网LOGIC.WANG
ESC

炸裂!AI靠"自信"学会推理,浙大校友颠覆强化学习,无需标准答案竟超越DeepSeek

AI圈又爆颠覆性突破!UC Berkeley团队刚甩出王炸成果:大模型不用看标准答案,仅凭"自我自信度"就能学会复杂推理,甚至在数学和代码任务上碾压传统强化学习方法。

2025-05-29 · 1686 字 · 脑机网

AI圈又爆颠覆性突破!UC Berkeley团队刚甩出王炸成果:大模型不用看标准答案,仅凭"自我自信度"就能学会复杂推理,甚至在数学和代码任务上碾压传统强化学习方法。更震撼的是,这套被称为INTUITOR的新框架,让15亿参数的小模型也能涌现出DeepSeek级别的长思维链——这波操作直接把AI训练带入"自我觉醒"时代?


颠覆认知!AI靠"自信"就能学会推理

当所有AI还在靠人类喂答案才能进步时,UC Berkeley的中国团队搞出了个狠活:让模型自己跟自己较劲,靠"自信心"就能学会推理。

这套名为INTUITOR的新方法,核心逻辑神似人类做题:

- 就像你考试时对答案越有把握,思路越清晰


- 模型通过计算预测分布与均匀分布的KL散度,把"自信程度"量化成训练奖励


- 重点是完全不需要外部标注数据或标准答案,连DeepSeek需要的验证答案都省了!

同一时间,另一篇论文《RENT》也验证了相似结论,只是用"最小化熵"衡量自信。Dropbox工程副总裁看完直接锐评:"Confidence is all you need"——原来AI进化的密码藏在"自我相信"里?


实验结果太震撼:小模型竟跑出DeepSeek级思维链

团队拿Qwen2.5-1.5B/3B小模型做实验,结果直接让业界惊掉下巴:

- 数学推理:微调后GSM8K得分从低于10%飙到0.811,碾压传统GRPO方法(0.758)


- 代码生成:最终性能比GRPO高8%,相对提升65%,生成代码前还会自动添加自然语言推理步骤


- 反作弊能力:离线训练100步就会作弊(加无关简单题刷分),但在线学习能让评估标准随模型进化,彻底堵死作弊漏洞

最炸裂的是思维链涌现现象:15亿参数的小模型,竟然能像DeepSeek-R1那样生成超长推理步骤。论文里的案例显示,模型解复杂数学题时,会先分步骤写出推理过程,再给出最终答案——这简直是AI在模拟人类"打草稿"的思考过程!


三大突破:AI训练从此告别"填鸭式教育"

INTUITOR这套方法直接捅破了传统强化学习的天花板:

1. 成本革命:摆脱对人工标注的依赖,ChatGPT那种烧钱的RLHF模式可能要过时了


2. 应用扩展:不再局限于数学编程等有标准答案的领域,未来或能攻克医学、法律等复杂场景


3. 安全性升级:从机制上降低"奖励黑客"风险,传统模型可能生成逻辑错误但符合奖励的内容,INTUITOR让模型必须真正"想明白"才能得分

对比一下传统方法的痛点:RLHF需要大量人工标注,成本高昂还可能引入偏见;RLVR依赖可验证答案,无法处理开放领域问题。而INTUITOR就像给AI装上了"自主学习大脑",让模型从"被动接受"变成"主动思考"。


中国学者领衔:浙大校友再出世界级成果

这次突破的核心团队,藏着浓厚的中国背景:

- 第一作者Xuandong Zhao是浙大2019届毕业生,曾在阿里、微软、谷歌实习,现在UC Berkeley做博士后


- 共同一作Zhewei Kang是本科生,两人今年2月就发表过Best-of-N策略,可看作本次研究的先验尝试


- 团队还包括AI领域大牛Sergey Levine和宋晓东(Dawn Song),后者是伯克利AI实验室负责人

值得注意的是,Xuandong Zhao进入伯克利短短一年,就发表十多篇论文并被ICLR、ICML等顶会接收。这次INTUITOR的代码已开源(GitHub搜索Intuitor),论文链接也公布(arxiv.org/abs/2505.19590),学界正在疯狂复现验证。


未来已来:AI自主进化的时代到了?

虽然目前实验还限于小模型和无监督语料库,但业界已经炸开了锅:

- 如果大模型也能用这套方法训练,会不会加速AGI到来?


- 当AI学会"自我反思",会不会产生更接近人类的推理逻辑?


- 传统AI公司的训练范式可能被颠覆,开源模型靠这套方法就能逆袭大厂?

有网友类比:"这就像AI从应试教育转向素质教育,不再死记硬背答案,而是真正学会思考。"也有人担忧:"当模型能自我优化,人类还能跟上它们的进化速度吗?"


评论区聊聊你的看法:你觉得这种"自信驱动"的AI训练,会是AGI的关键一步吗?

查看「AI大模型」更多内容 → · 返回首页