---
title: "炸裂！AI靠\"自信\"学会推理，浙大校友颠覆强化学习，无需标准答案竟超越DeepSeek"
date: 2025-05-29
category: AI大模型
site: 脑机网
canonical: https://aiai.cafe/a/njw-9a0099
language: zh-CN
---

# 炸裂！AI靠"自信"学会推理，浙大校友颠覆强化学习，无需标准答案竟超越DeepSeek

> AI圈又爆颠覆性突破！UC Berkeley团队刚甩出王炸成果：大模型不用看标准答案，仅凭"自我自信度"就能学会复杂推理，甚至在数学和代码任务上碾压传统强化学习方法。

AI圈又爆颠覆性突破！UC Berkeley团队刚甩出王炸成果：大模型不用看标准答案，仅凭"自我自信度"就能学会复杂推理，甚至在数学和代码任务上碾压传统强化学习方法。更震撼的是，这套被称为INTUITOR的新框架，让15亿参数的小模型也能涌现出DeepSeek级别的长思维链——这波操作直接把AI训练带入"自我觉醒"时代？

颠覆认知！AI靠"自信"就能学会推理

当所有AI还在靠人类喂答案才能进步时，UC Berkeley的中国团队搞出了个狠活：让模型自己跟自己较劲，靠"自信心"就能学会推理。

这套名为INTUITOR的新方法，核心逻辑神似人类做题：

- 就像你考试时对答案越有把握，思路越清晰

- 模型通过计算预测分布与均匀分布的KL散度，把"自信程度"量化成训练奖励

- 重点是完全不需要外部标注数据或标准答案，连DeepSeek需要的验证答案都省了！

同一时间，另一篇论文《RENT》也验证了相似结论，只是用"最小化熵"衡量自信。Dropbox工程副总裁看完直接锐评："Confidence is all you need"——原来AI进化的密码藏在"自我相信"里？

实验结果太震撼：小模型竟跑出DeepSeek级思维链

团队拿Qwen2.5-1.5B/3B小模型做实验，结果直接让业界惊掉下巴：

- 数学推理：微调后GSM8K得分从低于10%飙到0.811，碾压传统GRPO方法（0.758）

- 代码生成：最终性能比GRPO高8%，相对提升65%，生成代码前还会自动添加自然语言推理步骤

- 反作弊能力：离线训练100步就会作弊（加无关简单题刷分），但在线学习能让评估标准随模型进化，彻底堵死作弊漏洞

最炸裂的是思维链涌现现象：15亿参数的小模型，竟然能像DeepSeek-R1那样生成超长推理步骤。论文里的案例显示，模型解复杂数学题时，会先分步骤写出推理过程，再给出最终答案——这简直是AI在模拟人类"打草稿"的思考过程！

三大突破：AI训练从此告别"填鸭式教育"

INTUITOR这套方法直接捅破了传统强化学习的天花板：

1. 成本革命：摆脱对人工标注的依赖，ChatGPT那种烧钱的RLHF模式可能要过时了

2. 应用扩展：不再局限于数学编程等有标准答案的领域，未来或能攻克医学、法律等复杂场景

3. 安全性升级：从机制上降低"奖励黑客"风险，传统模型可能生成逻辑错误但符合奖励的内容，INTUITOR让模型必须真正"想明白"才能得分

对比一下传统方法的痛点：RLHF需要大量人工标注，成本高昂还可能引入偏见；RLVR依赖可验证答案，无法处理开放领域问题。而INTUITOR就像给AI装上了"自主学习大脑"，让模型从"被动接受"变成"主动思考"。

中国学者领衔：浙大校友再出世界级成果

这次突破的核心团队，藏着浓厚的中国背景：

- 第一作者Xuandong Zhao是浙大2019届毕业生，曾在阿里、微软、谷歌实习，现在UC Berkeley做博士后

- 共同一作Zhewei Kang是本科生，两人今年2月就发表过Best-of-N策略，可看作本次研究的先验尝试

- 团队还包括AI领域大牛Sergey Levine和宋晓东（Dawn Song），后者是伯克利AI实验室负责人

值得注意的是，Xuandong Zhao进入伯克利短短一年，就发表十多篇论文并被ICLR、ICML等顶会接收。这次INTUITOR的代码已开源（GitHub搜索Intuitor），论文链接也公布（arxiv.org/abs/2505.19590），学界正在疯狂复现验证。

未来已来：AI自主进化的时代到了？

虽然目前实验还限于小模型和无监督语料库，但业界已经炸开了锅：

- 如果大模型也能用这套方法训练，会不会加速AGI到来？

- 当AI学会"自我反思"，会不会产生更接近人类的推理逻辑？

- 传统AI公司的训练范式可能被颠覆，开源模型靠这套方法就能逆袭大厂？

有网友类比："这就像AI从应试教育转向素质教育，不再死记硬背答案，而是真正学会思考。"也有人担忧："当模型能自我优化，人类还能跟上它们的进化速度吗？"

评论区聊聊你的看法：你觉得这种"自信驱动"的AI训练，会是AGI的关键一步吗？

---

来源：脑机网（https://aiai.cafe/）｜原文：https://aiai.cafe/a/njw-9a0099
本内容仅供参考，不构成投资建议。
