脑机网 脑机网LOGIC.WANG
ESC

GPT-5.6正式发布,Sol模型通关"史上最难AI测试"

7月9日,OpenAI正式公开发布GPT-5.6系列,一口气放出Sol、Terra、Luna三款模型。

2026-07-11 · 824 字 · 脑机网

7月9日,OpenAI正式公开发布GPT-5.6系列,一口气放出Sol、Terra、Luna三款模型。

同一周,Sol以7.8%的得分刷新ARC-AGI-3基准,成为首个经官方核验"通关"该测试的前沿模型——而此前最强模型在这一关的得分,仅有0.37%。

一个系列,三副面孔

Sol是旗舰,首次引入两档能力分级:"max"档分配额外推理时间,自主探索替代方案并自我纠错;"ultra"档则协调四个并行智能体实例,攻克多步骤复杂任务,代价是更高的Token消耗。Terra定位均衡的日常模型,Luna则是最快、最省的选择。

API按档定价,从轻度消费应用到企业级智能体工作流,各取所需。OpenAI称这是其迄今安全部署最完备的一次,系统卡详尽披露了生物与网络安全领域的评测。

通关"最难AI游戏"

ARC-AGI-3是一个交互式游戏模式,要求模型自主探索环境、归纳规则、规划动作——被公认为衡量通用推理的"硬骨头"。7月9日,ARC Prize官方宣布,GPT-5.6 Sol以7.8%得分刷新SOTA,成为首个通关的前沿模型。

更耐人寻味的是过程:Sol用152步完成通关,而人类基线为208步。分析显示,它在推理中展示了对游戏机制的自主归纳能力,而非机械记忆。

语音也来了

就在发布前一日,7月8日,OpenAI推出GPT-Live新一代语音模型,基于原生实时架构,支持自然打断、停顿理解、实时翻译与听写,并可无缝调度后端模型处理复杂推理与联网搜索。两个版本中,GPT-Live-1面向Go、Plus、Pro订阅用户,mini版面向免费用户。OpenAI透露,如今每周有超1.5亿人使用ChatGPT语音、听写及相关语音功能。

从"会答题"到"会思考、会动手",大模型竞赛的下半场,已经开场。Sol通关ARC,不只是一次刷分,更是通用推理能力迈过门槛的信号。

这场由OpenAI点燃的周度军备竞赛,正把整个行业推向新高度。下一个被改写的,会是谁的纪录?

2026.07.11

查看「AI大模型」更多内容 → · 返回首页