---
title: "GPT-6还没正式发布，怎么就把最难的考卷刷到99.9%？"
date: 2026-09-17
category: AI大模型
site: 脑机网
canonical: https://aiai.cafe/a/njw-c2e3d7
language: zh-CN
---

# GPT-6还没正式发布，怎么就把最难的考卷刷到99.9%？

> 9月16日，ARC Prize 创始人公布了一件事：OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 的半私有测试集上拿到 99.9%。分数高到直接把这份考卷提前作废——主办方随即宣布重做下一代评测。

9月16日，ARC Prize 创始人公布了一件事：OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 的半私有测试集上拿到 99.9%。分数高到直接把这份考卷提前作废——主办方随即宣布重做下一代评测。

## 99.9%是个什么概念
ARC-AGI 一直被称为"大模型照妖镜"。它考的不是知识，是面对从没见过的图形规律，能不能当场归纳出规则。人类做起来轻松，模型长期吃力。

这一次的对照很刺眼：

- GPT-6 Astra：**99.9%**
- Claude Opus 5：**30.2%**
- 更早一代模型：**7.8%**
同一份卷子，第一名和第二名差了近70个百分点。不是大家都进步了，是有一家跑到了另一个量级。

## 考卷自己做不下去了
ARC Prize 创始人的反应很务实：承认基准已饱和，并公布下一代蓝图——ARC-AGI-4 聚焦"更长周期的持续学习"，ARC-AGI-5 则完全围绕"开放式发明"出题。

换句话说，考"能不能做对一道给好的题"已经没意义了，接下来要考的是"能不能在没有题目的地方自己找出题"。

评测体系的升级，本身就是模型能力跃迁的副产品。

## 发布周：不止一个模型在动
这几天 OpenAI 的动作密度异常。产品负责人称本周发布数量将达 DevDay 级别，Altman 也预告有大版本。已有用户反馈，用 GPT-5.6 Sol 时后台被路由到了 GPT-6 Sol，"速度很快"。

同时官方宣布：**GPT-5.5 系列将于 10 月 14 日在全平台下线**。一款发布才半年、曾帮 OpenAI 稳住 Codex 用户盘的模型，就这样退场。

模型开始有了"货架期"，而且越来越短。

## 嘴上喊刹车，手里在换发动机
有意思的是时间点。就在几天前，Anthropic 的 Dario 在长文里呼吁放慢前沿迭代，OpenAI 的 Altman 公开声援。而现在，两家被发现在同一周各自灰度测试新一代模型——OpenAI 测 GPT-6 Sol，Anthropic 测 Opus 5.2。

Dario 的核心论据是：前沿技术向实体产业落地兑现价值的渗透率只有 5% 到 10%，就算模型不再突破，现有技术也有大量红利可挖。

这个判断本身没错，但它解释不了一件事：如果现有技术真的够用，为什么还要这么急地换代？

## 对普通人的三个提醒
1. **别把工作流绑死在单一模型上**。半年前还是主力的 GPT-5.5 要下线了，任何"我用惯了这个"都可能在下个季度失效。

2. **评测分数会越来越难懂**。基准饱和之后，"第一名"的含义变了——它不再代表真实可用性，只代表在某个特定尺子上的领先。

3. **看任务闭环，不看参数**。这轮竞争的落点已经从"模型更聪明"转向"能不能把一件事从头做完"。

评分表可以重做，但用户不会重做。他们只会记得，谁真的把活干完了。

---

来源：脑机网（https://aiai.cafe/）｜原文：https://aiai.cafe/a/njw-c2e3d7
本内容仅供参考，不构成投资建议。
