0. 五秒结论:AI能做顶级难题,却曾经会在“没有说明书的简单游戏”里迷路
AI的能力长期以来都很不均匀。
它早已在国际象棋上超过人类顶尖棋手;2025年,Gemini Deep Think还在国际数学奥林匹克中取得35/42分、金牌标准的官方成绩。可是一旦给前沿模型一个看起来很简单的2D环境,不告诉规则和目标,让它自己摸索,它却可能明显变弱。[1]
ARC-AGI-3就是专门测试这一点。没有自然语言说明,没有明确写出的胜利条件。智能体必须行动、观察变化、推断机制、发现目标并制定计划。[2][3]
2026年9月,GPT-6 Astra在ARC-AGI-3 Semi-Private上,用Standard harness取得62.71%,用OpenAI的Provider Adapter取得最高99.95%。[2][4]
这并不等于AGI已经完成。它不是100%,而且99.95%的成绩使用了供应商专用的上下文管理机制。
真正重要的变化更具体:AI在“连任务本身是什么都需要先自己搞清楚”的陌生环境中学习的能力大幅增强。
如果把这种能力用于市场,与其让它“预测明天股价”,不如把它当成发现候选优势、验证并主动反驳自己结论的研究员。
1. AGI是什么?1、2、3不是AI等级,而是基准测试的三代
AGI是Artificial General Intelligence,即人工通用智能。
ARC Prize把AGI大致理解为:一个系统能够像人类一样高效地学习人类能学会的新技能。[2]
ARC-AGI-1、2、3并不是“AGI一级、二级、三级”,而是基准测试的不同世代。
- ARC-AGI-1:2019年推出的彩色网格抽象推理题,从少量示例中找出隐藏的转换规则。[5]
- ARC-AGI-2:格式相同但更难。所有入选题目都经过人类测试,至少两个人能在两次尝试以内解出。[5][6]
- ARC-AGI-3:从静态题目变成交互式环境,智能体要通过多步行动学习第一次见到的世界。[3]
给小学生解释就是:
1=图形谜题
2=更凶狠的图形谜题
3=第一次玩游戏,但说明书被扔了
2. “未知游戏”是什么样?只有动手之后才知道2D世界的含义
ARC-AGI-3使用回合制2D网格环境。状态可以表示在最大64×64的网格上,智能体从可用动作中选择操作。[7]
关键在于:知道有哪些按钮,不等于知道怎样才算赢。
下面只是一个虚构示意,并非官方题目:
■■□□□□
■●□□▲□
□□□■□□
没有说明。
向右移动,●跟着动;碰到▲,颜色改变;再到另一个位置,一个像门的东西打开了。
人类会很自然地提出假设:
“●可能是我。”
“▲可能是开关。”
“也许要先改变状态再去门那里。”
ARC-AGI-3测的就是探索→建模→发现目标→规划与执行。[2]
官方设计原则是让人类能比较快上手,但这并不意味着任何小学生都能轻松通关全部游戏。2026年的人类数据来自458名参与者,验证了环境对人类可解,但个人成功率仍有差异。[8]
3. 为什么AI擅长国际象棋和高难数学,却会在这种游戏里变弱?
国际象棋一开始就给出了完整规则。数学题也会明确告诉你要证明什么。
哪怕问题极难,问题的框架已经给好了。
ARC-AGI-3却要求先回答更早的问题:
“什么才算进展?”
“这个东西有什么作用?”
“刚才的动作到底改变了什么?”
人类每天都在做这种事:新设备、新游戏、新工作、新软件。摸几下就会建立一个“可能是这样运作”的粗略模型。
过去的前沿AI在用少量经验建立并长期保持这种模型方面存在明显弱点。
它可能能证明复杂定理,却在像玩具一样的界面里迷路。
4. GPT-5.6 Sol:脑子很强,但像是每走一步都把笔记扔掉
GPT-5.6 Sol Max在ARC-AGI-1得96.5%、ARC-AGI-2得92.5%,但ARC-AGI-3 Semi-Private只有7.78%。[9]
OpenAI调查后发现,问题的一部分不是模型本身,而是连接模型和游戏的harness。[10]
官方设置会在动作后丢弃隐藏推理,历史过长时也会截掉旧记录。
换成人类就是:
“踩红色会开门。”
→ 走一步
→ 把写着这个发现的纸撕掉
→ 下一步重新问“这个红色是什么?”
OpenAI启用推理保留和上下文压缩后,Sol在Public set上的分数从13.3%升到38.3%。[10]
7.78%来自Semi-Private,13.3%和38.3%来自Public,所以不能直接当作同一排行榜比较。
但结论很清楚:智能不仅取决于模型本身,也取决于经验如何被保存和压缩。
5. GPT-6 Astra:62.71%和99.95%不是同一种测试条件
ARC Prize在2026年9月2日验证了Astra。[4]
Semi-Private最高结果如下:
| 条件 | Astra最高分 |
|---|---|
| Standard harness | 62.71%(Max) |
| Provider Adapter | 99.95%(High) |
Standard harness更接近统一的最小接口,模型自己决定保留哪些可见笔记。
Provider Adapter则会在请求之间保留供应商专用的隐藏推理状态,并对超长上下文进行压缩。[2][4]
所以“裸Astra单独99.95%”并不准确。更准确的是:Astra加上OpenAI设计的上下文管理达到了99.95%。
即使只看Standard的62.71%,相较Sol Max在同类Semi-Private上的7.78%,也已经是巨大跃升。[4][9]
人类比较也要仔细读。Provider Adapter下的Astra Max得98.55%,在它完成的关卡中,96.0%的关卡使用了比人类基准更少的动作,平均每关动作数少51.7%。[2]
这不是“比96%的人更聪明”,而是逐关与人类中位数动作基准比较的效率指标。
6. Astra到底在做什么?给每个游戏现场写一本自己的“小物理课本”
ARC Prize特别指出了Astra的行为。
它并不是把所有观察原封不动堆起来,而是压缩这些信息:
- 物体的位置
- 动作产生的效果
- 当前状态
- 尚未完成的计划
- 下一步要做的操作
它甚至会创造自己的简短符号来表示游戏规则。[2]
概念上就像:
红色 + 向右操作 → 状态B
状态B + 蓝色目标 → 门打开
这就是一个小型的世界模型:用来预测环境下一步如何变化的内部说明书。
关键在于它没有提前背答案,而是从互动中提取结构。
7. 那这是不是AGI完成了?ARC Prize明确说不是
ARC Prize认为Astra代表前沿模型能力的一次明显台阶式提升,但并没有声称它证明了AGI。[2]
ARC-AGI-3仍然是有限世界:
- 2D网格
- 回合制
- 确定性机制
- 有终点的目标
现实世界会改变规则,存在隐藏变量,对手会反应,目标有时都说不清。
而且Grand Prize要求100%。99.95%非常接近,但正式来说还不是100%。[11]
最准确的结论是:“通用智能已经完成”还太早,但“在陌生交互环境中快速学习”这个长期弱点被大幅削弱了。
8. 能用在哪里?最适合“人类没法事先把完整规则写出来”的工作
真正有趣的应用并不只是继续做谜题。
- 工厂与物流模拟:改变人员、库存、工序、配送,寻找降低延误和成本的条件。
- 软件探索:学习陌生界面,寻找可重复出现的故障条件。
- 游戏与机器人:用少量尝试学习动作和结果的因果关系。
- 广告、定价和运营优化:改变决策组合并观察结果。
- 科研辅助:生成假设、实验、淘汰失败结论、更新系统模型。
任务从**“按这个规则做”**变成“找出真正起作用的规则”。
9. 那股票和超短线呢?“候选优势发现器”比“预言机”更合理
这里的交易优势,指的是扣除交易成本后仍能重复出现的小幅统计优势。
Astra式方法不会从“RSI低于30就买”这种完成规则开始,而会观察盘口、成交、价格、点差、成交量和时间。
然后问:
哪些当前条件组合之后,未来几秒到几分钟的收益率会出现轻微方向偏差?
AI可以提出比如买盘深度突然增加、主动买单变多、点差较窄、特定时间窗口同时出现这样的假设。
但这只是待验证假设,不是赚钱公式。
市场和ARC最大的区别在于,市场规则不固定。参与者、新闻、流动性、监管和市场状态都会变化。
只说“找赚钱模式”,AI很容易把历史偶然当成自然定律。
10. 真要做,就让AI不只发现,还负责摧毁自己的发现
回测就是用历史数据评价交易规则。
危险在于,如果测试成千上万甚至数百万个组合,总会有一些纯靠运气看起来极其优秀。这就是回测过拟合。[12][13]
一个可信的“优势探索器”应当这样工作:
- 生成假设
- 在开发区间寻找候选
- 在完全未用于发现的数据上淘汰
- 分牛市、熊市、高波动、低波动做破坏性测试
- 扣除手续费、点差和滑点
- 记录一共尝试了多少个想法
- 按时间顺序做walk-forward验证
- 真金白银前先做实时模拟交易
- 事先定义优势消失后的停止条件
最理想的角色不是预言家。
而是一个提出1000个假设的研究员,加一个亲手杀掉其中998个的审稿人。
11. 最终结论:从“回答问题的AI”到“发现什么才是规则的AI”
ARC-AGI-3真正重要的,不只是99.95这个漂亮数字。
而是这条学习链:
观察 → 行动 → 失败 → 推断规则 → 修改假设 → 向目标推进。
Sol展示了强模型在经验保存方式糟糕时会有多弱。Astra则展示了把经验压缩成规则、再用很少的动作执行这些规则的巨大进步。
于是我们给高级智能体的任务也可以变化。
不再只是:
“规则就是这个,执行。”
而可以是:
“环境和数据在这里。找出看起来真正重要的规则,换条件去破坏它,只把活下来的结论带回来。”
这当然不保证在股票市场赚钱。市场比ARC恶劣得多。
但如果不把AI当算命先生,而把它当成发现并攻击假设的研究机器,Astra的进步就变得非常现实。
资料来源
- Google DeepMind — IMO 2025 gold-medal-level result (2025-07-21) deepmind.google
- ARC Prize — “OpenAI's GPT-6 Astra on ARC-AGI-3” (2026-09-03) arcprize.org
- ARC Prize — “Announcing ARC-AGI-3” (2026-03-25) arcprize.org
- ARC Prize Verified Results — GPT-6 Astra (verified 2026-09-02) arcprize.org
- ARC Prize — ARC-AGI-1 & ARC-AGI-2 Guide arcprize.org
- ARC Prize — “ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems” (2025-05-20) arcprize.org
- ARC-AGI-3 Docs — Game Schema docs.arcprize.org
- ARC Prize — “Measuring Human Performance on ARC-AGI-3” (2026-04-14) arcprize.org
- ARC Prize Verified Results — GPT-5.6 arcprize.org
- OpenAI — “How two settings tripled our ARC-AGI-3 scores” (2026-07-29) openai.com
- ARC Prize 2026 — ARC-AGI-3 Competition; Grand Prize requires 100% arcprize.org
- Bailey, Borwein, López de Prado & Zhu — “The Probability of Backtest Overfitting papers.ssrn.com
- Bailey & López de Prado — “How ‘backtest overfitting’ in finance leads to false discoveries” (2021) academic.oup.com
