人类很快就能上手的2D小游戏,AI却拿到了99.95%:ARC-AGI-3的“未知规则发现”跃迁,以及它能否用于寻找股票交易优势

AI的能力长期以来都很不均匀。

广告
广告

0. 五秒结论:AI能做顶级难题,却曾经会在“没有说明书的简单游戏”里迷路

AI的能力长期以来都很不均匀。

它早已在国际象棋上超过人类顶尖棋手;2025年,Gemini Deep Think还在国际数学奥林匹克中取得35/42分、金牌标准的官方成绩。可是一旦给前沿模型一个看起来很简单的2D环境,不告诉规则和目标,让它自己摸索,它却可能明显变弱。[1]

ARC-AGI-3就是专门测试这一点。没有自然语言说明,没有明确写出的胜利条件。智能体必须行动、观察变化、推断机制、发现目标并制定计划。[2][3]

2026年9月,GPT-6 Astra在ARC-AGI-3 Semi-Private上,用Standard harness取得62.71%,用OpenAI的Provider Adapter取得最高99.95%。[2][4]

这并不等于AGI已经完成。它不是100%,而且99.95%的成绩使用了供应商专用的上下文管理机制。

真正重要的变化更具体:AI在“连任务本身是什么都需要先自己搞清楚”的陌生环境中学习的能力大幅增强。

如果把这种能力用于市场,与其让它“预测明天股价”,不如把它当成发现候选优势、验证并主动反驳自己结论的研究员。

1. AGI是什么?1、2、3不是AI等级,而是基准测试的三代

AGI是Artificial General Intelligence,即人工通用智能。

ARC Prize把AGI大致理解为:一个系统能够像人类一样高效地学习人类能学会的新技能。[2]

ARC-AGI-1、2、3并不是“AGI一级、二级、三级”,而是基准测试的不同世代。

  • ARC-AGI-1:2019年推出的彩色网格抽象推理题,从少量示例中找出隐藏的转换规则。[5]
  • ARC-AGI-2:格式相同但更难。所有入选题目都经过人类测试,至少两个人能在两次尝试以内解出。[5][6]
  • ARC-AGI-3:从静态题目变成交互式环境,智能体要通过多步行动学习第一次见到的世界。[3]

给小学生解释就是:

1=图形谜题
2=更凶狠的图形谜题
3=第一次玩游戏,但说明书被扔了

2. “未知游戏”是什么样?只有动手之后才知道2D世界的含义

ARC-AGI-3使用回合制2D网格环境。状态可以表示在最大64×64的网格上,智能体从可用动作中选择操作。[7]

关键在于:知道有哪些按钮,不等于知道怎样才算赢。

下面只是一个虚构示意,并非官方题目:

■■□□□□
■●□□▲□
□□□■□□

没有说明。

向右移动,●跟着动;碰到▲,颜色改变;再到另一个位置,一个像门的东西打开了。

人类会很自然地提出假设:

“●可能是我。”
“▲可能是开关。”
“也许要先改变状态再去门那里。”

ARC-AGI-3测的就是探索→建模→发现目标→规划与执行。[2]

官方设计原则是让人类能比较快上手,但这并不意味着任何小学生都能轻松通关全部游戏。2026年的人类数据来自458名参与者,验证了环境对人类可解,但个人成功率仍有差异。[8]

3. 为什么AI擅长国际象棋和高难数学,却会在这种游戏里变弱?

国际象棋一开始就给出了完整规则。数学题也会明确告诉你要证明什么。

哪怕问题极难,问题的框架已经给好了。

ARC-AGI-3却要求先回答更早的问题:

“什么才算进展?”
“这个东西有什么作用?”
“刚才的动作到底改变了什么?”

人类每天都在做这种事:新设备、新游戏、新工作、新软件。摸几下就会建立一个“可能是这样运作”的粗略模型。

过去的前沿AI在用少量经验建立并长期保持这种模型方面存在明显弱点。

它可能能证明复杂定理,却在像玩具一样的界面里迷路。

4. GPT-5.6 Sol:脑子很强,但像是每走一步都把笔记扔掉

GPT-5.6 Sol Max在ARC-AGI-1得96.5%、ARC-AGI-2得92.5%,但ARC-AGI-3 Semi-Private只有7.78%。[9]

OpenAI调查后发现,问题的一部分不是模型本身,而是连接模型和游戏的harness。[10]

官方设置会在动作后丢弃隐藏推理,历史过长时也会截掉旧记录。

换成人类就是:

“踩红色会开门。”
→ 走一步
→ 把写着这个发现的纸撕掉
→ 下一步重新问“这个红色是什么?”

OpenAI启用推理保留和上下文压缩后,Sol在Public set上的分数从13.3%升到38.3%。[10]

7.78%来自Semi-Private,13.3%和38.3%来自Public,所以不能直接当作同一排行榜比较。

但结论很清楚:智能不仅取决于模型本身,也取决于经验如何被保存和压缩。

5. GPT-6 Astra:62.71%和99.95%不是同一种测试条件

ARC Prize在2026年9月2日验证了Astra。[4]

Semi-Private最高结果如下:

条件 Astra最高分
Standard harness 62.71%(Max)
Provider Adapter 99.95%(High)

Standard harness更接近统一的最小接口,模型自己决定保留哪些可见笔记。

Provider Adapter则会在请求之间保留供应商专用的隐藏推理状态,并对超长上下文进行压缩。[2][4]

所以“裸Astra单独99.95%”并不准确。更准确的是:Astra加上OpenAI设计的上下文管理达到了99.95%。

即使只看Standard的62.71%,相较Sol Max在同类Semi-Private上的7.78%,也已经是巨大跃升。[4][9]

人类比较也要仔细读。Provider Adapter下的Astra Max得98.55%,在它完成的关卡中,96.0%的关卡使用了比人类基准更少的动作,平均每关动作数少51.7%。[2]

这不是“比96%的人更聪明”,而是逐关与人类中位数动作基准比较的效率指标。

6. Astra到底在做什么?给每个游戏现场写一本自己的“小物理课本”

ARC Prize特别指出了Astra的行为。

它并不是把所有观察原封不动堆起来,而是压缩这些信息:

  • 物体的位置
  • 动作产生的效果
  • 当前状态
  • 尚未完成的计划
  • 下一步要做的操作

它甚至会创造自己的简短符号来表示游戏规则。[2]

概念上就像:

红色 + 向右操作 → 状态B
状态B + 蓝色目标 → 门打开

这就是一个小型的世界模型:用来预测环境下一步如何变化的内部说明书。

关键在于它没有提前背答案,而是从互动中提取结构。

7. 那这是不是AGI完成了?ARC Prize明确说不是

ARC Prize认为Astra代表前沿模型能力的一次明显台阶式提升,但并没有声称它证明了AGI。[2]

ARC-AGI-3仍然是有限世界:

  • 2D网格
  • 回合制
  • 确定性机制
  • 有终点的目标

现实世界会改变规则,存在隐藏变量,对手会反应,目标有时都说不清。

而且Grand Prize要求100%。99.95%非常接近,但正式来说还不是100%。[11]

最准确的结论是:“通用智能已经完成”还太早,但“在陌生交互环境中快速学习”这个长期弱点被大幅削弱了。

8. 能用在哪里?最适合“人类没法事先把完整规则写出来”的工作

真正有趣的应用并不只是继续做谜题。

  1. 工厂与物流模拟:改变人员、库存、工序、配送,寻找降低延误和成本的条件。
  2. 软件探索:学习陌生界面,寻找可重复出现的故障条件。
  3. 游戏与机器人:用少量尝试学习动作和结果的因果关系。
  4. 广告、定价和运营优化:改变决策组合并观察结果。
  5. 科研辅助:生成假设、实验、淘汰失败结论、更新系统模型。

任务从**“按这个规则做”**变成“找出真正起作用的规则”。

9. 那股票和超短线呢?“候选优势发现器”比“预言机”更合理

这里的交易优势,指的是扣除交易成本后仍能重复出现的小幅统计优势。

Astra式方法不会从“RSI低于30就买”这种完成规则开始,而会观察盘口、成交、价格、点差、成交量和时间。

然后问:

哪些当前条件组合之后,未来几秒到几分钟的收益率会出现轻微方向偏差?

AI可以提出比如买盘深度突然增加、主动买单变多、点差较窄、特定时间窗口同时出现这样的假设。

但这只是待验证假设,不是赚钱公式。

市场和ARC最大的区别在于,市场规则不固定。参与者、新闻、流动性、监管和市场状态都会变化。

只说“找赚钱模式”,AI很容易把历史偶然当成自然定律。

10. 真要做,就让AI不只发现,还负责摧毁自己的发现

回测就是用历史数据评价交易规则。

危险在于,如果测试成千上万甚至数百万个组合,总会有一些纯靠运气看起来极其优秀。这就是回测过拟合。[12][13]

一个可信的“优势探索器”应当这样工作:

  1. 生成假设
  2. 在开发区间寻找候选
  3. 在完全未用于发现的数据上淘汰
  4. 分牛市、熊市、高波动、低波动做破坏性测试
  5. 扣除手续费、点差和滑点
  6. 记录一共尝试了多少个想法
  7. 按时间顺序做walk-forward验证
  8. 真金白银前先做实时模拟交易
  9. 事先定义优势消失后的停止条件

最理想的角色不是预言家。

而是一个提出1000个假设的研究员,加一个亲手杀掉其中998个的审稿人。

11. 最终结论:从“回答问题的AI”到“发现什么才是规则的AI”

ARC-AGI-3真正重要的,不只是99.95这个漂亮数字。

而是这条学习链:

观察 → 行动 → 失败 → 推断规则 → 修改假设 → 向目标推进。

Sol展示了强模型在经验保存方式糟糕时会有多弱。Astra则展示了把经验压缩成规则、再用很少的动作执行这些规则的巨大进步。

于是我们给高级智能体的任务也可以变化。

不再只是:

“规则就是这个,执行。”

而可以是:

“环境和数据在这里。找出看起来真正重要的规则,换条件去破坏它,只把活下来的结论带回来。”

这当然不保证在股票市场赚钱。市场比ARC恶劣得多。

但如果不把AI当算命先生,而把它当成发现并攻击假设的研究机器,Astra的进步就变得非常现实。

资料来源

  1. Google DeepMind — IMO 2025 gold-medal-level result (2025-07-21) deepmind.google
  2. ARC Prize — “OpenAI's GPT-6 Astra on ARC-AGI-3” (2026-09-03) arcprize.org
  3. ARC Prize — “Announcing ARC-AGI-3” (2026-03-25) arcprize.org
  4. ARC Prize Verified Results — GPT-6 Astra (verified 2026-09-02) arcprize.org
  5. ARC Prize — ARC-AGI-1 & ARC-AGI-2 Guide arcprize.org
  6. ARC Prize — “ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems” (2025-05-20) arcprize.org
  7. ARC-AGI-3 Docs — Game Schema docs.arcprize.org
  8. ARC Prize — “Measuring Human Performance on ARC-AGI-3” (2026-04-14) arcprize.org
  9. ARC Prize Verified Results — GPT-5.6 arcprize.org
  10. OpenAI — “How two settings tripled our ARC-AGI-3 scores” (2026-07-29) openai.com
  11. ARC Prize 2026 — ARC-AGI-3 Competition; Grand Prize requires 100% arcprize.org
  12. Bailey, Borwein, López de Prado & Zhu — “The Probability of Backtest Overfitting papers.ssrn.com
  13. Bailey & López de Prado — “How ‘backtest overfitting’ in finance leads to false discoveries” (2021) academic.oup.com
广告
Mendoi-chan

作者

Mendoi-chan

把工作与日常生活中的麻烦整理成清晰的结构和下一步行动。

关于本站
广告

最新文章

  1. 1《作弊技能“死者苏生”》为什么能离谱到这种程度——百年前魔王军、人手不足、巫妖的悲哀,以及几乎克服阳光的吸血鬼
  2. 2情侣一定要有相同爱好吗?自由、身体亲密和经济安全感可能更重要
  3. 3简体中文 (zh-Hans)
  4. 4Joyfull联名菜单真的只是“换名字”吗?从“水面斩的水在哪?”一路查到商品开发
  5. 5简体中文 (zh-Hans)

推荐阅读

广告