0. 五秒結論:AI能做頂級難題,卻曾經會在「沒有說明書的簡單遊戲」裡迷路
AI的能力長期以來都很不均勻。
它早已在西洋棋上超越人類頂尖棋手;2025年,Gemini Deep Think還在國際數學奧林匹亞取得35/42分、金牌標準的官方成績。可是只要丟給前沿模型一個看起來很簡單的2D環境,不告訴規則與目標,要它自己摸索,它就可能明顯變弱。[1]
ARC-AGI-3就是專門測這件事。沒有自然語言說明,也沒有明寫的勝利條件。智能體必須行動、觀察變化、推斷機制、找出目標並規劃。[2][3]
2026年9月,GPT-6 Astra在ARC-AGI-3 Semi-Private上,以Standard harness得到62.71%,以OpenAI的Provider Adapter得到最高99.95%。[2][4]
這不代表AGI已經完成。它不是100%,而且99.95%的成績使用了供應商專用的脈絡管理機制。
真正重要的變化更具體:AI在「連任務本身是什麼都要先自己搞清楚」的陌生環境中學習的能力大幅提升。
若把這種能力帶進市場,與其叫它「預測明天股價」,不如把它當成發現候選優勢、驗證並主動反駁自己結論的研究員。
1. AGI是什麼?1、2、3不是AI等級,而是基準測試的三代
AGI是Artificial General Intelligence,也就是人工通用智慧。
ARC Prize大致把AGI理解為:一個系統能以接近人類的效率,學會人類能學會的新技能。[2]
ARC-AGI-1、2、3不是「AGI一級、二級、三級」,而是基準測試的不同世代。
- ARC-AGI-1:2019年推出的彩色網格抽象推理題,從少量範例找出隱藏的轉換規則。[5]
- ARC-AGI-2:格式相同但更難。所有收錄題目都經過人類測試,至少兩個人能在兩次嘗試內解出。[5][6]
- ARC-AGI-3:從靜態題目變成交互式環境,智能體必須透過多步行動學會第一次見到的世界。[3]
給小學生的版本就是:
1=圖形謎題
2=更兇狠的圖形謎題
3=第一次玩遊戲,但說明書被丟掉了
2. 「未知遊戲」是什麼樣子?只有動手之後才知道2D世界的意思
ARC-AGI-3使用回合制2D網格環境。狀態可表示在最大64×64的網格上,智能體從可用動作中挑選操作。[7]
關鍵是:知道有哪些按鈕,不等於知道怎樣才算贏。
以下只是虛構示意,不是官方題目:
■■□□□□
■●□□▲□
□□□■□□
沒有說明。
往右走,●跟著移動;碰到▲,顏色改變;再去別處,一個像門的東西打開。
人類自然會提出假設:
「●可能是我。」
「▲可能是開關。」
「也許要先改變狀態再去門那裡。」
ARC-AGI-3測的就是探索→建模→發現目標→規劃與執行。[2]
官方設計原則是讓人類能快速上手,但這不代表任何小學生都能輕鬆全破。2026年人類資料來自458名參與者,驗證了環境對人類可解,但個人成功率仍有差異。[8]
3. 為什麼AI擅長西洋棋和高難度數學,卻會在這種遊戲變弱?
西洋棋從一開始就給完整規則。數學題也會告訴你要證明什麼。
問題可以非常難,但問題框架已經提供了。
ARC-AGI-3卻要求先回答更早的問題:
「什麼才算進展?」
「這個物件有什麼作用?」
「剛才那個動作到底改變了什麼?」
人類每天都在做這種事:新設備、新遊戲、新工作、新軟體。摸幾下就會建立一個「大概是這樣運作」的粗略模型。
過去前沿AI在用少量經驗建立並維持這種模型方面有明顯弱點。
它可能能證明複雜定理,卻在像玩具一樣的介面裡迷路。
4. GPT-5.6 Sol:腦袋很強,但像每走一步就把筆記丟掉
GPT-5.6 Sol Max在ARC-AGI-1得96.5%、ARC-AGI-2得92.5%,但ARC-AGI-3 Semi-Private只有7.78%。[9]
OpenAI調查後發現,問題的一部分不是模型本身,而是連接模型和遊戲的harness。[10]
官方設定會在動作後丟棄隱藏推理,歷史過長時也會截掉舊記錄。
換成人類就是:
「踩紅色會開門。」
→ 走一步
→ 把寫著這個發現的紙撕掉
→ 下一步重新問「這個紅色是什麼?」
OpenAI啟用推理保留與脈絡壓縮後,Sol在Public set上的分數從13.3%升到38.3%。[10]
7.78%來自Semi-Private,13.3%和38.3%來自Public,所以不能直接當成同一張排行榜比較。
但結論很清楚:智慧不只取決於模型本身,也取決於經驗如何被保存與壓縮。
5. GPT-6 Astra:62.71%與99.95%不是同一種測試條件
ARC Prize在2026年9月2日驗證Astra。[4]
Semi-Private最高結果如下:
| 條件 | Astra最高分 |
|---|---|
| Standard harness | 62.71%(Max) |
| Provider Adapter | 99.95%(High) |
Standard harness更接近統一的最小介面,模型自己決定保留哪些可見筆記。
Provider Adapter則會在請求之間保留供應商專用的隱藏推理狀態,並對過長脈絡做壓縮。[2][4]
所以「Astra單獨裸跑99.95%」並不準確。更準確的是:Astra加上OpenAI設計的脈絡管理達到99.95%。
即使只看Standard的62.71%,相較Sol Max在Semi-Private的7.78%,也是巨大躍進。[4][9]
人類比較也要看仔細。Provider Adapter下的Astra Max得98.55%,在它完成的關卡中,96.0%的關卡使用了比人類基準更少的動作,平均每關動作數少51.7%。[2]
這不是「比96%的人更聰明」,而是逐關與人類中位數動作基準比較的效率指標。
6. Astra到底在做什麼?替每個遊戲現場寫一本自己的「小物理課本」
ARC Prize特別指出Astra的行為。
它不是把所有觀察原封不動堆起來,而是壓縮這些資訊:
- 物件的位置
- 動作產生的效果
- 目前狀態
- 尚未完成的計畫
- 下一步需要的操作
它甚至會自己創造簡短符號來表示遊戲規則。[2]
概念上就像:
紅色 + 向右操作 → 狀態B
狀態B + 藍色目標 → 門打開
這就是一個小型的世界模型:用來預測環境下一步如何變化的內部說明書。
關鍵是它沒有預先背答案,而是從互動中抽出結構。
7. 那這是不是AGI完成了?ARC Prize明確說不是
ARC Prize認為Astra代表前沿模型能力的一次明顯階梯式提升,但沒有聲稱它證明了AGI。[2]
ARC-AGI-3仍是有限世界:
- 2D網格
- 回合制
- 確定性機制
- 有終點的目標
現實世界會改規則,有隱藏變數,對手會反應,目標有時甚至說不清楚。
而且Grand Prize要求100%。99.95%非常接近,但正式來說還不是100%。[11]
最準確的結論是:「通用智慧已完成」還太早,但「在陌生互動環境中快速學習」這個長期弱點被大幅削弱。
8. 能用在哪裡?最適合「人類無法事先寫出完整規則」的工作
真正有趣的應用不只是繼續解謎。
- 工廠與物流模擬:改變人力、庫存、流程、配送,尋找降低延誤和成本的條件。
- 軟體探索:學會陌生介面,找到可重現的故障條件。
- 遊戲與機器人:用少量嘗試學習動作與結果的因果關係。
- 廣告、定價與營運最佳化:改變決策組合並觀察結果。
- 研究輔助:產生假設、實驗、淘汰失敗結論、更新系統模型。
任務從**「照這條規則做」**變成「找出真正有作用的規則」。
9. 那股票和超短線呢?「候選優勢發現器」比「預言機」更合理
這裡的交易優勢,是指扣除交易成本後仍可重複出現的小幅統計優勢。
Astra式方法不會從「RSI低於30就買」這種完成規則開始,而會觀察委託簿、成交、價格、價差、成交量與時間。
然後問:
哪些當前條件組合之後,未來幾秒到幾分鐘的報酬率會出現一點方向偏差?
AI可以提出例如買方掛單深度突然增加、主動買單增加、價差偏窄、特定時間窗同時出現的假設。
但那只是待驗證假設,不是賺錢公式。
市場和ARC最大的差別在於市場規則不固定。參與者、新聞、流動性、監管與市場狀態都會改變。
只說「找賺錢模式」,AI很容易把歷史偶然當成自然定律。
10. 真要做,就讓AI不只發現,還負責摧毀自己的發現
回測就是用歷史資料評估交易規則。
危險在於,如果測試成千上萬甚至數百萬個組合,總會有一些純靠運氣看起來極度優秀。這就是回測過度擬合。[12][13]
一個可信的「優勢探索器」應該:
- 產生假設
- 在開發期間尋找候選
- 在完全未用於發現的資料上淘汰
- 分多頭、空頭、高波動、低波動做破壞測試
- 扣除手續費、價差與滑價
- 記錄總共嘗試了多少想法
- 依時間順序做walk-forward驗證
- 真金白銀前先做即時模擬交易
- 事先定義優勢消失後的停止條件
最理想的角色不是預言家。
而是一個提出1000個假設的研究員,加上一個親手殺掉其中998個的審稿人。
11. 最終結論:從「回答問題的AI」到「發現什麼才是規則的AI」
ARC-AGI-3真正重要的,不只是99.95這個漂亮數字。
而是這條學習鏈:
觀察 → 行動 → 失敗 → 推斷規則 → 修改假設 → 朝目標前進。
Sol展示了強模型在經驗保存方式糟糕時會有多弱。Astra則展示了把經驗壓縮成規則,再用很少動作執行規則的巨大進步。
所以我們交給高階智能體的工作也能變化。
不再只是:
「規則就是這個,執行。」
而可以是:
「環境和資料在這裡。找出真正重要的規則,換條件去破壞它,只把活下來的結論帶回來。」
這當然不保證在股票市場賺錢。市場比ARC惡劣得多。
但如果不把AI當算命師,而把它當成發現並攻擊假設的研究機器,Astra的進步就變得非常實用。
資料來源
- Google DeepMind — IMO 2025 gold-medal-level result (2025-07-21) deepmind.google
- ARC Prize — “OpenAI's GPT-6 Astra on ARC-AGI-3” (2026-09-03) arcprize.org
- ARC Prize — “Announcing ARC-AGI-3” (2026-03-25) arcprize.org
- ARC Prize Verified Results — GPT-6 Astra (verified 2026-09-02) arcprize.org
- ARC Prize — ARC-AGI-1 & ARC-AGI-2 Guide arcprize.org
- ARC Prize — “ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems” (2025-05-20) arcprize.org
- ARC-AGI-3 Docs — Game Schema docs.arcprize.org
- ARC Prize — “Measuring Human Performance on ARC-AGI-3” (2026-04-14) arcprize.org
- ARC Prize Verified Results — GPT-5.6 arcprize.org
- OpenAI — “How two settings tripled our ARC-AGI-3 scores” (2026-07-29) openai.com
- ARC Prize 2026 — ARC-AGI-3 Competition; Grand Prize requires 100% arcprize.org
- Bailey, Borwein, López de Prado & Zhu — “The Probability of Backtest Overfitting papers.ssrn.com
- Bailey & López de Prado — “How ‘backtest overfitting’ in finance leads to false discoveries” (2021) academic.oup.com
