0. 5秒で結論:超難問を解くAIが「説明書なしの簡単ゲーム」で詰まっていた
AIはずっと変だった。
チェスでは人間の世界王者を倒し、難しい数学では国際数学オリンピック金メダル級まで来たのに、人間なら少し触れば分かる2Dゲームを、説明なしで渡されると急に弱くなることがあった。
ARC-AGI-3は、そこを狙ったテストだ。ルール説明なし。勝利条件の説明なし。知らない2D環境を触りながら、何が起きたかを見て、法則を作り、目的を見つけ、計画して攻略する。
2026年9月、GPT-6 AstraはこのARC-AGI-3で、Standard harnessでは62.71%、OpenAI向けのProvider Adapterでは最高99.95%を記録した。
ただし99.95%は「AGI完成」ではない。100%でもない。しかも専用の文脈管理を使った条件だ。
それでも重要なのは、AIが「答えを知っている問題」だけでなく、「そもそも何の問題か分からない場所」で学ぶ能力を大きく伸ばしたことだ。
そして実用で面白いのはここから。
この能力を株に持っていくなら、「明日の株価を当てろ」と神託を求めるより、データを触り、エッジ候補を発見し、自分で反証まで回す研究員として使う方がずっと筋がいい。
1. AGIって何? そして1・2・3はAIのレベルではない
AGIはArtificial General Intelligence、人工汎用知能の略だ。
ARC PrizeはAGIを、ざっくり言えば「人間が身につけられる技能を、人間と同じくらい効率よく新しく身につけられるシステム」として捉えている。
ここで混乱しやすいのがARC-AGI-1、2、3。
これは「AGIレベル1→2→3」と進化する称号ではない。知能テストの第1世代、第2世代、第3世代である。
- ARC-AGI-1:2019年に始まった色付きマスの図形なぞなぞ。数個の見本から隠れた変換ルールを見つける。
- ARC-AGI-2:形式は1と同じだが、より難しい。採用された全問題は、少なくとも2人が2回以内の挑戦で解けることを人間テストで確認した。
- ARC-AGI-3:静止画問題からゲーム型へ。説明なしの未知環境を何手も触りながら学ぶ。
小学生向けに縮めると、
1=図形なぞなぞ 2=凶悪になった図形なぞなぞ 3=説明書を捨てられた初見ゲーム
である。
2. 「未知ゲーム」ってどんなもの? 2Dで、操作して初めて意味が分かる
ARC-AGI-3のゲームはターン制の2Dグリッド環境だ。最大64×64のマスで状態が表現され、AIはその都度、使える操作を選ぶ。
重要なのは、操作の候補は分かっても、何のために操作するのかは教えてもらえないことだ。
たとえば雰囲気だけ再現した架空の例なら、最初にこんな画面が出る。
■■□□□□
■●□□▲□
□□□■□□
説明はない。
右を押す。●が動く。▲に触れる。色が変わる。別の場所へ行くと扉っぽいものが開く。
人間はそこで、
「●が自分かな」 「▲はスイッチかな」 「色を変えてから扉へ行くのか」
と仮説を作る。
ARC-AGI-3が測るのは、この探索→モデル化→目標発見→計画と実行だ。
公式は、人間にとって素早く理解しやすいことを設計原則にしている。ただし「どの小学生でも全問余裕」という意味ではない。2026年の人間データは458人を対象にしたもので、全環境が人間に解けることを確認する一方、個人ごとの成功率には差がある。
つまり「小学生でも分かりそうな見た目」はかなり合っているが、「児童向け知能テスト」ではない。
3. なぜチェスと難しい数学に強いAIが、こんなゲームで弱かったのか
ここが一番おもしろい。
チェスはルールが最初から完全に決まっている。数学も問題文に「何を証明するか」が書かれている。
AIから見ると、ものすごく難しくても、問題の枠は与えられている。
実際、2025年にはGoogle DeepMindのGemini Deep ThinkがIMOで35/42点、金メダル相当を公式評価で記録した。
一方ARC-AGI-3は、
「何をすれば勝ち?」 「この記号は何?」 「今の操作で何が変わった?」
から自分で調べないといけない。
人間は日常的にこれをやっている。新しい家電、新しいゲーム、新しい職場、新しいアプリ。説明書を全部読まなくても、触って「たぶんこう」を作る。
従来AIには、この**“たぶんこう”を少ない経験から作って持ち続ける能力**に大きな穴があった。
超難問を解けるのに、初見のおもちゃで迷子になる。
知能というものが一枚岩ではないことを、かなり残酷に見せるベンチマークだった。
4. GPT-5.6 Sol:頭はいい。でもゲーム中にノートを捨てていた
GPT-5.6 SolのARC-AGI-3 Semi-Private公式結果は、Maxで7.78%。ARC-AGI-1は96.5%、ARC-AGI-2は92.5%なのに、3で崖から落ちる。
OpenAIが調べると、原因の一部はモデル能力だけではなく、テスト用ハーネス、つまりAIとゲームをつなぐ仕組みにあった。
公式ハーネスでは、各操作のたびに内部の推論が捨てられ、長くなると古い履歴も切り落とされた。
人間で言えば、
「赤を踏むと扉が開くぞ」 → 一歩動く → その発見を書いたノートを破る → 次の一歩で「この赤は何だ?」から再開
である。
OpenAIが「推論を保持する」「古い文脈を圧縮して残す」という設定を有効にすると、Public setでは13.3%から38.3%へ約3倍になった。
注意したいのは、7.78%はSemi-Private、13.3%と38.3%はPublic setなので、その数字同士を直接一本のランキングとして比べてはいけない。
それでも示唆は明確だ。
知能はモデルの頭だけで決まらない。何を覚えておけるか、どう経験を圧縮するかでも激変する。
5. GPT-6 Astra:62.71%と99.95%は、同じ意味の数字ではない
2026年9月2日にARC Prizeが検証したGPT-6 Astraは、一気に別の景色へ行った。
Semi-Privateでの最高値はこうだ。
| 条件 | Astraの最高スコア |
|---|---|
| Standard harness | 62.71%(Max) |
| Provider Adapter | 99.95%(High) |
Standard harnessは各社共通に近い最小構成で、AI自身が残したいメモを選ぶ。
Provider Adapterは、OpenAI側の仕組みを使って見えない推論状態をターン間で保持し、長くなった会話を圧縮する。
だから「Astra単体が裸で99.95%」ではない。
正確には、**Astra+OpenAI向け文脈管理で99.95%**だ。
それでもStandardの62.71%だけ見ても、Sol MaxのSemi-Private 7.78%から巨大な伸びである。
そして人間比較でさらに面白い数字がある。
Provider AdapterのAstra Maxは98.55%だったが、その実行では、完了したレベルの96.0%で人間基準より少ない操作を使い、平均では人間基準より51.7%少ない操作だった。
ここで「人間の96%より賢い」と読むのは誤り。
意味は、レベルごとに設定された人間の中央値の手数と比較し、96%の完了レベルでAstraの方が少ない手数だったということだ。
十分ヤバいので、盛らなくてもヤバい。
6. Astraは何をしていた? ゲームの中に「自分用の物理法則」を作っていた
ARC PrizeがAstraのプレイ記録で注目したのは、点数だけではない。
Astraは、見たものをそのまま長々と覚えるのではなく、
- 物体はどこにあるか
- どの操作で何が変わるか
- 今どの状態か
- 次に何をするべきか
を短い記号へ圧縮していた。
つまり頭の中で、
「赤+右操作→状態B」 「状態Bで青へ→扉解放」
のような、自分専用の小さな世界モデルを作る。
公式はこれを、環境の仕組みを論理規則へ変換し、独自の短縮記法まで作った行動として紹介している。
これが「暗記が強いAI」と違うところだ。
初見ゲームの正解表は事前に持っていない。触った結果から、その場でこの世界では何が因果として効いているのかを整理している。
ARC-AGI-3が見たかった能力にかなり近い。
7. じゃあAGI完成? 公式の答えは「違う」
ここは切り分けが必要だ。
ARC Prize自身が、Astraを大きな能力の段差、つまりstep-function changeと評価している一方、AGI達成を主張していない。
理由は単純。
ARC-AGI-3は閉じた世界だ。
- 2Dグリッド
- ターン制
- 決定論的な仕組み
- 終わりのあるゴール
現実世界は、相手が嘘をつく、ルールが途中で変わる、目的自体が曖昧、観測できない要因がある、昨日の成功が今日通じない。
そしてGrand Prizeの条件は100%。99.95%は限りなく近いが、正式な100%ではない。
なので今回の意味は、
「万能知能が完成した」ではなく、「未知環境を触って学ぶという、従来かなり弱かった壁を一気に越え始めた」
くらいが最も正確だ。
8. 何に使える? 本命は「ルールが書いてない世界を探索する仕事」
この能力の実用先は、数学パズルだけではない。
むしろ強そうなのは、正解ルールを人間が最初から書けない仕事だ。
たとえば、
- 工場・物流シミュレーション:人員、在庫、段取り、配車を動かし、納期やコストが改善する条件を探索する。
- ソフトウェア探索:初見UIを触り、操作法やバグの再現条件を発見する。
- ゲーム・ロボット:行動→結果の因果を学び、少ない試行で攻略する。
- 広告・価格・運用最適化:条件を変え、結果を観測し、効く組み合わせを探す。
- 研究補助:仮説を立て、実験・シミュレーションで外し、残った規則を次の仮説へつなぐ。
要するに、
「このルールで動け」から「そもそも効いているルールを探せ」へ
仕事の渡し方が変わる。
9. 株やスキャルピングには? 「予言AI」より「エッジ候補発見AI」が面白い
株でいうエッジとは、ここでは手数料などを引いた後でも繰り返し残る、小さな統計的な有利さくらいの意味で使う。
Astra型の発想を持ち込むなら、
「RSIが30なら買え」
と人間が完成済みルールを渡すより、板、約定、価格、出来高などを観察させ、
「どんな条件の組み合わせの後に、数秒〜数分の値動きが少し偏るか?」
を探索させる方が面白い。
たとえばAIが仮説として、
- 買い板が急に厚くなった
- 成行買いが短時間で増えた
- スプレッドが狭い
- 寄り付き直後ではなく一定時間後
という条件を作り、未来の短時間リターンに偏りがあるか調べる。
重要なのは、これは例であって儲かるルールではないことだ。
市場はARCゲームと決定的に違う。
ARCでは同じ操作なら同じ仕組みが返る。市場では参加者、ニュース、流動性、規制、相場環境が変わり、昨日のルールが消える。
だからAIに「勝ちルールを探せ」だけ言うと、過去データの偶然を神の法則と勘違いしやすい。
10. 株で本当に作るなら、AIには「発見」より「自分の発見を壊す」までやらせる
バックテストは、過去データで売買ルールを試す作業だ。
問題は、条件を何千、何万と試すと、ただの偶然なのにものすごく儲かって見えるルールが必ず混ざることだ。これはバックテスト過学習として長く研究されている。
なので「エッジ探索機」は次のようにする。
- 仮説を作る:どの状態が未来に関係しそうか。
- 学習用期間で試す:候補を大量に出す。
- 未使用期間で落とす:発見に使っていないデータで再試験する。
- 時期をずらす:上昇相場、下落相場、高ボラ、低ボラなどで壊す。
- コストを入れる:手数料、スプレッド、滑りを入れた後でも残るか。
- 試した回数を記録する:1万個試して1個当たったなら、その1個を奇跡扱いしない。
- ウォークフォワード:過去→次の期間、さらに次の期間へ時間順に進める。
- ペーパートレード:実金投入前にリアルタイムで仮想運用する。
- 停止条件を決める:エッジが消えたら自動で止める。
役割は予言者ではない。
仮説を1000個出す研究員+その1000個を998個まで自分で殺す査読者である。
これならARC-AGI-3的な「探索して世界モデルを更新する」能力を、金融の現実に少し合わせられる。
11. 最終結論:「答えを出すAI」から「何がルールか探すAI」へ
ARC-AGI-3の衝撃は、99.95という派手な数字だけではない。
本質は、
見る→触る→失敗する→法則を作る→仮説を直す→目的へ進む
という、人間にはかなり自然な学び方が、フロンティアAIで急速に強くなったことだ。
Solでは、強い頭があっても記憶の持ち方で苦戦した。Astraでは、その経験を圧縮し、ルールとして持ち、少ない操作で使う能力が大きく伸びた。
だから応用先も、「難しい数学をもっと解かせる」だけではもったいない。
工場でも、ソフトでも、研究でも、相場でも、
「ルールはこれです」ではなく「データと環境はこれです。効いているルールを探し、別条件で壊して、それでも残るものを持ってこい」
という仕事の渡し方ができる。
株でそれがすぐ金になる保証はない。むしろ相場は、ARCよりはるかに意地が悪い。
しかし、AIを占い師として見るより、未知の法則を探索し、自分の仮説を反証する研究装置として見るなら、Astraの進歩はかなり実用的なニュースに見えてくる。
