0. Fünf-Sekunden-Fazit: KI konnte Spitzenprobleme lösen und sich trotzdem in einem einfachen Spiel ohne Anleitung verirren
KI-Fähigkeiten waren lange erstaunlich ungleich verteilt.
Computer sind Menschen im Schach seit Langem überlegen, und 2025 erreichte eine fortgeschrittene Version von Gemini Deep Think mit 35/42 Punkten offiziell Goldmedaillen-Niveau bei der Internationalen Mathematik-Olympiade. Trotzdem konnten Frontier-Modelle große Schwierigkeiten bekommen, wenn man ihnen eine einfach aussehende 2D-Umgebung ohne Anleitung und ohne erklärtes Ziel gab und sie selbst herausfinden mussten, was zu tun ist.[1]
ARC-AGI-3 wurde genau für diese Lücke entwickelt. Ein Agent muss handeln, Veränderungen beobachten, Mechaniken ableiten, Ziele erkennen und planen, ohne natürlichsprachliche Regeln zu erhalten.[2][3]
Im September 2026 erreichte GPT-6 Astra auf ARC-AGI-3 Semi-Private 62,71% mit dem Standard harness und verifizierte maximal 99,95% mit OpenAIs Provider Adapter.[2][4]
Das beweist keine fertige AGI. Es sind nicht 100%, und der Lauf mit 99,95% nutzte providerspezifisches Kontextmanagement.
Die wichtige Veränderung ist konkreter: KI ist deutlich besser darin geworden, innerhalb einer unbekannten Umgebung zu lernen, in der anfangs nicht einmal klar ist, worin die Aufgabe besteht.
Für Märkte ist daher eine Rolle interessanter als „sage den Kurs von morgen voraus“: ein Agent, der mögliche statistische Edges entdeckt, testet und seine eigenen Ergebnisse aktiv zu widerlegen versucht.
1. Was ist AGI? Und 1, 2, 3 sind Benchmark-Generationen, keine KI-Stufen
AGI steht für Artificial General Intelligence, allgemeine künstliche Intelligenz.
ARC Prize versteht darunter grob ein System, das Fähigkeiten, die Menschen erlernen können, mit menschenähnlicher Lerneffizienz erwerben kann.[2]
ARC-AGI-1, 2 und 3 bedeuten also nicht „AGI-Stufe 1, 2, 3“. Es sind Generationen des Benchmarks.
- ARC-AGI-1: 2019 eingeführt; farbige Rasterrätsel, bei denen aus wenigen Beispielen eine verborgene Transformation abgeleitet werden muss.[5]
- ARC-AGI-2: gleiches Format, deutlich schwieriger. Jede enthaltene Aufgabe wurde von mindestens zwei Menschen in höchstens zwei Versuchen gelöst.[5][6]
- ARC-AGI-3: wechselt von statischen Rätseln zu interaktiven, unbekannten Umgebungen, die über viele Aktionen gelernt werden müssen.[3]
Kindgerecht:
1 = Bilderrätsel
2 = viel gemeineres Bilderrätsel
3 = neues Spiel, nachdem jemand die Anleitung weggeworfen hat
2. Wie sieht ein „unbekanntes Spiel“ aus? Eine 2D-Welt, die erst durch Handeln Sinn ergibt
ARC-AGI-3 verwendet rundenbasierte 2D-Rasterumgebungen. Zustände können auf Rastern bis 64×64 dargestellt werden, und der Agent wählt aus verfügbaren Aktionen.[7]
Entscheidend ist: Zu wissen, welche Knöpfe existieren, verrät noch nicht, was Gewinnen bedeutet.
Ein erfundenes Beispiel, keine offizielle Aufgabe, könnte so starten:
■■□□□□
■●□□▲□
□□□■□□
Keine Erklärung.
Man bewegt sich nach rechts, der Punkt bewegt sich. Man berührt das Dreieck, seine Farbe ändert sich. An anderer Stelle öffnet sich etwas, das wie eine Tür aussieht.
Ein Mensch bildet sofort Hypothesen:
„Vielleicht bin ich der Punkt.“
„Vielleicht ist das Dreieck ein Schalter.“
„Vielleicht muss ich den Zustand ändern, bevor ich zur Tür gehe.“
ARC-AGI-3 misst genau diese Schleife: Exploration → Modellbildung → Zielerwerb → Planung und Ausführung.[2]
Der Benchmark ist so gestaltet, dass Menschen ihn relativ schnell aufnehmen können. Das heißt aber nicht, dass jedes Kind jedes Spiel mühelos löst. Die Humanstudie 2026 umfasste 458 Teilnehmer; die Umgebungen wurden als für Menschen lösbar kalibriert, individuelle Erfolgsraten unterschieden sich jedoch.[8]
3. Warum konnte KI in Schach und schwieriger Mathematik stark, hier aber schwach sein?
Im Schach sind die vollständigen Regeln von Anfang an gegeben. In Mathematik sagt die Aufgabe, was bewiesen werden soll.
Die Aufgabe kann extrem schwer sein, aber der Problemrahmen ist bereits definiert.
ARC-AGI-3 stellt frühere Fragen:
„Was zählt überhaupt als Fortschritt?“
„Wozu dient dieses Objekt?“
„Was hat meine letzte Aktion verändert?“
Menschen machen das ständig mit neuen Geräten, Spielen, Arbeitsplätzen und Apps. Wir probieren ein paar Dinge aus und bauen ein grobes Modell: „Es funktioniert wahrscheinlich so.“
Frontier-Modelle hatten eine deutliche Schwäche darin, solche Modelle aus wenig Erfahrung zu bilden und über längere Zeit stabil zu halten.
Sie konnten einen schweren Satz beweisen und sich danach in einer spielzeugartigen Oberfläche verirren.
4. GPT-5.6 Sol: ein starkes Gehirn, das praktisch nach jedem Schritt sein Notizbuch wegwarf
GPT-5.6 Sol Max erzielte 96,5% auf ARC-AGI-1 und 92,5% auf ARC-AGI-2, aber nur 7,78% auf ARC-AGI-3 Semi-Private.[9]
OpenAI untersuchte die Ursache und stellte fest, dass ein Teil des Problems im Harness lag, also in der Software zwischen Modell und Spiel.[10]
Verdeckte Reasoning-Zustände wurden nach Aktionen verworfen, und ältere Historie wurde bei langem Kontext abgeschnitten.
Für einen Menschen wäre das:
„Auf Rot treten öffnet die Tür.“
→ einen Schritt machen
→ die Notiz mit dieser Entdeckung zerreißen
→ beim nächsten Schritt: „Was ist dieses rote Ding?“
Als OpenAI Reasoning-Retention und Kontext-Compaction aktivierte, stieg Sol im Public set von 13,3% auf 38,3%.[10]
7,78 und 38,3 dürfen nicht direkt gerankt werden: Ersteres ist Semi-Private, Letzteres Public.
Die Lehre bleibt klar: Fähigkeit hängt nicht nur vom Modell selbst ab, sondern auch davon, wie Erfahrung erhalten und komprimiert wird.
5. GPT-6 Astra: 62,71% und 99,95% sind nicht dieselbe Art Ergebnis
ARC Prize verifizierte GPT-6 Astra am 2. September 2026.[4]
Die besten Semi-Private-Ergebnisse waren:
| Bedingung | Bestes Astra-Ergebnis |
|---|---|
| Standard harness | 62,71% (Max) |
| Provider Adapter | 99,95% (High) |
Der Standard harness ähnelt einer gemeinsamen Minimal-Schnittstelle; das Modell entscheidet selbst, welche sichtbaren Notizen es behält.
Der Provider Adapter erhält providerspezifischen, nicht sichtbaren Reasoning-Zustand zwischen Anfragen und nutzt Compaction für lange Kontexte.[2][4]
Daher ist „Astra allein und ohne Hilfe schaffte 99,95%“ ungenau. Präziser ist: Astra plus OpenAIs Kontextmanagement erreichte 99,95%.
Schon 62,71% im Standard sind ein massiver Sprung gegenüber Sol Max mit 7,78% auf Semi-Private.[4][9]
Auch der Menschenvergleich muss exakt gelesen werden. Astra Max mit Provider Adapter erzielte 98,55% und benötigte in 96,0% der abgeschlossenen Levels weniger Aktionen als die menschliche Baseline, im Durchschnitt 51,7% weniger Aktionen pro Level.[2]
Das heißt nicht „klüger als 96% der Menschen“. Es ist ein Level-für-Level-Effizienzvergleich mit einer menschlichen Median-Baseline.
6. Was machte Astra tatsächlich? Für jedes Spiel schrieb es ein kleines eigenes Physikbuch
ARC Prize hob Astras Verhalten hervor, nicht nur die Punktzahl.
Statt jede Beobachtung wörtlich zu speichern, komprimierte Astra Informationen über:
- Objektpositionen,
- Effekte von Aktionen,
- aktuellen Zustand,
- offene Pläne,
- nächste sinnvolle Schritte.
Es erfand sogar eine kompakte symbolische Notation für Spielmechaniken.[2]
Konzeptionell etwa:
Rot + Aktion rechts → Zustand B Zustand B + blaues Ziel → Tür offen
Das ist ein kleines Weltmodell: eine interne Darstellung, die vorhersagt, wie sich die Umgebung als Nächstes verändert.
Die richtige Antwort war nicht vorher auswendig gelernt; nützliche Struktur musste aus Interaktion gewonnen werden.
7. Ist das also AGI? ARC Prize sagt ausdrücklich nein
ARC Prize bezeichnet Astra als sichtbaren Sprung der Frontier-Fähigkeiten, behauptet aber nicht, dass damit AGI bewiesen sei.[2]
ARC-AGI-3 bleibt eine begrenzte Welt:
- 2D-Raster,
- rundenbasiert,
- deterministische Mechaniken,
- abgeschlossene Ziele.
Die reale Welt enthält wechselnde Regeln, verborgene Variablen, strategische Gegner und unklare Ziele.
Außerdem verlangt der Grand Prize 100%. Verifizierte 99,95% sind extrem nah, aber nicht 100%.[11]
Die präzise Schlussfolgerung lautet: Allgemeine Intelligenz ist nicht „fertig“, aber eine historische Schwäche — effizientes Lernen in neuen interaktiven Umgebungen — wurde stark reduziert.
8. Wo ist das nützlich? Bei Aufgaben, deren vollständiges Regelwerk niemand vorher schreiben kann
Die interessantesten Anwendungen gehen weit über Rätsel hinaus.
- Fabrik- und Logistiksimulation: Personal, Bestand, Reihenfolge und Routen variieren, um Bedingungen für weniger Verzögerung und Kosten zu finden.
- Software-Erkundung: unbekannte Oberflächen lernen und reproduzierbare Fehlerbedingungen finden.
- Spiele und Robotik: Ursache-Wirkungs-Beziehungen zwischen Aktion und Ergebnis mit wenigen Versuchen lernen.
- Werbung, Preise und Betrieb: Entscheidungskombinationen erkunden und Ergebnisse beobachten.
- Forschungsunterstützung: Hypothesen erzeugen, testen, Fehlschläge verwerfen und das Systemmodell aktualisieren.
Die Aufgabe wechselt von „Befolge diese Regel“ zu „Finde heraus, welche Regeln tatsächlich wichtig sind“.
9. Und Aktien und Scalping? Ein Entdecker möglicher Edges ist plausibler als ein Orakel
Ein Edge bedeutet hier einen kleinen, wiederholbaren statistischen Vorteil, der nach Handelskosten bestehen bleibt.
Ein Astra-artiger Ansatz würde nicht mit einer fertigen Regel wie „Kaufe bei RSI unter 30“ beginnen. Er würde Orderbuch, Trades, Preis, Spread, Volumen und Zeit beobachten.
Dann lautet die Frage:
Welche Kombinationen des aktuellen Zustands werden von einer kleinen Richtungstendenz der Rendite in den nächsten Sekunden oder Minuten gefolgt?
Die KI könnte etwa eine Hypothese aus plötzlich wachsender Bid-Tiefe, einem Schub von Market-Buys, engem Spread und einem bestimmten Zeitfenster bilden.
Das ist weiterhin nur eine Hypothese, keine Gewinnformel.
Märkte unterscheiden sich fundamental von ARC, weil ihre Regeln nicht stabil bleiben. Teilnehmer, Nachrichten, Liquidität, Regulierung und Marktregime ändern sich.
Wer nur sagt „finde ein profitables Muster“, riskiert, dass die KI historischen Zufall für ein Naturgesetz hält.
10. Ein seriöses System muss die KI zwingen, ihre eigenen Entdeckungen anzugreifen
Ein Backtest bewertet eine Handelsregel mit historischen Daten.
Die Gefahr: Testet man Tausende oder Millionen Varianten, sehen einige allein durch Zufall spektakulär aus. Das ist das bekannte Problem des Backtest-Overfittings.[12][13]
Ein glaubwürdiger Edge-Explorer sollte:
- Hypothesen erzeugen;
- Kandidaten in einem Entwicklungszeitraum suchen;
- sie auf unberührten Daten verwerfen;
- sie in steigenden, fallenden, volatilen und ruhigen Märkten zu brechen versuchen;
- Gebühren, Spread und Slippage abziehen;
- die Zahl aller getesteten Ideen protokollieren;
- zeitlich korrektes Walk-forward-Testing durchführen;
- vor echtem Geld Paper Trading verwenden;
- Abschaltbedingungen definieren, wenn der Edge verschwindet.
Die ideale Rolle ist nicht Prophet.
Sondern ein Forscher, der 1.000 Ideen vorschlägt, plus ein Gutachter, der 998 davon tötet.
11. Schluss: von „KI, die antwortet“ zu „KI, die herausfindet, was überhaupt die Regeln sind“
Das Entscheidende an ARC-AGI-3 ist nicht nur die auffällige Zahl 99,95%.
Es ist die Lernschleife:
beobachten → handeln → scheitern → Regel ableiten → Hypothese revidieren → zum Ziel vorankommen.
Sol zeigte, wie sehr ein starkes Modell leidet, wenn Erfahrung schlecht erhalten wird. Astra zeigte einen großen Fortschritt darin, Erfahrung in nützliche Regeln zu komprimieren und sie mit wenigen Interaktionen umzusetzen.
Dadurch ändert sich auch, welche Aufgaben man fortgeschrittenen Agenten geben kann.
Nicht nur:
„Hier ist die Regel. Führe sie aus.“
Sondern:
„Hier sind Umgebung und Daten. Finde die Regeln, die wichtig zu sein scheinen, versuche sie unter anderen Bedingungen zu brechen und bring nur das zurück, was überlebt.“
Das garantiert keine Gewinne an der Börse. Märkte sind viel feindseliger als ARC.
Aber wenn wir KI nicht als Wahrsagerin, sondern als Maschine zum Entdecken und Angreifen von Hypothesen betrachten, wird Astras Ergebnis zu einer sehr praktischen Nachricht.
Common sources / 共通参照資料
Quellen
- Google DeepMind — IMO 2025 gold-medal-level result (2025-07-21) deepmind.google
- ARC Prize — “OpenAI's GPT-6 Astra on ARC-AGI-3” (2026-09-03) arcprize.org
- ARC Prize — “Announcing ARC-AGI-3” (2026-03-25) arcprize.org
- ARC Prize Verified Results — GPT-6 Astra (verified 2026-09-02) arcprize.org
- ARC Prize — ARC-AGI-1 & ARC-AGI-2 Guide arcprize.org
- ARC Prize — “ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems” (2025-05-20) arcprize.org
- ARC-AGI-3 Docs — Game Schema docs.arcprize.org
- ARC Prize — “Measuring Human Performance on ARC-AGI-3” (2026-04-14) arcprize.org
- ARC Prize Verified Results — GPT-5.6 arcprize.org
- OpenAI — “How two settings tripled our ARC-AGI-3 scores” (2026-07-29) openai.com
- ARC Prize 2026 — ARC-AGI-3 Competition; Grand Prize requires 100% arcprize.org
- Bailey, Borwein, López de Prado & Zhu — “The Probability of Backtest Overfitting papers.ssrn.com
- Bailey & López de Prado — “How ‘backtest overfitting’ in finance leads to false discoveries” (2021) academic.oup.com
