Wer kurzfristige Handelsstrategien schon einmal von Hand untersucht hat, weiß: Der schwerste Teil ist nicht bloß das Rechnen.
Was tun, wenn Signal A erscheint? Was, wenn B gleichzeitig kommt? Bei hoher Volatilität handeln, bei niedriger auslassen? In dieser Sitzung dem Trend folgen, in jener gar nicht einsteigen?
Wer jeden Zweig einzeln prüft, verwandelt einen normalen Feierabend schnell in ein privates Forschungslabor. Mehrere Stunden täglich über Jahre zu investieren und am Ende nur eine belastbare Strategie übrig zu haben, ist keineswegs absurd.
Dann kommt eine auf Exploration starke KI.
In einem solchen Forschungsablauf kann sie innerhalb weniger Stunden Tausende Varianten prüfen, untersuchen, warum Ergebnisse instabil sind, und die Ursache des Scheiterns in das nächste Experiment überführen.
Die menschliche Reaktion ist naheliegend:
„Wie lange würde ein Mensch brauchen, wenn er das alles einzeln machen müsste?“
Doch „KI kann 4.000 Strategien testen, also haben wir gewonnen“ ist in der Finanzforschung gefährlich. Mehr Versuche bedeuten auch mehr Chancen, zufällig etwas zu finden, das nur zur Vergangenheit passt.[1][2]
Die sinnvollere Kombination lautet:
menschliche Hypothese × KI-Exploration × KI-Widerlegung × statistische Korrektur für massive Suche.
Man braucht nicht nur eine KI, die Gewinner findet. Man braucht auch eine, deren Aufgabe es ist, diese Gewinner zu zerstören.
1. Warum Jahre manueller Forschung plötzlich komprimiert wirken können
Manuelle Strategieforschung ist eine Kette kleiner Aufgaben:
- Hypothese bilden.
- Bedingung implementieren.
- Backtest durchführen.
- Ergebnis lesen.
- Fragen, warum es instabil ist.
- Bedingungen aufteilen.
- Erneut testen.
Keiner dieser Schritte muss für sich außergewöhnlich schwer sein. Die Last entsteht durch Hunderte oder Tausende Wiederholungen.
Dazu kommen Kontextwechsel: Was habe ich gestern getestet? Hatte ich diesen Filter schon? War dieses Ergebnis vor oder nach der Änderung der Spread-Annahme?
Ein Explorationsagent kann die Schleife am Laufen halten.
Er muss nicht bei „profitabel“ stoppen. Er kann prüfen, ob das Ergebnis von wenigen Tagen abhängt, nach Kosten verschwindet, nur in einer Sitzung lebt oder zusammenbricht, wenn ein Baustein entfernt wird.
Das ist mehr als schnelleres Backtesting.
Es ist schnellere Forschungsiteration.
2. Astras Stärke ähnelt weniger „die Antwort kennen“ als „sich in einer unbekannten Umgebung zurechtfinden“
ARC-AGI-3 macht diese Fähigkeit anschaulich.
Der interaktive Benchmark besteht aus neuen 2D-Gitterwelten ohne natürlichsprachige Anleitung und ohne angegebenes Ziel. Ein Agent muss erkunden, Regeln ableiten, ein Arbeitsmodell der Umgebung aufbauen, Ziele erkennen, planen, handeln und sich korrigieren.[3][4]
Im Juli 2026 erreichte GPT-5.6 Sol 7,78 % auf dem semi-privaten Set von ARC Prize. OpenAI zeigte zusätzlich auf dem öffentlichen Set, dass eine andere Konfiguration mit erhaltenem Reasoning-Zustand und Kontextkompression Sol von 13,3 % auf 38,3 % bringen konnte.[5]
Im September erreichte Astra auf demselben semi-privaten Set 62,7 % mit dem Standard-Harness von ARC Prize und 99,9 % mit einem Provider Adapter, der mehr Reasoning-Zustand zwischen Aktionen erhält. Da das Harness-Design die Punktzahl stark beeinflusst, darf man 99,9 gegen 7,78 nicht als simplen Faktor unter identischen Bedingungen lesen. Entscheidend ist der Sprung bei Exploration, Zustandsmodellierung und langfristiger Anpassung.[6][3]
ARC Prize berichtete außerdem, dass Astra bei 96 % der von ihm abgeschlossenen Levels weniger Aktionen benötigte als der Median der menschlichen erfolgreichen Spieler.[3]
Das ist eine andere Art von Stärke als das einmalige Lösen einer extrem schwierigen Gleichung.
Eher:
„Was passiert, wenn ich das berühre? Gut. Und wenn ich jenes probiere? Ah, jetzt verstehe ich die Regel.“
Gerade weil manche 2D-Umgebungen so aussehen, als könnte ein Kind einfach herumprobieren, war ihre langjährige Schwierigkeit für KI besonders aufschlussreich.
ARC Prize betont zugleich, dass eine Sättigung von ARC-AGI-3 kein Beweis für AGI ist. Der Benchmark ist geschlossen und deterministisch; die reale Welt ist es nicht.[3]
3. Warum die Exploration eines 2D-Spiels an Scalping-Forschung erinnert
Der Markt ist kein deterministisches Puzzle. Es gibt konkurrierende Akteure, verborgene Informationen, Regimewechsel, Kosten und Ausführungsgrenzen.
Die Forschungsschleife kann trotzdem ähnlich aussehen.
Angenommen, eine Orderbuch-Ungleichgewichtsbedingung verbessert den Backtest.
Dann folgen zwingend weitere Fragen:
- Ist das Ungleichgewicht selbst wirklich prädiktiv?
- Funktioniert es nur bei hoher Volatilität?
- Ist der Effekt nur ein Artefakt niedriger Spreads?
- Verschwindet er bei einem Tick schlechterer Ausführung?
- Existiert er nur in einer bestimmten Sitzung?
Beobachten. Ändern. Messen. Hypothese aktualisieren.
Die Struktur ähnelt ARC-AGI-3: Wahrnehmen → Handeln → Rückmeldung → Modell aktualisieren → nächste Aktion wählen.[3][4]
Darum ist eine bessere Anweisung als „finde die profitabelsten Parameter“:
„Zerlege, warum dieser Gewinn existiert, finde Bedingungen, die ihn töten, und verwandle diese Fehlerursachen in die nächsten Experimente.“
4. Menschliche Erfahrung verschwindet nicht — „hier riecht es interessant“ wird zur Startkarte
Natürlich kann die KI bei null beginnen.
Doch je größer der Suchraum, desto wertvoller wird menschliche Erfahrung für die Frage, wo das erste Explorationsbudget eingesetzt wird.
Wer jahrelang gelesen und Bausteine getestet hat, besitzt oft komprimiertes Wissen wie:
- allein schwach, vielleicht als Filter nützlich;
- nur in Trendregimen interessant;
- im Backtest schön, nach Kosten fragil;
- besser zum Verhindern schlechter Einstiege als zur Richtungsprognose;
- wirkt stark, ist aber wahrscheinlich auf einen Zeitraum konzentriert.
Das ist keine Wahrheitstabelle.
Es ist eine Vorinformation über den Suchraum.
Auch in der Wissenschaft gibt es ähnliche Strukturen. Co-Scientist aus dem Jahr 2026 startet von einem durch Forscher definierten Ziel und vorhandener Evidenz und erzeugt, kritisiert, rangiert und entwickelt Hypothesen wiederholt weiter, während Testzeit-Rechenaufwand skaliert wird.[7]
Im Trading kann der Mensch sagen: „Hier zuerst graben.“ Die KI untersucht dann Tausende benachbarte Zweige.
Erfahrung eignet sich besser als Budgetlenkung denn als Dogma.
5. Warum Kombinationen manuell zur Hölle werden
Nehmen wir 20 Bausteine.
Mit nur zwei Möglichkeiten — verwenden oder nicht verwenden — gibt es bereits:
2^20 = 1.048.576 Kombinationen.
Mit drei Möglichkeiten — nicht verwenden, normal verwenden, invertiert verwenden — entstehen:
3^20 = 3.486.784.401 Kombinationen.
In der Praxis testet niemand alles stumpf. Fachwissen beseitigt Unsinn früh.
Doch reale Forschung ergänzt Schwellenwerte, Uhrzeiten, Volatilität, Spread, Haltedauer, News-Ausschlüsse, Long/Short-Asymmetrie und Ausführungsannahmen.
Der alte Prozess:
„Was, wenn ich das auch ansehe? Was, wenn ich diesen Fall ausschließe? Nur in diesem Regime?“
war damit praktisch ein Mensch, der einen riesigen bedingten Suchbaum von Hand abläuft.
Dass dies Jahre dauert, ist nicht überraschend.
Die Tabellenkalkulation war unschuldig. Das Universum war zu groß.
6. Der wertvolle KI-Teil ist nicht Brute Force, sondern die Auswahl des nächsten Experiments
Ein guter Explorationsagent ändert den nächsten Test anhand des vorherigen Ergebnisses.
Besteht eine Strategie aus A+B+C+D, entfernt man die Bausteine einzeln.
- D entfernen ändert fast nichts → D könnte Dekoration sein.
- B ist allein schwach, aber A+B reduziert Drawdown deutlich → B könnte Filter statt Prognosesignal sein.
- C ist insgesamt schwach, aber bei hoher Volatilität stark → C könnte regimeabhängig sein.
Das Entfernen von Komponenten, um ihren Beitrag zu verstehen, wird häufig als Ablationstest bezeichnet.
Der Name ist weniger wichtig als das Ziel:
eine komplexe Strategie zerlegen und nur die Bausteine behalten, die wirklich Arbeit leisten.
Explorieren → scheitern → Fehlerursache klassifizieren → nächstes Experiment wählen.
Automatisiert man diese Schleife, wird das Modell eher zum Forschungsassistenten als zum reinen Optimierer.
7. Die größte Gefahr bleibt Overfitting — wer 4.000 Dinge testet, findet einen „glücklichen Genius“
Das ist der kritische Punkt in der Finanzforschung.
Wer 4.000 Strategien testet und nur die schönste zeigt, kann schlicht den glücklichsten historischen Zufall erwischt haben.
White formalisierte das Data-Snooping-Problem: Werden dieselben Daten wiederholt für Inferenz und Modellauswahl verwendet, können gute Resultate durch Zufall statt durch echte Überlegenheit entstehen.[1]
Mehrere Signale verschärfen das Problem.
Novy-Marx zeigte, dass Multi-Signal-Strategien starken Overfitting-Bias aufweisen können und dass selbst zufällige Signale ohne echte Vorhersagekraft nach Auswahl und Kombination hochsignifikant wirkende Backtests erzeugen können.[2]
Explorationskraft hat zwei Schneiden.
KI kann tausendmal schneller falsch liegen.
Und anschließend den schönsten Fehler auszeichnen.
Je größer die Suche, desto mehr muss Overfitting-Schutz Teil der Suchmaschine selbst sein.
8. Schutz beginnt damit, jeden Versuch zu protokollieren und einen finalen Datensatz aus der Auswahl herauszuhalten
Wenn Tausende Kandidaten untersucht wurden, gehören auch die Verlierer zur Evidenz.
Ein robuster Ablauf sollte mindestens enthalten:
- Jeden Versuch protokollieren. Was wurde geändert, wie viele Varianten gab es, warum wurden sie verworfen?
- Entdeckung und finale Bewertung trennen. Den finalen Datensatz während der Modellauswahl nicht ständig ansehen.
- Zeitlich nach vorne validieren. Auf älteren Daten entwickeln und auf späteren Daten per Walk-forward prüfen.
- Ausführung absichtlich verschlechtern. Spread, Gebühren, Slippage, Latenz und pessimistische Fill-Annahmen erhöhen.
- Parameter stören. Eine Strategie, die nur an einem magischen Schwellenwert lebt, ist verdächtig.
- Regime aufteilen. Prüfen, ob Gewinn nur aus einem Jahr, einer Sitzung, einer Volatilität, einer Richtung oder wenigen Trades stammt.
- Statistisch korrigieren, dass sehr viele Versuche gemacht wurden.
Der Deflated Sharpe Ratio, DSR, korrigiert die Sharpe-Interpretation für Auswahlverzerrung durch multiple Tests und für nicht normal verteilte Renditen.[8]
Die Probability of Backtest Overfitting, PBO, wurde speziell für Investment-Backtests vorgeschlagen und schätzt mit kombinatorisch symmetrischer Kreuzvalidierung die Wahrscheinlichkeit von Overfitting.[9]
Whites Reality Check behandelt Data Snooping über viele Kandidaten; Hansens SPA-Test wurde entwickelt, um leistungsfähiger und weniger empfindlich gegenüber schlechten oder irrelevanten Alternativen zu sein.[1][10]
Man muss die Abkürzungen nicht auswendig lernen.
Die Regel reicht:
Wenn der Gewinner nach 4.000 Versuchen auftaucht, bewerte ihn als Gewinner eines Turniers mit 4.000 Versuchen.
Und sobald man den angeblich versiegelten finalen Datensatz betrachtet und danach die Strategie ändert, ist dieser Datensatz nicht mehr unberührt.
9. Eine starke Architektur kann zwei KIs nutzen: eine findet Gewinner, die andere versucht sie zu töten
Die Rollen lassen sich trennen.
Explorations-KI
- erzeugt neue Bedingungen;
- kombiniert menschliche Hypothesen neu;
- sucht regimeabhängige Effekte;
- macht aus Fehlerursachen neue Experimente.
Falsifikations-KI
- verschlechtert Kosten;
- verzögert Fills;
- entfernt Tage;
- verschiebt Schwellenwerte;
- wechselt Zeitraum und Markt;
- wendet DSR, PBO, Reality Check und SPA an;
- prüft, ob Profit aus extrem wenigen Beobachtungen stammt.
Die erste sagt: „Gefunden.“
Die zweite fragt: „Wirklich?“
Überlebt die Strategie, kommt die nächste Runde.
In der Finanzforschung ist diese unangenehme Persönlichkeit Qualitätskontrolle.
Das Ziel sollte sich von „maximalem historischen Gewinn“ verschieben zu:
„einer Struktur, die verständlich und belastbar bleibt, nachdem Annahmen, Parameter, Kosten und Stichprobe vernünftig beschädigt wurden“.
10. Wenn ein neues Modell erscheint, suche die Fähigkeit, die gerade eine Mauer durchbrochen hat — nicht nur die Gesamtnote
Diese Idee reicht weit über Scalping hinaus.
Bei einer neuen KI können ein paar Prozentpunkte auf einem allgemeinen Benchmark weniger wichtig sein als eine seltsame Aufgabe, die plötzlich von nahezu unmöglich zu praktisch wechselt.
Die nützliche Frage lautet:
„Welche Arbeit war mit der vorherigen Generation wirtschaftlich unattraktiv und wird jetzt plötzlich machbar?“
Bei Astra hebt ARC-AGI-3 Exploration unbekannter Umgebungen, kompakte Weltmodelle, Zustandsbewahrung und effizientes Handeln hervor.[3]
Dann wird diese Fähigkeit mit realen Engpässen verbunden:
- Wo verlieren Menschen Zeit bei der Frage, was sie als Nächstes testen sollen?
- Wo gibt es Tausende überprüfbare Hypothesen?
- Lassen sich Erfolg und Misserfolg objektiv messen?
- Vergrößert Wiederholung die Arbeitskostendifferenz stark?
- Wird bessere Exploration zu Gewinn, Kostensenkung oder schnellerer F&E?
Je mehr dieser Punkte zusammenkommen, desto interessanter kann die Chance sein.
Auch die Wissenschaft bewegt sich in diese Richtung: Co-Scientist skaliert eine Schleife aus Hypothesen erzeugen, kritisieren, vergleichen und weiterentwickeln.[7]
Eine Modellveröffentlichung lässt sich daher als Schatzsuche betrachten:
„Welcher brutal mühsame menschliche Forschungsloop ist gerade maschinell skalierbar geworden?“
Kurz gesagt:
Der Mensch zeichnet die erste Karte. Die KI gräbt über die Karte hinaus. Die Statistik fragt, ob das Glänzende wirklich Gold ist.
Je stärker KI wird, desto wichtiger bleibt ein Skeptiker.
Dieser Skeptiker kann ebenfalls eine KI sein.
Quellen
- Halbert White — A Reality Check for Data Snooping, Econometrica 68(5), 2000 onlinelibrary.wiley.com
- Robert Novy-Marx — Backtesting Strategies Based on Multiple Signals, NBER Working Paper 21329, 2015 nber.org
- ARC Prize — OpenAI's GPT-6 Astra on ARC-AGI-3 (2026-09-03) arcprize.org
- ARC Prize — Announcing ARC-AGI-3 / ARC-AGI-3 documentation https://docs.arcprize.org/ arcprize.org
- OpenAI — How two settings tripled our ARC-AGI-3 scores (GPT-5.6 Sol) openai.com
- OpenAI — GPT-6 Astra: A new generation of intelligence openai.com
- Juraj Gottweis et al. — Accelerating scientific discovery with Co-Scientist, Nature, 2026 nature.com
- David H. Bailey & Marcos López de Prado — The Deflated Sharpe Ratio: Correcting for Selection Bias, Backtest Overfitting, and Non-Normality, 2014 doi.org
- David H. Bailey, Jonathan Borwein, Marcos López de Prado & Qiji Jim Zhu — The Probability of Backtest Overfitting, 2015 papers.ssrn.com
- Peter Reinhard Hansen — A Test for Superior Predictive Ability, Journal of Business & Economic Statistics 23(4), 2005 tandfonline.com
