1. Eigentlich wollte ich nur ins Gesicht stürmen, dann entstand ein Labor
Das Ziel war, mit KI das stärkste aktuelle Deck zu finden. Set 8, 826-Karten-Datenbank, Engine-Commit, Environment-Hash, legale Decks und Seeds wurden eingefroren. Der historische 12.480-Spiele-Baseline hatte rule coverage 100%, unsupported 0 und rule gap 0, trotzdem lieferte die rohe KI absurde Werte wie Sword ~79,8% und Rune ~25,6%.
Ein Fehler wird nicht wahr, nur weil man ihn zehntausendmal wiederholt.
2. Menschlicher Rat machte den Bot schwächer und Mittelwerte versteckten Brände
human-prior-v1 wurde mit 2.016 paired units / 4.032 games getestet: Baseline 50,99%, neu 49,36%, -1,64pt. Adaptive v2 gewann insgesamt +0,74pt, aber Runecraft verlor -6,25pt und riss den leader floor; T11 scheiterte ebenfalls, unter anderem mit Abysscraft -16,67pt.
Menschlicher Rat ist kontextabhängig; fixed weights können den Kontext töten. Ein guter Durchschnitt bedeutet nicht, dass keine Klasse brennt.
3. Die Ursachenanalyse fand auch Bugs im Forschungssystem
Ein nicht angeschlossener max_nodes=160-Vertrag und ein Actor/Fixed-Player-Perspektivfehler, der Kausalaussagen umkehrte, wurden behoben. Die Analyseplattform wurde besser, die breite Performance nicht.
Die Set-8-Policy-Forschung stoppte nach 20 Experimenten und 31.406 bestätigten Engine-Spielen bei PAUSED_COMPLETE_NO_PROMOTION: 439 discordant units, 0 vollständig erklärt, 11 teilweise, 428 ungelöst. human-prior-v1 blieb aktiv; der geplante 8.064-Spiele-final-unseen-holdout blieb versiegelt.
4. 52 Marktdecks spielten 46.900 Partien und erzeugten das „hirnlos-gegen-hirnlos“-Ranking
Der Corpus hatte 52 decks / 25 archetypes / 7 leaders. Marktanalyse: 46.900 Spiele; separates direktes 7×7: 1.512. Mittelwerte: Buff Forest 71,99%, Rally Sword 65,97%, Midrange Abyss 54,17%, Artifact Portal 54,17%, Ramp Dragon 53,70%, Evolution Haven 31,71%, Calgidensula Witch 18,29%.
Das sind simulator-direct-Werte, keine Ladder-Winrates. Decks, bei denen „jetzt gut“ später meist ebenfalls gut bleibt, wirkten leichter für die aktuelle KI.
5. In menschlichen Turnieren lebte Witch in einem anderen Universum
Beim Dexel Rising Cup #2 am 8. August 2026 waren 116 von 384 eingereichten Decks Hand Witch, etwa 30,2% und damit Platz eins. Calgidensula Witch wurde im direkten KI-7×7 mit 18,29% Letzter. Es dürfen nicht identische 40 Karten unterstellt werden, doch die Mensch-KI-Lücke ist groß.
Rally Sword war auf beiden Seiten stark und unterstützt die praktische Hypothese, dass fehlertolerante Strategien für Nicht-Experten robuster sein können.
6. Future Optionality: Regeln vorhanden, Reihenfolge und Pläne fast nicht
7 leaders / 24 mechanics wurden über RULE, STATE, VISIBILITY, IMMEDIATE VALUE, FUTURE VALUE, SEQUENCE, SEARCH und PLAN geprüft. Von 27.810 decisions / 118.575 root candidates hatten nur 8.878, 7,49%, expliziten future value. rule/state/immediate waren 24/24 supported, sequence fehlte bei 23/24, plan bei 20/24.
Witch zeigte Draw-Reihenfolge; Dragon zeigte, dass PP und Awakening zukünftige Optionen öffnen. Die 12 Dragon-MYOPIC_REVERSAL-Diagnosen = ramp 6 + Awakening 6 wurden nicht zu festen Boni.
7. Ein echter Drei-Züge-Closed-Loop-Planner wurde gebaut
Die Engine geht mindestens 3 future turn boundaries vor, führt nur eine Action aus, beobachtet draw/random/opponent action und plant neu. Hidden hand und future draw order werden nicht angesehen.
Ablation 56 Spiele: root actions 3.979/3.979, 3-turn completion 100%, hidden-info 0, replans 81.621, plan changes 35.821. Die Implementierung funktionierte, die Performance fiel um -25,0 bis -37,5pt gegen human-prior-v1. Weiter sehen hieß nur, weiter entfernt falsch zu liegen.
8. Leaf calibration trennte die Stelle des Ranking-Bruchs
3.979 root-action leaves, 1.009 unique leaves, 54.208 terminal rollout rows. Von 73 first divergences: leaf weighting 59, chance aggregation 12, opponent backup 2.
Damit wurde die Leaf-Bewertung zum Hauptverdächtigen. Von 12 alten Dragon-Proxies wechselte im echten Drei-Züge-Search nur 1/12 tatsächlich Richtung Ramp.
9. Learned value sagte besser voraus und wählte den besten Zug schlechter
Fresh holdout v1.1: 727 leaves / 104 roots / 22.768 terminal rollouts, sieben leaders. Brier 0,1144→0,0972 und pairwise 75,7→78,9% wurden besser.
Aber root argmax 59,6→39,4%, top2 73,1→64,4%, top3 82,7→76,0%, mean regret 4,42→5,29pt; Forest/Haven/Portal scheiterten an floors. HOLD_OFFLINE.
Bessere Wahrscheinlichkeitsvorhersage ist nicht dasselbe wie die beste Action zu wählen.
10. Jetzt wird rückwärts von Lethal gedacht
LETHAL ← Schaden ← PP ← Karten ← Spellboost/Awakening/Rally-Thresholds ← aktuelle Action. Ramp ist nicht wertvoll wegen „+8 Punkte“, sondern wenn ein konkreter Gewinnweg rechtzeitig 8PP verlangt.
Das Ziel erzeugt rückwärts Voraussetzungen; die echte Engine prüft den Weg vorwärts.
11. Auch der eigene Tod wird rückwärts analysiert
Von SELF_LOSS werden benötigter Gegnerschaden, Board-Schaden, zusätzlicher Hand-Schaden, Ward-Entfernung, PP und öffentliche Information zurückverfolgt. Jede Action wird danach bewertet, welche gegnerischen Gewinnwege sie kappt.
Absolute Sicherheit erzeugt eine KI, die heilt, bis sie höflich verliert. RISK_REQUIRED erlaubt riskante Nicht-Forced-Loss-Linien, wenn sichere Linien praktisch keine echte Gewinnchance lassen.
12. „Erzwungen“ braucht einen deklarierten Beweisbereich
Gewinnlabels: PROVEN_WIN_NOW, FORCED_WIN_FULLY_OBSERVABLE_SUBTREE, FORCED_WIN_WITHIN_ENUMERATED_RESPONSE_SET, ROBUST_WIN_BELIEF, CONDITIONAL_WIN. Verlust wird ebenso in proof, belief und conditional getrennt.
Im Proof Search gilt self=OR, opponent=AND. Gewissheit bei chance verlangt alle reachable outcomes. Hidden-hand truth, future draw order und strategy fusion sind verboten; neu geplant wird erst nach Beobachtung.
13. Action-Priorität wird zu Stufen-Gates statt mysteriöser Punktesumme
Reihenfolge: proven win now → fully observable forced → enumerated forced → vermeidbaren proof-level forced loss entfernen → expected final win probability maximieren → near-tie safety → robustness → route progress/cut → validated continuation value.
belief/conditional ist nicht forced. Nur Actions, die sowohl bei Gewinnchance als auch Verlust-Risiko schlechter sind, dürfen als strictly dominated entfernt werden.
14. Drei Züge sind Mindestdistanz, keine Mauer
Startkonfiguration H_MIN=3, selective H_MAX=5. Nur Branches mit ungelöstem lethal, forced response, wichtigem threshold, delayed payoff oder near tie werden verlängert.
Rollouts starten bei 32/candidate; unklare Top-Kandidaten erhalten 64→128→256. Roots werden UNIQUE_BEST / PRACTICAL_TIE / UNRESOLVED. epsilon 0,02/0,03/0,05 wird nur auf Development gewählt und vor dem neuen Holdout eingefroren.
15. Neue QC: selbstsichere Fehler fangen, bevor wir die stärkste KI jagen
Primary verlangt 0 hidden-info, future-draw, rule gap, strategy fusion, false proven, forced-scope mislabel, chance-completeness violation, lethal miss, avoidable forced loss und leakage. Danach folgen 7-leader coverage, argmax, mean/p90/p95 regret, leader floors und top2 best-set.
Brier/pairwise/calibration sind Secondary und retten keinen Primary-Fehler. Holdout v1.1 ist dauerhaft verbraucht.
Wir gaben dem Bot Zukunft und er wurde schwächer. Wir lehrten Wahrscheinlichkeiten: Vorhersage besser, beste Action schlechter. Deshalb denkt er künftig von Gewinn und Verlust rückwärts und nennt nur das „erzwungen“, was sein Beweisbereich wirklich trägt.
Bauen wir die stärkste KI mit KI. Im Moment ist vielleicht die QC stärker als der Spielbot — das ist vermutlich gesund.
共通データ付録 / Shared data appendix
- Fixed Set 8 card DB: 826 cards
- Historical baseline: 12,480 engine games
- Policy research: 31,406 confirmed actual engine games —
PAUSED_COMPLETE_NO_PROMOTION - Active policy:
human-prior-v1 - Market corpus: 52 decks / 25 archetypes / 7 leaders
- Market analysis: 46,900 actual engine games
- Direct recommended 7×7: 1,512 games
- Future Optionality: 27,810 decisions / 118,575 root candidates / explicit future-value 7.49%
- Mechanics audit: sequence MISSING 23/24; plan MISSING 20/24
- Dragon MYOPIC_REVERSAL: 12 = ramp 6 + Awakening 6
- Three-turn Ablation: 56 actual engine games; root 3,979/3,979; completion 100%; replans 81,621; plan changes 35,821
- Leaf calibration: 1,009 unique leaves / 54,208 terminal rollout rows; first divergences 59 leaf + 12 chance + 2 opponent backup
- Learned holdout v1.1: 727 leaves / 104 roots / 22,768 terminal rollouts
- Learned metrics: Brier 0.1144→0.0972; argmax 59.6%→39.4%; pairwise 75.7%→78.9%; regret 4.42pt→5.29pt
- Current research status:
HOLD_OFFLINE; learned value not connected - Existing final holdout:
NOT_RUN
Research references
- Allis, van der Meulen & van den Herik (1994), Proof-Number Search — https://doi.org/10.1016/0004-3702(94)90004-3
- Allis, van den Herik & Huntjens (1993), Go-Moku / Threat-Space Search — https://aaai.org/papers/0001-fs93-02-001-go-moku-solved-by-new-search-techniques/
- Silver & Veness (2010), POMCP — https://papers.nips.cc/paper/2010/hash/edfbe1afcf9246bb0d40eb4d8027d90f-Abstract.html
- Cowling, Powley & Whitehouse (2012), ISMCTS — https://doi.org/10.1109/TCIAIG.2012.2200894
- Elmachtoub & Grigas, Smart Predict-then-Optimize — https://doi.org/10.1287/mnsc.2020.3922
- Cao et al. (2007), Listwise Learning to Rank — https://doi.org/10.1145/1273496.1273513
- Garivier & Kaufmann (2016), Best-Arm Identification — https://proceedings.mlr.press/v49/garivier16a.html
- Chatterjee et al. (2020), Lexicographic Reachability-Safety — https://arxiv.org/abs/2005.04018


