1. Eigentlich wollten wir nur ins Gesicht schlagen, dann entstand ein Forschungslabor
Die ursprüngliche Frage war simpel: Welches Deck ist aktuell am stärksten? Öffentliche Listen sammeln, Regeln einfrieren, CPUs zehntausende Spiele machen lassen und das Ranking lesen.
Dann kam die erste Wahrheit: Regeln korrekt auszuführen ist nicht dasselbe wie stark zu spielen. Set 8 wurde mit 826 Karten, Engine-Commit, Environment-Hash, legalen Decks und Seeds fixiert. Der historische Baseline-Lauf hatte 12.480 Spiele, 100% Rule Coverage, 0 Unsupported und 0 Rule Gaps. Trotzdem lieferte die rohe KI ungefähr Sword 79,8%, Forest 63,7%, Dragon 60,9%, Rune 25,6%.
Zehntausend Wiederholungen machen einen Fehler nicht wahr; sie machen ihn nur industriell reproduzierbar.
2. Menschliche Ratschläge machten den Bot schwächer
human-prior-v1 enthielt normale Prinzipien: wichtige Ressourcen halten, Setup respektieren, Win Conditions und Evolutionsressourcen schützen. Das exakte A/B umfasste 2.016 paired units und 4.032 engine games. Baseline 50,99%; human-prior-v1 49,36%; Delta -1,64pt.
Die KI hörte auf Menschen und wurde schlechter.
Menschlicher Rat ist konditional. „Halte diese Karte“ ist falsch, wenn man sonst sofort stirbt. Fixed weights bewahren den Satz und töten den Kontext.
3. Adaptive v2 verbesserte den Durchschnitt und zerstörte Witch
Adaptive v2 wechselte zwischen LETHAL, SURVIVE, STABILIZE, SETUP, RESOURCE und PRESSURE und ergänzte kurze Suche sowie Future Value. Insgesamt +0,74pt gegenüber v1, aber Runecraft -6,25pt und damit unter dem preregistrierten Leader-Floor -5pt. REJECT.
T11 war +0,30 gegenüber v1, aber -2,38 gegenüber reference-v5 und Abyss -16,67. Ebenfalls REJECT.
Der Durchschnitt bestand; ein Fach stand in Flammen.
4. Bei der Ursachenanalyse wurden zuerst die Forscher festgenommen
Ein echter Bug: max_nodes=160 war nicht an den Planner angeschlossen; 9.067 Entscheidungen überschritten das nominelle Limit. Die Korrektur verbesserte die breite Performance nicht.
Dann ein Actor-Attribution-Bug: Eine Intervention „loss→win“ war aus Sicht des fixed player normalisiert worden. Für den Actor, dessen Aktion tatsächlich verändert wurde, war es win→loss. Die Untersuchung hatte das Opfer verhaftet.
Actor, Direction und Invariants wurden repariert. Die Performance-Ursache blieb ungelöst.
5. Nach 31.406 Spielen wurde „ungeklärt“ zu einem legitimen Ergebnis
Die Set-8-Policy-Forschung endete mit 20 Experimenten und 31.406 bestätigten actual engine games. Von 439 discordant units waren 0 Performance-Ursachen vollständig kausal erklärt, 11 teilweise, 428 unresolved.
Status PAUSED_COMPLETE_NO_PROMOTION, active weiterhin human-prior-v1, geplantes finales unseen holdout mit 8.064 Spielen unberührt.
Der wichtigste Erfolg war keine Super-KI, sondern ein System, das eine KI nicht nur wegen einer hübschen Teilgrafik promoted.
6. Danach kämpften 52 Marktdecks 46.900 Spiele
Der Markt-Corpus enthielt 52 Decks, 25 Archetypen und 7 Leader. Quick/broad, lokale 1–3-Karten-Optimierung, unseen-seed ranking und Traces ergaben 46.900 actual engine games.
Die sieben Empfehlungen spielten ein direktes Round Robin: 21 ungeordnete Paare, 1.512 Games, 72 je Nicht-Diagonal-Zelle, 756 reference-v5 und 756 human-prior-v1, first/second ebenfalls 756/756. Coverage 100%, keine Unsupported-, Rule-Gap- oder Hidden-Info-Verletzungen.
7. Das „hirnlos-gegen-hirnlos-Ranking“ entstand
| Rang | Deck | 7×7-Mittel | Schlechtestes Matchup |
|---|---|---|---|
| 1 | Buff Forest | 71,99% | Abyss 59,72% |
| 2 | Rally Sword | 65,97% | Forest 31,94% |
| 3 | Midrange Abyss | 54,17% | 40,3% |
| 4 | Artifact Portal | 54,17% | 36,1% |
| 5 | Ramp Dragon | 53,70% | Forest 25,0% |
| 6 | Evolution Haven | 31,71% | Dragon 12,5% |
| 7 | Calgidensula Witch | 18,29% | Forest 1,4% |
Decks, bei denen „jetzt stark spielen“ meist auch später gut bleibt, sind für die aktuelle KI leicht. Decks, die Tempo opfern, um in zwei oder drei Zügen zu explodieren, sind schwerer.
8. Im Menschenturnier lebte Witch in einem anderen Universum
Dexel Rising Cup #2 am 8. August 2026: 64 Teams, 192 Spieler, 384 Decks. Hand Witch erschien 116-mal, rund 30,2% des Feldes; AF/Storm Portal 52, Evolution Haven 34, Rally/Evolution Sword 29, Ramp Dragon 25.
Menschen behandelten Witch als Top-Meta. Calgidensula Witch der KI wurde im direkten 7×7 mit 18,29% Letzter. Man darf nicht identische 40-Karten-Listen unterstellen, aber die Human-vs-AI-Lücke ist enorm.
Rally Sword war in beiden Welten stark. Grobe Heuristik: stark mit einfacher KI + stark mit Experten kann auf hohe Fehlertoleranz hinweisen.
9. Future-Optionality-Audit
24 Mechaniken aller sieben Leader wurden über RULE, STATE, VISIBILITY, IMMEDIATE VALUE, FUTURE VALUE, SEQUENCE, SEARCH und PLAN geprüft.
Von 27.810 Decisions und 118.575 Root Candidates hatten nur 8.878 —7,49%— expliziten Future Value. Rule/state/immediate waren 24/24 SUPPORTED. Sequence war 23/24 MISSING, Plan 20/24 MISSING.
Die KI kennt Regeln und unmittelbaren Wert, aber kaum Reihenfolge und langfristige Pläne.
10. Witch: Spellboost kennen heißt Spellboost nicht verstehen
Spellboost hatte Rule/State, aber Visibility/Future Value waren PARTIAL und Sequence/Plan MISSING. DRAW → SPELL unterscheidet sich von SPELL → DRAW: Eine zuerst gezogene Karte kann den späteren Boost erhalten; eine später gezogene bekommt den bereits vergangenen Boost nicht rückwirkend.
12 synthetische Fixtures: DRAW_FIRST_BETTER 4, SPELL_FIRST_BETTER 0, EQUIVALENT 8. 50 reale repräsentative States wurden insgesamt STATE_DEPENDENT klassifiziert. Also nicht „immer zuerst ziehen“, sondern nach der Beobachtung neu planen.
11. Dragon: +1 Max-PP kauft zukünftige Aktionsrechte
Ramp kann jetzt Tempo verlieren, aber teure Karten, Multi-Card-Turns, Heilung, Removal und Finisher freischalten. 6→7 überschreitet außerdem Awakening.
Das Audit fand 12 Dragoncraft MYOPIC_REVERSAL: 6 Ramp + 6 Awakening. Immediate Control lag zunächst vorne, diagnostische t+2 Continuations konnten die Reihenfolge drehen. Daraus darf kein fixer Ramp-Bonus werden.
12. Die anderen fünf Klassen hatten eigene Varianten
Forest: Combo Thresholds, Generation, Bounce Order. Sword: Rally 9→10 und Multi-Summon. Abyss: Shadows, Inhalt des Reanimate Pools, HP als Ressource. Haven: Countdown und Act, wo das Nicht-Benutzen eine zukünftige Wahl erhält. Portal: Zero-Cost Tokens und Copy lassen den Sequence Space explodieren.
EP, SEP, Extra PP und Hand-/Board-/Leader-Area-Limits sind ebenfalls Tauschgeschäfte zwischen Gegenwartswert und zukünftiger Optionalität.
13. Deshalb bauten wir einen echten Three-Turn Closed-Loop Planner
Der Planner musste die Engine mindestens drei zukünftige Turn Boundaries vorantreiben, nicht drei Aktionen. Er fixierte auch kein Drei-Züge-Skript: eine Aktion ausführen, Draw/Generation/Random beobachten, dann drei Züge vom neuen State neu rechnen. Struktur ähnlich Receding Horizon / MPC.
Keine Einsicht in zukünftige eigene Draw Order oder echte gegnerische Hand; stattdessen Belief Sampling. FutureRelevantState hielt Spellboost, Extra PP, Countdown, Act, Rally, Shadows und Destroyed-Follower-Pool fest. Kein fixer Optionality-, Witch- oder Ramp-Bonus.
14. Implementierung erfolgreich. Performance stürzte ab.
Ablation: 56 actual engine games. 3.979 / 3.979 Root Actions bewertet, Three-Turn Completion 100%, Hidden-Info Violations 0. Observation Replans 81.621, Plan Changes 35.821.
Aber base/widen lagen -37,5pt gegen human-prior-v1, replan/state/robust -25,0pt. Alle Kandidaten brachen den preregistrierten -10pt-Floor. Korrektes Urteil: REJECT_ACTIVE_UNCHANGED. Targeted, Broad, Market 7×7 und Final Holdout blieben NOT_RUN.
Wir hatten eine KI gebaut, die weiter sieht und selbstbewusster falsch liegt.
15. Das beweist nicht, dass drei Züge genügen
Entfernt wurde nur der Verdacht „die Implementierung erreicht gar keine drei Züge“. Strategische Suffizienz von drei Zügen bleibt unbewiesen. Base -37,5→Replan -25,0 ist nur ein Richtungssignal, weil jeder Kandidat nur 8 Conditions hatte.
Die 12 alten Dragon-Reversals wurden mit echter Three-Turn-Engine-Suche wiederholt; nur 1/12 wechselte tatsächlich Richtung Ramp. Der alte Proxy war kein Ground Truth.
Neue Hauptverdächtige: Terminal/Leaf Evaluator und Opponent Response Model.
16. Nächste Frage: „Du sagst, diese Zukunft ist -150. Wie viele von 100 Spielen gewinnt man wirklich von hier?“
Die nächste Runde ändert die Gewichte noch nicht. Three-Turn Leafs werden eingefroren und der Evaluator vollständig zerlegt: Raw Feature→Normalization→Weight→Contribution, besonders für extreme -150-Werte.
Dann wird derselbe Leaf 32–128-mal bis zum Terminal ausgespielt, um empirische Win Rates zu erhalten. Raw Score ist keine Wahrscheinlichkeit: Score→Probability kalibrieren, dann Brier Score, Log Loss und Reliability messen. Ranking separat mit Spearman, Kendall, Same-Root Argmax Accuracy, Pairwise Concordance und Decision Regret.
Opponent Responses werden zwischen human-prior-v1, reference-v5 und search-based Stress Response gecross-played. So lassen sich schlechtes Leaf Scoring, falsches Gegner-Modell, falsche Skalen/Gewichte, fehlende State-Repräsentation oder ein noch zu kurzer Horizont trennen.
17. Fazit: Die Zukunft ist sichtbar, der Bewertungsbogen verdächtig
Die KI ist von „was ist jetzt stark?“ zu „ich simuliere wirklich drei Züge“ gekommen, aber ihrer Bewertung der gesehenen Zukunft können wir noch nicht vertrauen.
Der Weg führte über Sword 79,8%, kontraproduktiven Menschenrat, kaputte Witch-Policies, Actor-Bug, 46.900 Marktspiele, Future Optionality und echte Three-Turn-Foresight.
Dann wurde die KI schwächer.
Wir wollten nur ins Gesicht schlagen. Das nächste Fach heißt Brier Score und Leaf-Value Calibration. Shadowverse ist offenbar eine Graduiertenschule.
Datenanhang
- Set 8 card DB: 826
- Baseline: 12.480 games
- Policy research: 31.406 actual engine games
- Status:
PAUSED_COMPLETE_NO_PROMOTION - Active:
human-prior-v1 - Market: 52 decks / 25 archetypes / 7 leaders
- Market analysis: 46.900 games
- Direct 7×7: 1.512 games
- Optionality: 27.810 decisions / 118.575 candidates / 7,49%
- Sequence MISSING 23/24; Plan MISSING 20/24
- Dragon reversals: 12 = ramp 6 + Awakening 6
- RH3 Ablation: 56 games
- Root coverage 3.979/3.979; completion 100%
- Replans 81.621; plan changes 35.821
- Verdict:
REJECT_ACTIVE_UNCHANGED - Final holdout:
NOT_RUN
Quellen (6)
- Shadowverse: Worlds Beyond offizielles Deck Portal
- Dexel Rising Cup #2
- Silver & Veness (2010), POMCP
- Cowling, Powley & Whitehouse (2012), ISMCTS
- Model Predictive Control / Receding Horizon Control
- Brier Score, Reliability und clustered validation


