Wir gaben einer „hirnlosen“ KI drei Züge Zukunftssicht — und sie wurde noch schwächer: 46.900 Markt-Simulationsspiele plus separate KI-Forschung zeigen das Problem „Zukunft sehen, Zukunft falsch bewerten“

Thema: Shadowverse: Worlds Beyond

Die ursprüngliche Frage war simpel: Welches Deck ist aktuell am stärksten?

So funktionieren die Lesehilfen

Anhören liest den Artikel vor. Schnelllesen zeigt Wortgruppen im gewählten Tempo. Sprachübungen vergleichen verfügbare Übersetzungen. Speichern legt ein Lesezeichen in diesem Browser an, das du in der Merkliste des Players wiederfindest.

Artikel teilen
Werbung
Werbung

1. Eigentlich wollten wir nur ins Gesicht schlagen, dann entstand ein Forschungslabor

Die ursprüngliche Frage war simpel: Welches Deck ist aktuell am stärksten? Öffentliche Listen sammeln, Regeln einfrieren, CPUs zehntausende Spiele machen lassen und das Ranking lesen.

Dann kam die erste Wahrheit: Regeln korrekt auszuführen ist nicht dasselbe wie stark zu spielen. Set 8 wurde mit 826 Karten, Engine-Commit, Environment-Hash, legalen Decks und Seeds fixiert. Der historische Baseline-Lauf hatte 12.480 Spiele, 100% Rule Coverage, 0 Unsupported und 0 Rule Gaps. Trotzdem lieferte die rohe KI ungefähr Sword 79,8%, Forest 63,7%, Dragon 60,9%, Rune 25,6%.

Zehntausend Wiederholungen machen einen Fehler nicht wahr; sie machen ihn nur industriell reproduzierbar.

2. Menschliche Ratschläge machten den Bot schwächer

human-prior-v1 enthielt normale Prinzipien: wichtige Ressourcen halten, Setup respektieren, Win Conditions und Evolutionsressourcen schützen. Das exakte A/B umfasste 2.016 paired units und 4.032 engine games. Baseline 50,99%; human-prior-v1 49,36%; Delta -1,64pt.

Die KI hörte auf Menschen und wurde schlechter.

Menschlicher Rat ist konditional. „Halte diese Karte“ ist falsch, wenn man sonst sofort stirbt. Fixed weights bewahren den Satz und töten den Kontext.

3. Adaptive v2 verbesserte den Durchschnitt und zerstörte Witch

Adaptive v2 wechselte zwischen LETHAL, SURVIVE, STABILIZE, SETUP, RESOURCE und PRESSURE und ergänzte kurze Suche sowie Future Value. Insgesamt +0,74pt gegenüber v1, aber Runecraft -6,25pt und damit unter dem preregistrierten Leader-Floor -5pt. REJECT.

T11 war +0,30 gegenüber v1, aber -2,38 gegenüber reference-v5 und Abyss -16,67. Ebenfalls REJECT.

Der Durchschnitt bestand; ein Fach stand in Flammen.

4. Bei der Ursachenanalyse wurden zuerst die Forscher festgenommen

Ein echter Bug: max_nodes=160 war nicht an den Planner angeschlossen; 9.067 Entscheidungen überschritten das nominelle Limit. Die Korrektur verbesserte die breite Performance nicht.

Dann ein Actor-Attribution-Bug: Eine Intervention „loss→win“ war aus Sicht des fixed player normalisiert worden. Für den Actor, dessen Aktion tatsächlich verändert wurde, war es win→loss. Die Untersuchung hatte das Opfer verhaftet.

Actor, Direction und Invariants wurden repariert. Die Performance-Ursache blieb ungelöst.

5. Nach 31.406 Spielen wurde „ungeklärt“ zu einem legitimen Ergebnis

Die Set-8-Policy-Forschung endete mit 20 Experimenten und 31.406 bestätigten actual engine games. Von 439 discordant units waren 0 Performance-Ursachen vollständig kausal erklärt, 11 teilweise, 428 unresolved.

Status PAUSED_COMPLETE_NO_PROMOTION, active weiterhin human-prior-v1, geplantes finales unseen holdout mit 8.064 Spielen unberührt.

Der wichtigste Erfolg war keine Super-KI, sondern ein System, das eine KI nicht nur wegen einer hübschen Teilgrafik promoted.

6. Danach kämpften 52 Marktdecks 46.900 Spiele

Der Markt-Corpus enthielt 52 Decks, 25 Archetypen und 7 Leader. Quick/broad, lokale 1–3-Karten-Optimierung, unseen-seed ranking und Traces ergaben 46.900 actual engine games.

Die sieben Empfehlungen spielten ein direktes Round Robin: 21 ungeordnete Paare, 1.512 Games, 72 je Nicht-Diagonal-Zelle, 756 reference-v5 und 756 human-prior-v1, first/second ebenfalls 756/756. Coverage 100%, keine Unsupported-, Rule-Gap- oder Hidden-Info-Verletzungen.

7. Das „hirnlos-gegen-hirnlos-Ranking“ entstand

Rang Deck 7×7-Mittel Schlechtestes Matchup
1 Buff Forest 71,99% Abyss 59,72%
2 Rally Sword 65,97% Forest 31,94%
3 Midrange Abyss 54,17% 40,3%
4 Artifact Portal 54,17% 36,1%
5 Ramp Dragon 53,70% Forest 25,0%
6 Evolution Haven 31,71% Dragon 12,5%
7 Calgidensula Witch 18,29% Forest 1,4%

Decks, bei denen „jetzt stark spielen“ meist auch später gut bleibt, sind für die aktuelle KI leicht. Decks, die Tempo opfern, um in zwei oder drei Zügen zu explodieren, sind schwerer.

8. Im Menschenturnier lebte Witch in einem anderen Universum

Dexel Rising Cup #2 am 8. August 2026: 64 Teams, 192 Spieler, 384 Decks. Hand Witch erschien 116-mal, rund 30,2% des Feldes; AF/Storm Portal 52, Evolution Haven 34, Rally/Evolution Sword 29, Ramp Dragon 25.

Menschen behandelten Witch als Top-Meta. Calgidensula Witch der KI wurde im direkten 7×7 mit 18,29% Letzter. Man darf nicht identische 40-Karten-Listen unterstellen, aber die Human-vs-AI-Lücke ist enorm.

Rally Sword war in beiden Welten stark. Grobe Heuristik: stark mit einfacher KI + stark mit Experten kann auf hohe Fehlertoleranz hinweisen.

9. Future-Optionality-Audit

24 Mechaniken aller sieben Leader wurden über RULE, STATE, VISIBILITY, IMMEDIATE VALUE, FUTURE VALUE, SEQUENCE, SEARCH und PLAN geprüft.

Von 27.810 Decisions und 118.575 Root Candidates hatten nur 8.878 —7,49%— expliziten Future Value. Rule/state/immediate waren 24/24 SUPPORTED. Sequence war 23/24 MISSING, Plan 20/24 MISSING.

Die KI kennt Regeln und unmittelbaren Wert, aber kaum Reihenfolge und langfristige Pläne.

10. Witch: Spellboost kennen heißt Spellboost nicht verstehen

Spellboost hatte Rule/State, aber Visibility/Future Value waren PARTIAL und Sequence/Plan MISSING. DRAW → SPELL unterscheidet sich von SPELL → DRAW: Eine zuerst gezogene Karte kann den späteren Boost erhalten; eine später gezogene bekommt den bereits vergangenen Boost nicht rückwirkend.

12 synthetische Fixtures: DRAW_FIRST_BETTER 4, SPELL_FIRST_BETTER 0, EQUIVALENT 8. 50 reale repräsentative States wurden insgesamt STATE_DEPENDENT klassifiziert. Also nicht „immer zuerst ziehen“, sondern nach der Beobachtung neu planen.

11. Dragon: +1 Max-PP kauft zukünftige Aktionsrechte

Ramp kann jetzt Tempo verlieren, aber teure Karten, Multi-Card-Turns, Heilung, Removal und Finisher freischalten. 6→7 überschreitet außerdem Awakening.

Das Audit fand 12 Dragoncraft MYOPIC_REVERSAL: 6 Ramp + 6 Awakening. Immediate Control lag zunächst vorne, diagnostische t+2 Continuations konnten die Reihenfolge drehen. Daraus darf kein fixer Ramp-Bonus werden.

12. Die anderen fünf Klassen hatten eigene Varianten

Forest: Combo Thresholds, Generation, Bounce Order. Sword: Rally 9→10 und Multi-Summon. Abyss: Shadows, Inhalt des Reanimate Pools, HP als Ressource. Haven: Countdown und Act, wo das Nicht-Benutzen eine zukünftige Wahl erhält. Portal: Zero-Cost Tokens und Copy lassen den Sequence Space explodieren.

EP, SEP, Extra PP und Hand-/Board-/Leader-Area-Limits sind ebenfalls Tauschgeschäfte zwischen Gegenwartswert und zukünftiger Optionalität.

13. Deshalb bauten wir einen echten Three-Turn Closed-Loop Planner

Der Planner musste die Engine mindestens drei zukünftige Turn Boundaries vorantreiben, nicht drei Aktionen. Er fixierte auch kein Drei-Züge-Skript: eine Aktion ausführen, Draw/Generation/Random beobachten, dann drei Züge vom neuen State neu rechnen. Struktur ähnlich Receding Horizon / MPC.

Keine Einsicht in zukünftige eigene Draw Order oder echte gegnerische Hand; stattdessen Belief Sampling. FutureRelevantState hielt Spellboost, Extra PP, Countdown, Act, Rally, Shadows und Destroyed-Follower-Pool fest. Kein fixer Optionality-, Witch- oder Ramp-Bonus.

14. Implementierung erfolgreich. Performance stürzte ab.

Ablation: 56 actual engine games. 3.979 / 3.979 Root Actions bewertet, Three-Turn Completion 100%, Hidden-Info Violations 0. Observation Replans 81.621, Plan Changes 35.821.

Aber base/widen lagen -37,5pt gegen human-prior-v1, replan/state/robust -25,0pt. Alle Kandidaten brachen den preregistrierten -10pt-Floor. Korrektes Urteil: REJECT_ACTIVE_UNCHANGED. Targeted, Broad, Market 7×7 und Final Holdout blieben NOT_RUN.

Wir hatten eine KI gebaut, die weiter sieht und selbstbewusster falsch liegt.

15. Das beweist nicht, dass drei Züge genügen

Entfernt wurde nur der Verdacht „die Implementierung erreicht gar keine drei Züge“. Strategische Suffizienz von drei Zügen bleibt unbewiesen. Base -37,5→Replan -25,0 ist nur ein Richtungssignal, weil jeder Kandidat nur 8 Conditions hatte.

Die 12 alten Dragon-Reversals wurden mit echter Three-Turn-Engine-Suche wiederholt; nur 1/12 wechselte tatsächlich Richtung Ramp. Der alte Proxy war kein Ground Truth.

Neue Hauptverdächtige: Terminal/Leaf Evaluator und Opponent Response Model.

16. Nächste Frage: „Du sagst, diese Zukunft ist -150. Wie viele von 100 Spielen gewinnt man wirklich von hier?“

Die nächste Runde ändert die Gewichte noch nicht. Three-Turn Leafs werden eingefroren und der Evaluator vollständig zerlegt: Raw Feature→Normalization→Weight→Contribution, besonders für extreme -150-Werte.

Dann wird derselbe Leaf 32–128-mal bis zum Terminal ausgespielt, um empirische Win Rates zu erhalten. Raw Score ist keine Wahrscheinlichkeit: Score→Probability kalibrieren, dann Brier Score, Log Loss und Reliability messen. Ranking separat mit Spearman, Kendall, Same-Root Argmax Accuracy, Pairwise Concordance und Decision Regret.

Opponent Responses werden zwischen human-prior-v1, reference-v5 und search-based Stress Response gecross-played. So lassen sich schlechtes Leaf Scoring, falsches Gegner-Modell, falsche Skalen/Gewichte, fehlende State-Repräsentation oder ein noch zu kurzer Horizont trennen.

17. Fazit: Die Zukunft ist sichtbar, der Bewertungsbogen verdächtig

Die KI ist von „was ist jetzt stark?“ zu „ich simuliere wirklich drei Züge“ gekommen, aber ihrer Bewertung der gesehenen Zukunft können wir noch nicht vertrauen.

Der Weg führte über Sword 79,8%, kontraproduktiven Menschenrat, kaputte Witch-Policies, Actor-Bug, 46.900 Marktspiele, Future Optionality und echte Three-Turn-Foresight.

Dann wurde die KI schwächer.

Wir wollten nur ins Gesicht schlagen. Das nächste Fach heißt Brier Score und Leaf-Value Calibration. Shadowverse ist offenbar eine Graduiertenschule.

Datenanhang

  • Set 8 card DB: 826
  • Baseline: 12.480 games
  • Policy research: 31.406 actual engine games
  • Status: PAUSED_COMPLETE_NO_PROMOTION
  • Active: human-prior-v1
  • Market: 52 decks / 25 archetypes / 7 leaders
  • Market analysis: 46.900 games
  • Direct 7×7: 1.512 games
  • Optionality: 27.810 decisions / 118.575 candidates / 7,49%
  • Sequence MISSING 23/24; Plan MISSING 20/24
  • Dragon reversals: 12 = ramp 6 + Awakening 6
  • RH3 Ablation: 56 games
  • Root coverage 3.979/3.979; completion 100%
  • Replans 81.621; plan changes 35.821
  • Verdict: REJECT_ACTIVE_UNCHANGED
  • Final holdout: NOT_RUN

Quellen (6)

  • Shadowverse: Worlds Beyond offizielles Deck Portal
  • Dexel Rising Cup #2
  • Silver & Veness (2010), POMCP
  • Cowling, Powley & Whitehouse (2012), ISMCTS
  • Model Predictive Control / Receding Horizon Control
  • Brier Score, Reliability und clustered validation

WerbungBücher zu diesem Thema

Dieser Artikel enthält Affiliate-Links (Werbung). Mehr zur Werbung Als Amazon-Partner verdiene ich an qualifizierten Verkäufen. As an Amazon Associate I earn from qualifying purchases.

Werbung

Noch einer? Etwas Lustiges?

Wo Sie schon fertig sind: ein paar Geschichten zum selben Thema und ein paar ganz andere, die Spaß machen.

  1. Ähnliches ThemaVerschwende keine 30 Minuten auf eine 100-Yen-EntscheidungDie Stärke von „Idee gehabt, sofort gemacht“ liegt in Risikokompression und weniger Handlungsreibung
  2. Wenn ein Wutanfall zur Suchanfrage wirdMenschen, die jede seltsame Frage mit KI zerlegen, passen erstaunlich gut zu SEO
  3. Ganz anders, aber unterhaltsamWenn „ADHS ist eigentlich Hochleistung“ zur Gundam-Spezifikation wird: der selbstreferenzielle Fehler, Stereotype mit neuen Stereotypen zu bekämpfen
  4. Wie holt man beim Shabu-yo-Abendessen „sein Geld wieder raus“? Sind 12 Teller Rind wirklich die Grenze – und warum heißen Gusto und Shabu-yo unterschiedlich, obwohl beide zu Skylark gehören?
  5. Warum es nach dem Studium schwerer wird, Freunde zu findenBegegnungen passieren nicht mehr automatisch, sondern brauchen bewusst geschaffene Wege
  6. Löwenzahn essen garantiert noch lange keinen Ruhmwas Masato Sakais harte Anfangsjahre über einen Schauspielmarkt mit viel zu wenigen Plätzen zeigen

Heute lesen

Jeder Artikel beantwortet eine Frage, die sich Leser dieses Artikels oft als Nächstes stellen.

Alle Artikel durchsuchenMehr zu Karten- und Brettspiele

Weitere Artikel finden

Alle Artikel

Mendoi-chan

Wer diese Seite betreibt

Mendoi-chan

Sie macht Reibungen im Beruf und Alltag als klare Struktur und konkrete nächste Schritte verständlich.

Werbung

Neueste Artikel

  1. 1Der Unterwäsche stehlende Priester wird geschnappt, aber der „Zucht-Onkel“ bleibt ein Held? Der Manga kürzt die speziellsten Fetische, während der Webroman sogar „Eingebildete Schwangerschaft“ freischaltet
  2. 2Die Menschheit gewinnt das nicht – Ich behandelte PRAGMATA wie ein Mondmuseum und bekam plötzlich Angst vor der industriellen Leistungsfähigkeit einer Maschinenzivilisation
  3. 3Für Menschen, denen Allein-Unternehmungen schwerfallen: „Wenn niemand mitkommt, gehe ich nicht“ zerlegen und ein eigenes „Solo-Aktions-OS“ bauen
  4. 4Kurzfassung: Die Mondbasis hielt länger durch als mein Steuerungssystem
  5. 5Eine 50-jährige Hypothek macht das Haus nicht billiger — Schulden, Zinsrisiko und Japans FSA-Aufsicht

Das könnte Sie interessieren

Werbung