Die Horrorvorstellung lautet: Name, Kosten, Werte, Text und Sonderlogik hunderte Male manuell eintragen.
Wenn Kartendaten jedoch strukturiert vorliegen und bereits eine brauchbare Open-Source-Battle-Engine existiert, ändert sich alles. Die DB wird gesammelt eingelesen, gemeinsame Effekte nutzen vorhandene Handler, und nur echte neue Mechaniken brauchen Sondercode.
In diesem Fall bot Beyond Decks bereits Daten, Decks, Seeds, Replays, Battle Sim, KI und Benchmarks.
Die Aufgabe war nicht, das Spiel neu zu bauen, sondern ein Forschungslabor und ein besseres Gehirn auf eine vorhandene Sandbox zu setzen.
1. Ohne Animationen ist eine Partie lächerlich kurz
Der echte Client verbraucht Zeit für Draw-Animation, Dragging, Voice, Evolution, Attacken, Damage-Anzeige und menschliches Nachdenken.
Der Simulator macht:
Zustand A
→ legale Aktionen
→ auswählen
→ aktualisieren
→ Zustand B
bis jemand verliert.
Teuer ist nicht die Präsentation, sondern wie weit die KI in die Zukunft schauen soll.
2. Der Basissimulator ist ernsthafte Technik, kein Spielzeug
Vorhanden sind deterministic seeds, replay inspection, target selection, tactical look-ahead, full-turn planning, lethal solver, Klassenmechaniken, Benchmarks, Coverage-Audits und Runtime-Checks.
Der Autor sagt gleichzeitig klar: Die KI ist kein perfektes Turnier-Orakel, sondern intermediate.
Perfekt für Forschung. Regeln, Karten, Seeds, Replay und Battle-Maschine existieren. Die interessanteste Lücke ist menschenähnliche Entscheidungsqualität.
3. 12.480 Spiele ergaben Royal nahe79,8%—große Samples verstärken auch Policy-Bias
Die Regelabdeckung war gut, aber Royal lag bei etwa79,8%, Witch bei25,6%.
Das beweist nicht, dass Royal objektiv unbesiegbar ist.
Wenn Royal mit „Follower spielen, Board gewinnen, Face angreifen“ funktioniert, während ein komplexes Deck Combo-Teile, Evolution und Hand ohne Zukunftsplanung verschwendet, bevorzugt die KI einfache Pläne.
Große Samples können eine falsche Policy extrem präzise messen.
4. Menschliches Wissen wurde als Denkgewohnheit eingebaut, nicht als Antworttabelle
Mulligan, Hold-Karten, Evolution, Hand-/Board-Platz, Wechsel zwischen Angriff und Verteidigung, gegnerische Power Turns, alternative Win Conditions, Lethal in2–3 Zügen und typische Fehler wurden strukturiert.
Als Scores:
hold_value +20
future_combo_value +30
opponent_counter_cost +25
zu frühe Nutzung -40
Der Guide lenkt die Suche.
5. Aktuell laufen 4.032 echte Spiele—2.016 sind A/B-Bedingungen
56 Gruppen × 2 Richtungen × 18 Seeds = 2.016 Bedingungen
Reference und human-prior spielen pro Bedingung je eine Partie. Der Motor verarbeitet4.032.
2.016 ist die Zahl der gleichen Prüfungsfragen für zwei KIs.
6. Vor dem großen Batch stoppen und validieren
Zuerst wurde die Regression behoben, dass Finisher zu früh gespielt wurden. Danach Smoke Tests mit echter DB und echten Decks.
Geprüft werden Coverage, Unsupported, Rule Gaps, DB-Hash, doppelte IDs, fehlende Referenzen und Corpus-Version.
Regel: Erst das Experiment validieren, dann Sample-Größe kaufen.
7. human-prior v1 ist noch nicht vollständig adaptiv
Dasselbe Ramp-Deck muss Ziele wechseln:
normal → ramp
nächster Zug tödlich → verteidigen
Gegner leer → angreifen
Finisher ohne Setup → halten
Setup fertig → einsetzen
Die KI muss jede Runde neu bestimmen, was jetzt am wichtigsten ist.
8. Adaptive AI wechselt ATTACK / SURVIVE / SETUP / RESOURCE / LETHAL
HP, Board, Hand, PP, Evolution, Druck, erwarteter Schaden und Combo-Readiness geben den Modi Scores.
Bei6HP gegen14 Schaden muss SURVIVE RESOURCE schlagen.
Adaptivität bedeutet jetzt spielen gegen später halten vergleichen.
9. 2–3 Züge voraus schauen, aber mit menschlichem Wissen beschneiden
50 legale Aktionen
→ Human Priors: 20
→ schneller Evaluator: 10
→ 2–3-Zug-Suche nur für Top10
+8 jetzt und nächster Zug tot muss gegen +3 jetzt mit Überleben verlieren.
10. Die versteckte Hand zu lesen wäre Cheat—modelliere „könnte er haben“
Leader, Archetyp, gespielte Karten, Restdeck, Handgröße und frühere Aktionen erzeugen mehrere plausible Welten.
AoE vorhanden 30%
nicht vorhanden 70%
Die gleiche Aktion wird über mehrere Welten bewertet.
So entsteht: „Vielleicht hat er es, also respektiere ich es etwas—aber nicht alles.“
11. Die Reihenfolge zählt—KI nicht mitten in 4.032 Spielen wechseln
v1 einfrieren
→ 4.032 beenden
→ Fehler analysieren
→ Adaptive v2
→ quick A/B
→ ~2.016 Bedingungen erneut
→ full ~12k
→ 40 Karten optimieren
→ Matchup-Diagnose
v2 soll aus beobachteten Fehlern entstehen.
12. Ziel ist keine CPU, die den Guide auswendig kennt, sondern eine, die ihn brechen darf
Menschliches Wissen, Game Tree, Zukunftsbewertung, Hidden-Hand-Wahrscheinlichkeiten und dynamische Ziele werden kombiniert.
Dann gilt: „Normalerweise ramp, aber verteidige wenn du stirbst“, „Normalerweise halten, aber bei Lethal alles ausgeben“, „Normalerweise entwickeln, aber gegen wahrscheinliches AoE Ressourcen behalten“.
Der Guide berät. Die Position entscheidet.
13. Das Muster gilt auch für andere Spiele—baue ein Siegeslabor statt das Spiel neu
Pokémon kann vorhandene Simulatoren für Team, Auswahl, Wechsel und Move-Entscheidungen nutzen. Kartenspiele für Deck, Mulligan, Ressourcen und Matchup-Policy.
Spiel neu bauen und Siegentscheidungen erforschen sind unterschiedliche Jobs.
Wenn ein guter Simulator existiert, nutze ihn.
Baue nicht das Stadion neu. Baue das Labor, das herausfindet, wie man darin gewinnt.
Und wenn Royal wieder fast80% erreicht:
„Ist dieser Bot wieder Klassenbester in ‘Einheit spielen, Face schlagen’?“
