Bauen wir die stärkste KI mit KI — der Shadowverse-WB-Bot, der mit Drei-Züge-Voraussicht schwächer wurde, plant nun rückwärts von Gewinnwegen, Verlustwegen und beweisbegrenzt „erzwungenen“ Ergebnissen

Thema: Shadowverse: Worlds Beyond

Ein Fehler wird nicht wahr, nur weil man ihn zehntausendmal wiederholt.

So funktionieren die Lesehilfen

Anhören liest den Artikel vor. Schnelllesen zeigt Wortgruppen im gewählten Tempo. Sprachübungen vergleichen verfügbare Übersetzungen. Speichern legt ein Lesezeichen in diesem Browser an, das du in der Merkliste des Players wiederfindest.

Artikel teilen
Werbung
Werbung

1. Eigentlich wollte ich nur ins Gesicht stürmen, dann entstand ein Labor

Das Ziel war, mit KI das stärkste aktuelle Deck zu finden. Set 8, 826-Karten-Datenbank, Engine-Commit, Environment-Hash, legale Decks und Seeds wurden eingefroren. Der historische 12.480-Spiele-Baseline hatte rule coverage 100%, unsupported 0 und rule gap 0, trotzdem lieferte die rohe KI absurde Werte wie Sword ~79,8% und Rune ~25,6%.

Ein Fehler wird nicht wahr, nur weil man ihn zehntausendmal wiederholt.

2. Menschlicher Rat machte den Bot schwächer und Mittelwerte versteckten Brände

human-prior-v1 wurde mit 2.016 paired units / 4.032 games getestet: Baseline 50,99%, neu 49,36%, -1,64pt. Adaptive v2 gewann insgesamt +0,74pt, aber Runecraft verlor -6,25pt und riss den leader floor; T11 scheiterte ebenfalls, unter anderem mit Abysscraft -16,67pt.

Menschlicher Rat ist kontextabhängig; fixed weights können den Kontext töten. Ein guter Durchschnitt bedeutet nicht, dass keine Klasse brennt.

3. Die Ursachenanalyse fand auch Bugs im Forschungssystem

Ein nicht angeschlossener max_nodes=160-Vertrag und ein Actor/Fixed-Player-Perspektivfehler, der Kausalaussagen umkehrte, wurden behoben. Die Analyseplattform wurde besser, die breite Performance nicht.

Die Set-8-Policy-Forschung stoppte nach 20 Experimenten und 31.406 bestätigten Engine-Spielen bei PAUSED_COMPLETE_NO_PROMOTION: 439 discordant units, 0 vollständig erklärt, 11 teilweise, 428 ungelöst. human-prior-v1 blieb aktiv; der geplante 8.064-Spiele-final-unseen-holdout blieb versiegelt.

4. 52 Marktdecks spielten 46.900 Partien und erzeugten das „hirnlos-gegen-hirnlos“-Ranking

Der Corpus hatte 52 decks / 25 archetypes / 7 leaders. Marktanalyse: 46.900 Spiele; separates direktes 7×7: 1.512. Mittelwerte: Buff Forest 71,99%, Rally Sword 65,97%, Midrange Abyss 54,17%, Artifact Portal 54,17%, Ramp Dragon 53,70%, Evolution Haven 31,71%, Calgidensula Witch 18,29%.

Das sind simulator-direct-Werte, keine Ladder-Winrates. Decks, bei denen „jetzt gut“ später meist ebenfalls gut bleibt, wirkten leichter für die aktuelle KI.

5. In menschlichen Turnieren lebte Witch in einem anderen Universum

Beim Dexel Rising Cup #2 am 8. August 2026 waren 116 von 384 eingereichten Decks Hand Witch, etwa 30,2% und damit Platz eins. Calgidensula Witch wurde im direkten KI-7×7 mit 18,29% Letzter. Es dürfen nicht identische 40 Karten unterstellt werden, doch die Mensch-KI-Lücke ist groß.

Rally Sword war auf beiden Seiten stark und unterstützt die praktische Hypothese, dass fehlertolerante Strategien für Nicht-Experten robuster sein können.

6. Future Optionality: Regeln vorhanden, Reihenfolge und Pläne fast nicht

7 leaders / 24 mechanics wurden über RULE, STATE, VISIBILITY, IMMEDIATE VALUE, FUTURE VALUE, SEQUENCE, SEARCH und PLAN geprüft. Von 27.810 decisions / 118.575 root candidates hatten nur 8.878, 7,49%, expliziten future value. rule/state/immediate waren 24/24 supported, sequence fehlte bei 23/24, plan bei 20/24.

Witch zeigte Draw-Reihenfolge; Dragon zeigte, dass PP und Awakening zukünftige Optionen öffnen. Die 12 Dragon-MYOPIC_REVERSAL-Diagnosen = ramp 6 + Awakening 6 wurden nicht zu festen Boni.

7. Ein echter Drei-Züge-Closed-Loop-Planner wurde gebaut

Die Engine geht mindestens 3 future turn boundaries vor, führt nur eine Action aus, beobachtet draw/random/opponent action und plant neu. Hidden hand und future draw order werden nicht angesehen.

Ablation 56 Spiele: root actions 3.979/3.979, 3-turn completion 100%, hidden-info 0, replans 81.621, plan changes 35.821. Die Implementierung funktionierte, die Performance fiel um -25,0 bis -37,5pt gegen human-prior-v1. Weiter sehen hieß nur, weiter entfernt falsch zu liegen.

8. Leaf calibration trennte die Stelle des Ranking-Bruchs

3.979 root-action leaves, 1.009 unique leaves, 54.208 terminal rollout rows. Von 73 first divergences: leaf weighting 59, chance aggregation 12, opponent backup 2.

Damit wurde die Leaf-Bewertung zum Hauptverdächtigen. Von 12 alten Dragon-Proxies wechselte im echten Drei-Züge-Search nur 1/12 tatsächlich Richtung Ramp.

9. Learned value sagte besser voraus und wählte den besten Zug schlechter

Fresh holdout v1.1: 727 leaves / 104 roots / 22.768 terminal rollouts, sieben leaders. Brier 0,1144→0,0972 und pairwise 75,7→78,9% wurden besser.

Aber root argmax 59,6→39,4%, top2 73,1→64,4%, top3 82,7→76,0%, mean regret 4,42→5,29pt; Forest/Haven/Portal scheiterten an floors. HOLD_OFFLINE.

Bessere Wahrscheinlichkeitsvorhersage ist nicht dasselbe wie die beste Action zu wählen.

10. Jetzt wird rückwärts von Lethal gedacht

LETHAL ← Schaden ← PP ← Karten ← Spellboost/Awakening/Rally-Thresholds ← aktuelle Action. Ramp ist nicht wertvoll wegen „+8 Punkte“, sondern wenn ein konkreter Gewinnweg rechtzeitig 8PP verlangt.

Das Ziel erzeugt rückwärts Voraussetzungen; die echte Engine prüft den Weg vorwärts.

11. Auch der eigene Tod wird rückwärts analysiert

Von SELF_LOSS werden benötigter Gegnerschaden, Board-Schaden, zusätzlicher Hand-Schaden, Ward-Entfernung, PP und öffentliche Information zurückverfolgt. Jede Action wird danach bewertet, welche gegnerischen Gewinnwege sie kappt.

Absolute Sicherheit erzeugt eine KI, die heilt, bis sie höflich verliert. RISK_REQUIRED erlaubt riskante Nicht-Forced-Loss-Linien, wenn sichere Linien praktisch keine echte Gewinnchance lassen.

12. „Erzwungen“ braucht einen deklarierten Beweisbereich

Gewinnlabels: PROVEN_WIN_NOW, FORCED_WIN_FULLY_OBSERVABLE_SUBTREE, FORCED_WIN_WITHIN_ENUMERATED_RESPONSE_SET, ROBUST_WIN_BELIEF, CONDITIONAL_WIN. Verlust wird ebenso in proof, belief und conditional getrennt.

Im Proof Search gilt self=OR, opponent=AND. Gewissheit bei chance verlangt alle reachable outcomes. Hidden-hand truth, future draw order und strategy fusion sind verboten; neu geplant wird erst nach Beobachtung.

13. Action-Priorität wird zu Stufen-Gates statt mysteriöser Punktesumme

Reihenfolge: proven win now → fully observable forced → enumerated forced → vermeidbaren proof-level forced loss entfernen → expected final win probability maximieren → near-tie safety → robustness → route progress/cut → validated continuation value.

belief/conditional ist nicht forced. Nur Actions, die sowohl bei Gewinnchance als auch Verlust-Risiko schlechter sind, dürfen als strictly dominated entfernt werden.

14. Drei Züge sind Mindestdistanz, keine Mauer

Startkonfiguration H_MIN=3, selective H_MAX=5. Nur Branches mit ungelöstem lethal, forced response, wichtigem threshold, delayed payoff oder near tie werden verlängert.

Rollouts starten bei 32/candidate; unklare Top-Kandidaten erhalten 64→128→256. Roots werden UNIQUE_BEST / PRACTICAL_TIE / UNRESOLVED. epsilon 0,02/0,03/0,05 wird nur auf Development gewählt und vor dem neuen Holdout eingefroren.

15. Neue QC: selbstsichere Fehler fangen, bevor wir die stärkste KI jagen

Primary verlangt 0 hidden-info, future-draw, rule gap, strategy fusion, false proven, forced-scope mislabel, chance-completeness violation, lethal miss, avoidable forced loss und leakage. Danach folgen 7-leader coverage, argmax, mean/p90/p95 regret, leader floors und top2 best-set.

Brier/pairwise/calibration sind Secondary und retten keinen Primary-Fehler. Holdout v1.1 ist dauerhaft verbraucht.

Wir gaben dem Bot Zukunft und er wurde schwächer. Wir lehrten Wahrscheinlichkeiten: Vorhersage besser, beste Action schlechter. Deshalb denkt er künftig von Gewinn und Verlust rückwärts und nennt nur das „erzwungen“, was sein Beweisbereich wirklich trägt.

Bauen wir die stärkste KI mit KI. Im Moment ist vielleicht die QC stärker als der Spielbot — das ist vermutlich gesund.


共通データ付録 / Shared data appendix

  • Fixed Set 8 card DB: 826 cards
  • Historical baseline: 12,480 engine games
  • Policy research: 31,406 confirmed actual engine games — PAUSED_COMPLETE_NO_PROMOTION
  • Active policy: human-prior-v1
  • Market corpus: 52 decks / 25 archetypes / 7 leaders
  • Market analysis: 46,900 actual engine games
  • Direct recommended 7×7: 1,512 games
  • Future Optionality: 27,810 decisions / 118,575 root candidates / explicit future-value 7.49%
  • Mechanics audit: sequence MISSING 23/24; plan MISSING 20/24
  • Dragon MYOPIC_REVERSAL: 12 = ramp 6 + Awakening 6
  • Three-turn Ablation: 56 actual engine games; root 3,979/3,979; completion 100%; replans 81,621; plan changes 35,821
  • Leaf calibration: 1,009 unique leaves / 54,208 terminal rollout rows; first divergences 59 leaf + 12 chance + 2 opponent backup
  • Learned holdout v1.1: 727 leaves / 104 roots / 22,768 terminal rollouts
  • Learned metrics: Brier 0.1144→0.0972; argmax 59.6%→39.4%; pairwise 75.7%→78.9%; regret 4.42pt→5.29pt
  • Current research status: HOLD_OFFLINE; learned value not connected
  • Existing final holdout: NOT_RUN

Research references

WerbungBücher zu diesem Thema

Dieser Artikel enthält Affiliate-Links (Werbung). Mehr zur Werbung Als Amazon-Partner verdiene ich an qualifizierten Verkäufen. As an Amazon Associate I earn from qualifying purchases.

Werbung

Heute lesen

Jeder Artikel beantwortet eine Frage, die sich Leser dieses Artikels oft als Nächstes stellen.

Alle Artikel durchsuchenMehr zu Karten- und Brettspiele

Weitere Artikel finden

Alle Artikel

Mendoi-chan

Wer diese Seite betreibt

Mendoi-chan

Sie macht Reibungen im Beruf und Alltag als klare Struktur und konkrete nächste Schritte verständlich.

Werbung

Neueste Artikel

  1. 1Der Unterwäsche stehlende Priester wird geschnappt, aber der „Zucht-Onkel“ bleibt ein Held? Der Manga kürzt die speziellsten Fetische, während der Webroman sogar „Eingebildete Schwangerschaft“ freischaltet
  2. 2Die Menschheit gewinnt das nicht – Ich behandelte PRAGMATA wie ein Mondmuseum und bekam plötzlich Angst vor der industriellen Leistungsfähigkeit einer Maschinenzivilisation
  3. 3Für Menschen, denen Allein-Unternehmungen schwerfallen: „Wenn niemand mitkommt, gehe ich nicht“ zerlegen und ein eigenes „Solo-Aktions-OS“ bauen
  4. 4Kurzfassung: Die Mondbasis hielt länger durch als mein Steuerungssystem
  5. 5Eine 50-jährige Hypothek macht das Haus nicht billiger — Schulden, Zinsrisiko und Japans FSA-Aufsicht
Werbung