1. Awalnya cuma mau hantam leader, tiba-tiba punya laboratorium
Tujuan awal sangat sederhana: cari deck terkuat saat ini. Kumpulkan deck publik, kunci ruleset, biarkan CPU bermain puluhan ribu game, lalu baca ranking.
Masalah pertama: AI yang mengeksekusi rule dengan benar belum tentu bermain dengan kuat. Set 8 dikunci dengan database 826 kartu, engine commit, environment hash, deck legal, dan seed deterministik. Baseline lama 12.480 game memiliki rule coverage 100%, unsupported 0, rule gap 0, tetapi hasil mentahnya Sword ~79,8%, Forest 63,7%, Dragon 60,9%, Rune 25,6%.
Mengulang kesalahan 10.000 kali tidak membuatnya benar; hanya membuat kesalahan itu sangat konsisten.
2. Nasihat manusia justru membuat bot lebih lemah
human-prior-v1 menambahkan prinsip seperti menyimpan resource penting, menjaga setup, win condition, dan evolusi. Exact A/B memakai 2.016 paired units dan 4.032 engine games. Baseline 50,99%; human-prior-v1 49,36%; delta -1,64pt.
Bot mendengar manusia lalu melemah.
Nasihat manusia bersyarat. “Simpan kartu ini” salah jika tidak memakainya berarti mati sekarang. Fixed weight mempertahankan kalimat, tetapi membuang konteks.
3. Adaptive v2 memperbaiki rata-rata dan merusak Witch
Adaptive v2 mengganti objective LETHAL, SURVIVE, STABILIZE, SETUP, RESOURCE, PRESSURE serta menambah search pendek dan future value. Overall +0,74pt versus v1, tetapi Runecraft -6,25pt, melewati preregistered leader floor -5pt. REJECT.
T11 kemudian +0,30 versus v1, namun -2,38 versus reference-v5 dan Abyss -16,67. REJECT lagi.
Nilai rata-rata lulus; satu mata pelajaran terbakar.
4. Root-cause analysis malah menangkap penelitinya dulu
max_nodes=160 ternyata tidak tersambung ke planner, sehingga 9.067 decision melewati nominal limit. Memperbaikinya tidak memperbaiki performa luas.
Lalu ditemukan bug actor attribution. Intervensi yang disebut “loss→win” dihitung dari fixed player; bagi actor yang aksinya diubah, hasilnya justru win→loss. Peneliti menangkap korban.
Actor/direction/invariant diperbaiki, tetapi penyebab performa AI tetap belum ditemukan.
5. Setelah 31.406 game, “belum tahu” menjadi hasil resmi
Riset policy Set 8 ditutup setelah 20 eksperimen dan 31.406 confirmed actual engine games. Dari 439 discordant units, penyebab performa yang sepenuhnya terjelaskan secara kausal: 0; parsial: 11; unresolved: 428.
Status PAUSED_COMPLETE_NO_PROMOTION, active tetap human-prior-v1, final unseen holdout 8.064 game tidak disentuh.
Keberhasilan utamanya bukan super-AI, tetapi sistem yang tidak mempromosikan AI hanya karena grafiknya terlihat cantik.
6. Lalu 52 deck meta bertarung 46.900 game
Corpus pasar berisi 52 deck, 25 archetype, 7 leader. Quick/broad, optimasi lokal 1–3 kartu, unseen-seed ranking, dan guide trace menghasilkan 46.900 actual engine games.
Tujuh deck rekomendasi kemudian direct round robin: 21 unordered pairs, 1.512 games, 72 per non-diagonal cell, reference-v5 756 dan human-prior-v1 756, first/second juga 756/756. Coverage 100%, unsupported/rule gap/hidden-info violation semuanya 0.
7. Lahirlah “ranking sesama bot bego”
| Rank | Deck | Rata-rata 7×7 | Matchup terburuk |
|---|---|---|---|
| 1 | Buff Forest | 71,99% | Abyss 59,72% |
| 2 | Rally Sword | 65,97% | Forest 31,94% |
| 3 | Midrange Abyss | 54,17% | 40,3% |
| 4 | Artifact Portal | 54,17% | 36,1% |
| 5 | Ramp Dragon | 53,70% | Forest 25,0% |
| 6 | Evolution Haven | 31,71% | Dragon 12,5% |
| 7 | Calgidensula Witch | 18,29% | Forest 1,4% |
Deck yang “kuat sekarang” biasanya tetap baik nanti tampak mudah bagi AI. Deck yang mengorbankan tempo untuk membeli ledakan 2–3 turn mendatang tampak sulit. Maka muncul nama tidak ilmiah tapi berguna: “ranking sesama bot bego”.
8. Di turnamen manusia, Witch hidup di alam semesta lain
Dexel Rising Cup #2 pada 8 Agustus 2026: 64 tim, 192 pemain, 384 deck. Hand Witch dipakai 116 kali, sekitar 30,2%, jelas nomor satu. AF/Storm Portal 52, Evolution Haven 34, Rally/Evolution Sword 29, Ramp Dragon 25.
Manusia top menganggap Witch deck meta teratas; AI direct 7×7 menaruh Calgidensula Witch di posisi terakhir dengan 18,29%. Kita tidak boleh menganggap kedua archetype adalah 40 kartu identik, tetapi gap manusia-vs-AI jelas besar.
Rally Sword kuat di keduanya. Heuristik kasarnya: kuat pada AI sederhana + kuat pada manusia ahli mungkin berarti lebih tahan terhadap kesalahan keputusan.
9. Audit Future Optionality
24 mekanik di tujuh leader diaudit lewat RULE, STATE, VISIBILITY, IMMEDIATE VALUE, FUTURE VALUE, SEQUENCE, SEARCH, PLAN.
Dari 27.810 decision dan 118.575 root candidate, hanya 8.878 —7,49%— memiliki explicit future value. Rule/state/immediate value didukung 24/24. Sequence MISSING 23/24 dan plan MISSING 20/24.
AI tahu aturan dan “untung sekarang”, tetapi hampir tidak punya representasi urutan dan rencana panjang.
10. Witch: tahu Spellboost bukan berarti memahami Spellboost
Rule/state Spellboost ada, tetapi visibility/future value PARTIAL dan sequence/plan MISSING. DRAW → SPELL berbeda dari SPELL → DRAW: kartu yang baru ditarik sebelum spell bisa ikut menerima boost; kartu yang ditarik sesudahnya tidak menerima boost yang sudah terjadi.
Dari 12 synthetic fixture: DRAW_FIRST_BETTER 4, SPELL_FIRST_BETTER 0, EQUIVALENT 8. Lima puluh representative real states diringkas STATE_DEPENDENT. Jadi bukan “selalu draw dulu”, melainkan replan setelah observasi.
11. Dragon: +1 max PP adalah pembelian hak aksi masa depan
Ramp mungkin rugi board sekarang, tetapi membuka kartu mahal, multi-card turn, heal, removal, finisher; 6→7 juga melewati Awakening threshold.
Audit mencatat 12 Dragoncraft MYOPIC_REVERSAL: ramp 6 + Awakening 6. Immediate control lebih tinggi, tetapi diagnostic continuation t+2 bisa membalik ranking. Ini tidak berarti kita boleh hard-code bonus ramp.
12. Lima class lain punya penyakit serupa
Forest: combo threshold, low-cost generation, bounce order. Sword: Rally 9→10, multi-summon. Abyss: Shadows, reanimate pool, HP resource. Haven: Countdown dan Act, tempat “tidak memakai sekarang” menjaga opsi masa depan. Portal: zero-cost token/copy meledakkan sequence space.
EP, SEP, Extra PP, hand 9, board 5, leader area 5 juga merupakan trade-off nilai sekarang vs optionality masa depan.
13. Maka dibuat planner closed-loop tiga turn sungguhan
Planner wajib mendorong engine minimal tiga future turn boundary, bukan tiga action. Ia juga tidak membuat script tiga turn yang kaku: jalankan satu action, amati draw/generation/random result, lalu hitung ulang tiga turn dari state baru. Strukturnya mirip Receding Horizon / MPC.
Future draw order sendiri dan true hand lawan tidak dibocorkan; digunakan belief sampling. FutureRelevantState menyimpan Spellboost, Extra PP, Countdown, Act, Rally, Shadows, destroyed-follower pool, dan state publik relevan. Tidak ada fixed optionality, Witch, atau ramp bonus.
14. Implementasi sukses. Performa jatuh ke basement.
Ablation 56 actual engine games. Semua 3.979 / 3.979 root actions dinilai, three-turn completion 100%, hidden-info violation 0. Observation replan 81.621 kali; plan berubah 35.821 kali.
Tetapi base/widen berada -37,5pt versus human-prior-v1; replan/state/robust -25,0pt. Semua candidate melanggar preregistered -10pt floor. Hasil yang benar: REJECT_ACTIVE_UNCHANGED. Targeted, broad, market 7×7 dan final holdout NOT_RUN.
Kami sukses membuat AI yang melihat lebih jauh sambil salah dengan percaya diri lebih tinggi.
15. Ini tidak membuktikan tiga turn cukup
Yang hilang adalah dugaan “implementasi sebenarnya tidak mencapai tiga turn”. Belum terbukti bahwa tiga turn cukup secara strategis. Perbaikan base -37,5 → replan -25,0 juga hanya directional signal karena tiap candidate hanya 8 conditions.
Dua belas Dragon reversal lama diputar ulang dengan real three-turn search; hanya 1/12 benar-benar berubah ke arah ramp. Proxy lama bukan ground truth.
Tersangka baru: terminal/leaf evaluator dan opponent response model.
16. Pertanyaan berikut: “Katamu masa depan ini -150. Kalau dimainkan 100 kali dari sini, menang berapa?”
Ronde berikut jangan langsung mengubah weight. Simpan leaf tiga turn, pecah evaluator menjadi raw feature→normalization→weight→contribution, dan cari term penyebab nilai ekstrem seperti -150.
Kemudian restart dari leaf identik 32–128 kali sampai terminal untuk mendapat empirical win rate. Raw score bukan probability, jadi kalibrasikan score→probability lalu ukur Brier score, log loss, reliability. Kualitas ranking diukur terpisah dengan Spearman, Kendall, same-root argmax accuracy, pairwise concordance, dan decision regret.
Opponent response dicross-play dengan human-prior-v1, reference-v5, dan search-based stress response. Baru setelah itu kita bisa membedakan leaf scoring buruk, opponent model buruk, scale/weight salah, state representation kurang, atau horizon tiga turn masih kurang.
17. Kesimpulan: masa depan terlihat, rubric nilainya mencurigakan
AI sudah berkembang dari “apa yang kuat sekarang?” menjadi “aku bisa mensimulasikan tiga turn”, tetapi cara menilai masa depan yang terlihat belum dapat dipercaya.
Perjalanan dimulai dari Sword 79,8%, nasihat manusia yang kontra-produktif, Witch rusak, bug actor, 46.900 game market, audit Future Optionality, lalu three-turn foresight sungguhan.
Dan AI malah lebih lemah.
Kami cuma mau pukul leader. Mata kuliah berikutnya ternyata Brier score dan leaf-value calibration. Shadowverse berubah menjadi sekolah pascasarjana tanpa izin.
Lampiran data
- Card DB Set 8: 826
- Baseline: 12.480 games
- Policy research: 31.406 actual engine games
- Status:
PAUSED_COMPLETE_NO_PROMOTION - Active:
human-prior-v1 - Market: 52 decks / 25 archetypes / 7 leaders
- Market analysis: 46.900 games
- Direct 7×7: 1.512 games
- Optionality: 27.810 decisions / 118.575 candidates / 7,49%
- Sequence MISSING 23/24; plan MISSING 20/24
- Dragon reversals: 12 = ramp 6 + Awakening 6
- RH3 Ablation: 56 games
- Root coverage 3.979/3.979; horizon 100%
- Replans 81.621; plan changes 35.821
- Result:
REJECT_ACTIVE_UNCHANGED - Final holdout:
NOT_RUN
Referensi
- Shadowverse: Worlds Beyond official Deck Portal
- Dexel Rising Cup #2
- Silver & Veness (2010), POMCP
- Cowling, Powley & Whitehouse (2012), ISMCTS
- Model Predictive Control / Receding Horizon Control
- Brier score, reliability, dan clustered validation literature
