AI “Tanpa Otak” Diberi Pandangan Tiga Turn, Malah Makin Lemah — Pelajaran dari 46.900 Game Simulasi Meta dan Riset AI Terpisah tentang “Bisa Melihat Masa Depan, tetapi Salah Menilainya”

Bahan: Shadowverse: Worlds Beyond

Tujuan awal sangat sederhana: cari deck terkuat saat ini. Kumpulkan deck publik, kunci ruleset, biarkan CPU bermain puluhan ribu game, lalu baca ranking.

Cara memakai fitur membaca

Dengarkan membacakan artikel. Baca cepat menampilkan frasa berurutan dengan kecepatan pilihan Anda. Latihan bahasa membandingkan terjemahan yang tersedia. Simpan menambahkan penanda di browser ini; buka kembali dari daftar tersimpan di pemutar.

Bagikan artikel ini

Bagikan artikel ini

Iklan
Iklan

1. Awalnya cuma mau hantam leader, tiba-tiba punya laboratorium

Tujuan awal sangat sederhana: cari deck terkuat saat ini. Kumpulkan deck publik, kunci ruleset, biarkan CPU bermain puluhan ribu game, lalu baca ranking.

Masalah pertama: AI yang mengeksekusi rule dengan benar belum tentu bermain dengan kuat. Set 8 dikunci dengan database 826 kartu, engine commit, environment hash, deck legal, dan seed deterministik. Baseline lama 12.480 game memiliki rule coverage 100%, unsupported 0, rule gap 0, tetapi hasil mentahnya Sword ~79,8%, Forest 63,7%, Dragon 60,9%, Rune 25,6%.

Mengulang kesalahan 10.000 kali tidak membuatnya benar; hanya membuat kesalahan itu sangat konsisten.

2. Nasihat manusia justru membuat bot lebih lemah

human-prior-v1 menambahkan prinsip seperti menyimpan resource penting, menjaga setup, win condition, dan evolusi. Exact A/B memakai 2.016 paired units dan 4.032 engine games. Baseline 50,99%; human-prior-v1 49,36%; delta -1,64pt.

Bot mendengar manusia lalu melemah.

Nasihat manusia bersyarat. “Simpan kartu ini” salah jika tidak memakainya berarti mati sekarang. Fixed weight mempertahankan kalimat, tetapi membuang konteks.

3. Adaptive v2 memperbaiki rata-rata dan merusak Witch

Adaptive v2 mengganti objective LETHAL, SURVIVE, STABILIZE, SETUP, RESOURCE, PRESSURE serta menambah search pendek dan future value. Overall +0,74pt versus v1, tetapi Runecraft -6,25pt, melewati preregistered leader floor -5pt. REJECT.

T11 kemudian +0,30 versus v1, namun -2,38 versus reference-v5 dan Abyss -16,67. REJECT lagi.

Nilai rata-rata lulus; satu mata pelajaran terbakar.

4. Root-cause analysis malah menangkap penelitinya dulu

max_nodes=160 ternyata tidak tersambung ke planner, sehingga 9.067 decision melewati nominal limit. Memperbaikinya tidak memperbaiki performa luas.

Lalu ditemukan bug actor attribution. Intervensi yang disebut “loss→win” dihitung dari fixed player; bagi actor yang aksinya diubah, hasilnya justru win→loss. Peneliti menangkap korban.

Actor/direction/invariant diperbaiki, tetapi penyebab performa AI tetap belum ditemukan.

5. Setelah 31.406 game, “belum tahu” menjadi hasil resmi

Riset policy Set 8 ditutup setelah 20 eksperimen dan 31.406 confirmed actual engine games. Dari 439 discordant units, penyebab performa yang sepenuhnya terjelaskan secara kausal: 0; parsial: 11; unresolved: 428.

Status PAUSED_COMPLETE_NO_PROMOTION, active tetap human-prior-v1, final unseen holdout 8.064 game tidak disentuh.

Keberhasilan utamanya bukan super-AI, tetapi sistem yang tidak mempromosikan AI hanya karena grafiknya terlihat cantik.

6. Lalu 52 deck meta bertarung 46.900 game

Corpus pasar berisi 52 deck, 25 archetype, 7 leader. Quick/broad, optimasi lokal 1–3 kartu, unseen-seed ranking, dan guide trace menghasilkan 46.900 actual engine games.

Tujuh deck rekomendasi kemudian direct round robin: 21 unordered pairs, 1.512 games, 72 per non-diagonal cell, reference-v5 756 dan human-prior-v1 756, first/second juga 756/756. Coverage 100%, unsupported/rule gap/hidden-info violation semuanya 0.

7. Lahirlah “ranking sesama bot bego”

Rank Deck Rata-rata 7×7 Matchup terburuk
1 Buff Forest 71,99% Abyss 59,72%
2 Rally Sword 65,97% Forest 31,94%
3 Midrange Abyss 54,17% 40,3%
4 Artifact Portal 54,17% 36,1%
5 Ramp Dragon 53,70% Forest 25,0%
6 Evolution Haven 31,71% Dragon 12,5%
7 Calgidensula Witch 18,29% Forest 1,4%

Deck yang “kuat sekarang” biasanya tetap baik nanti tampak mudah bagi AI. Deck yang mengorbankan tempo untuk membeli ledakan 2–3 turn mendatang tampak sulit. Maka muncul nama tidak ilmiah tapi berguna: “ranking sesama bot bego”.

8. Di turnamen manusia, Witch hidup di alam semesta lain

Dexel Rising Cup #2 pada 8 Agustus 2026: 64 tim, 192 pemain, 384 deck. Hand Witch dipakai 116 kali, sekitar 30,2%, jelas nomor satu. AF/Storm Portal 52, Evolution Haven 34, Rally/Evolution Sword 29, Ramp Dragon 25.

Manusia top menganggap Witch deck meta teratas; AI direct 7×7 menaruh Calgidensula Witch di posisi terakhir dengan 18,29%. Kita tidak boleh menganggap kedua archetype adalah 40 kartu identik, tetapi gap manusia-vs-AI jelas besar.

Rally Sword kuat di keduanya. Heuristik kasarnya: kuat pada AI sederhana + kuat pada manusia ahli mungkin berarti lebih tahan terhadap kesalahan keputusan.

9. Audit Future Optionality

24 mekanik di tujuh leader diaudit lewat RULE, STATE, VISIBILITY, IMMEDIATE VALUE, FUTURE VALUE, SEQUENCE, SEARCH, PLAN.

Dari 27.810 decision dan 118.575 root candidate, hanya 8.878 —7,49%— memiliki explicit future value. Rule/state/immediate value didukung 24/24. Sequence MISSING 23/24 dan plan MISSING 20/24.

AI tahu aturan dan “untung sekarang”, tetapi hampir tidak punya representasi urutan dan rencana panjang.

10. Witch: tahu Spellboost bukan berarti memahami Spellboost

Rule/state Spellboost ada, tetapi visibility/future value PARTIAL dan sequence/plan MISSING. DRAW → SPELL berbeda dari SPELL → DRAW: kartu yang baru ditarik sebelum spell bisa ikut menerima boost; kartu yang ditarik sesudahnya tidak menerima boost yang sudah terjadi.

Dari 12 synthetic fixture: DRAW_FIRST_BETTER 4, SPELL_FIRST_BETTER 0, EQUIVALENT 8. Lima puluh representative real states diringkas STATE_DEPENDENT. Jadi bukan “selalu draw dulu”, melainkan replan setelah observasi.

11. Dragon: +1 max PP adalah pembelian hak aksi masa depan

Ramp mungkin rugi board sekarang, tetapi membuka kartu mahal, multi-card turn, heal, removal, finisher; 6→7 juga melewati Awakening threshold.

Audit mencatat 12 Dragoncraft MYOPIC_REVERSAL: ramp 6 + Awakening 6. Immediate control lebih tinggi, tetapi diagnostic continuation t+2 bisa membalik ranking. Ini tidak berarti kita boleh hard-code bonus ramp.

12. Lima class lain punya penyakit serupa

Forest: combo threshold, low-cost generation, bounce order. Sword: Rally 9→10, multi-summon. Abyss: Shadows, reanimate pool, HP resource. Haven: Countdown dan Act, tempat “tidak memakai sekarang” menjaga opsi masa depan. Portal: zero-cost token/copy meledakkan sequence space.

EP, SEP, Extra PP, hand 9, board 5, leader area 5 juga merupakan trade-off nilai sekarang vs optionality masa depan.

13. Maka dibuat planner closed-loop tiga turn sungguhan

Planner wajib mendorong engine minimal tiga future turn boundary, bukan tiga action. Ia juga tidak membuat script tiga turn yang kaku: jalankan satu action, amati draw/generation/random result, lalu hitung ulang tiga turn dari state baru. Strukturnya mirip Receding Horizon / MPC.

Future draw order sendiri dan true hand lawan tidak dibocorkan; digunakan belief sampling. FutureRelevantState menyimpan Spellboost, Extra PP, Countdown, Act, Rally, Shadows, destroyed-follower pool, dan state publik relevan. Tidak ada fixed optionality, Witch, atau ramp bonus.

14. Implementasi sukses. Performa jatuh ke basement.

Ablation 56 actual engine games. Semua 3.979 / 3.979 root actions dinilai, three-turn completion 100%, hidden-info violation 0. Observation replan 81.621 kali; plan berubah 35.821 kali.

Tetapi base/widen berada -37,5pt versus human-prior-v1; replan/state/robust -25,0pt. Semua candidate melanggar preregistered -10pt floor. Hasil yang benar: REJECT_ACTIVE_UNCHANGED. Targeted, broad, market 7×7 dan final holdout NOT_RUN.

Kami sukses membuat AI yang melihat lebih jauh sambil salah dengan percaya diri lebih tinggi.

15. Ini tidak membuktikan tiga turn cukup

Yang hilang adalah dugaan “implementasi sebenarnya tidak mencapai tiga turn”. Belum terbukti bahwa tiga turn cukup secara strategis. Perbaikan base -37,5 → replan -25,0 juga hanya directional signal karena tiap candidate hanya 8 conditions.

Dua belas Dragon reversal lama diputar ulang dengan real three-turn search; hanya 1/12 benar-benar berubah ke arah ramp. Proxy lama bukan ground truth.

Tersangka baru: terminal/leaf evaluator dan opponent response model.

16. Pertanyaan berikut: “Katamu masa depan ini -150. Kalau dimainkan 100 kali dari sini, menang berapa?”

Ronde berikut jangan langsung mengubah weight. Simpan leaf tiga turn, pecah evaluator menjadi raw feature→normalization→weight→contribution, dan cari term penyebab nilai ekstrem seperti -150.

Kemudian restart dari leaf identik 32–128 kali sampai terminal untuk mendapat empirical win rate. Raw score bukan probability, jadi kalibrasikan score→probability lalu ukur Brier score, log loss, reliability. Kualitas ranking diukur terpisah dengan Spearman, Kendall, same-root argmax accuracy, pairwise concordance, dan decision regret.

Opponent response dicross-play dengan human-prior-v1, reference-v5, dan search-based stress response. Baru setelah itu kita bisa membedakan leaf scoring buruk, opponent model buruk, scale/weight salah, state representation kurang, atau horizon tiga turn masih kurang.

17. Kesimpulan: masa depan terlihat, rubric nilainya mencurigakan

AI sudah berkembang dari “apa yang kuat sekarang?” menjadi “aku bisa mensimulasikan tiga turn”, tetapi cara menilai masa depan yang terlihat belum dapat dipercaya.

Perjalanan dimulai dari Sword 79,8%, nasihat manusia yang kontra-produktif, Witch rusak, bug actor, 46.900 game market, audit Future Optionality, lalu three-turn foresight sungguhan.

Dan AI malah lebih lemah.

Kami cuma mau pukul leader. Mata kuliah berikutnya ternyata Brier score dan leaf-value calibration. Shadowverse berubah menjadi sekolah pascasarjana tanpa izin.

Lampiran data

  • Card DB Set 8: 826
  • Baseline: 12.480 games
  • Policy research: 31.406 actual engine games
  • Status: PAUSED_COMPLETE_NO_PROMOTION
  • Active: human-prior-v1
  • Market: 52 decks / 25 archetypes / 7 leaders
  • Market analysis: 46.900 games
  • Direct 7×7: 1.512 games
  • Optionality: 27.810 decisions / 118.575 candidates / 7,49%
  • Sequence MISSING 23/24; plan MISSING 20/24
  • Dragon reversals: 12 = ramp 6 + Awakening 6
  • RH3 Ablation: 56 games
  • Root coverage 3.979/3.979; horizon 100%
  • Replans 81.621; plan changes 35.821
  • Result: REJECT_ACTIVE_UNCHANGED
  • Final holdout: NOT_RUN

Referensi

  • Shadowverse: Worlds Beyond official Deck Portal
  • Dexel Rising Cup #2
  • Silver & Veness (2010), POMCP
  • Cowling, Powley & Whitehouse (2012), ISMCTS
  • Model Predictive Control / Receding Horizon Control
  • Brier score, reliability, dan clustered validation literature

Baca ini hari ini

Masing-masing menjawab pertanyaan yang biasanya muncul setelah membaca artikel ini.

Lihat semua artikelLebih banyak tentang Game kartu dan papan

Bagikan artikel ini

Iklan

Satu lagi? Ada yang seru?

Mumpung sudah selesai membaca: beberapa cerita yang mirip dan beberapa yang beda sama sekali tapi seru.

  1. Topik serupaRasa “Ada yang Aneh” Adalah Laporan BugDari “Jangan Suruh Saya Bertarung di Luar Pertandingan” ke Layanan, Lingkungan, dan Relasi yang Lebih Matang
  2. Kenapa Semua Seranganku Kalah?Pemain Pyra/Mythra Melawan Intangibility Kazuya dan Perut Buaya
  3. Beda sama sekali, tapi seruApa yang Membuat Seseorang Terlihat “Dalam”?Tidak Buru-Buru Menjawab, Menjaga Kompleksitas, tetapi Tetap Bisa Mengambil Keputusan
  4. Mengapa karakter terkuat di manga dan anime sering mati, disegel, atau dilemahkan? “Pajak kenapa tidak panggil Gojo saja?” pada 30 karakter
  5. Jadi Ujung-Ujungnya Wajah?Dari “Hadiah Seksual Setelah 100 Meter” ke Jaringan Kecanggungan: Obrolan Konyol Berakhir Menjadi Manajemen Risiko Romansa
  6. Jam 5 pagibadan bilang “tidur”, otak bilang “kami masih buka”

Cari artikel lain

Semua artikel

Mendoi-chan

Pengelola situs

Mendoi-chan

Mengubah kerepotan di tempat kerja dan kehidupan sehari-hari menjadi struktur yang jelas dan langkah berikutnya.

Iklan

Artikel terbaru

  1. 1Pastor pencuri pakaian dalam ditangkap, tapi “Om Penanam Benih” jadi pahlawan? Manga memangkas fetish yang paling niche, sementara web novel membangkitkan “Kehamilan Imajinatif”
  2. 2Manusia Tidak Akan Menang — Saya Menikmati PRAGMATA Seperti Museum Bulan, Lalu Menyadari Betapa Menyeramkannya Produksi Massal Peradaban Mesin
  3. 3Untuk yang Sulit Melakukan Sesuatu Sendirian: Bongkar “Kalau Tak Ada Teman, Aku Tak Jalan” dan Bangun “OS Aksi Solo”
  4. 4fasilitas Bulan belum selesai rusak, sistem kontrol saya sudah menyerah duluan
  5. 5KPR 50 tahun tidak membuat rumah lebih murah — utang, risiko bunga, dan pengawasan FSA Jepang

Baca juga

Iklan