1. 疾走ドーンしたかっただけなのに研究所が建った
『Shadowverse: Worlds Beyond』で「今いちばん強いデッキ」を知りたい。公開デッキを集め、ルールを固定し、CPU同士を何万戦も殴らせれば、人間は結果だけ読めばいい。最初の発想はそれだけだった。
ところが最初に分かったのは、ルールを正しく処理するAIと、カードゲームを強くプレイするAIは別物という当たり前だった。Set 8を固定し、カードDB 826枚、上流engine commit、environment hash、legal deck、seedを保存。過去の基準実験は12,480戦、rule coverage 100%、unsupported 0、rule gap 0。それでも生のAIはロイヤル約79.8%、エルフ63.7%、ドラゴン60.9%、ウィッチ25.6%という異世界の成績表を出した。
1万回回したら真実になるのではない。1万回、高速で同じ勘違いをする機械になることもある。
2. 人間の知恵を入れたら弱くなった
次に、人間が普通に言う「大事な札は温存」「セットアップを壊すな」「進化権を雑に使うな」のような知識を human-prior-v1 として入れた。exact A/Bは2,016 paired units、4,032 engine games。baseline 50.99%に対しhuman-prior-v1は49.36%、差は-1.64ptだった。
AI、人間の話を聞いたら弱くなる。
ただし理由は自然だった。人間の助言は条件付きである。「温存しろ」は、今使わないと死ぬ局面では無効。「盤面を取れ」は、唯一のコンボを破壊してまで取れという意味ではない。文章の知恵を固定weightに変えると、文脈だけが先に墓場へ行く。
3. Adaptive v2――平均は上がった、ウィッチは落ちた
そこでLETHAL、SURVIVE、STABILIZE、SETUP、RESOURCE、PRESSUREなどの目的を切り替えるAdaptive v2を作った。短い探索、hidden handの近似、将来価値も入れた。全体ではv1比+0.74pt。しかしウィッチは-6.25pt。事前登録したleader floor -5ptを突破したためREJECT。
v3/T11もv1比+0.30ptだったが、reference-v5比-2.38pt、ナイトメア-16.67pt。これもREJECT。
平均点だけ見れば合格、答案を開いたら一教科が火事。
4. 原因分析をしたら研究員側が先に逮捕された
原因分析では、max_nodes=160がplannerへ実際には接続されておらず、名目上限を超えたdecisionが9,067件あった。ところが接続しても広い勝率は改善しない。つまり「本物の実装欠陥だが、性能犯ではない」。
さらに、ある介入を「loss→win」と因果判定したところ、固定player視点と実際に行動したactor視点を取り違えていた。actorから見ればwin→loss。犯人を捕まえた研究員が、被害者の写真を指していた。
actor attribution、direction、invariantを修正し、分析基盤のSYSTEMIC ROOT CAUSEは解決。しかしAI性能の真犯人は逃走を続けた。
5. 31,406戦で「分からない」を正式な結論にした
Set 8の方策研究は20実験、確認済みactual engine games 31,406戦で正式完結。439 discordant unitsを分類し、性能原因を因果的に説明できたもの0、部分説明11、未解決428。無理にAdaptive v4を作らず、PAUSED_COMPLETE_NO_PROMOTIONで閉じた。
active policyはhuman-prior-v1のまま。予定していたfinal unseen holdout 8,064戦も未使用で封印した。
成果は「最強AI」ではない。強くなったように見えるだけのAIを誤採用しない研究装置だった。
6. そこで市場52デッキを4万6900戦殴り合わせた
次は実用へ戻る。「今の市場で何が強い?」「7リーダーで何を握る?」を調べるため、公開市場から52デッキ、25アーキタイプ、7リーダーを固定。quick、broad、1〜3枚の局所最適化、未見seedランキング、guide traceまで含めて市場分析は46,900 actual engine gamesになった。
最後に各リーダーの推奨7デッキを未見seedで直接round robin。21 unordered pairs、1,512 games。各非対角cell 72戦、reference-v5 756戦、human-prior-v1 756戦、先攻756・後攻756。coverage 100%、unsupported 0、rule gap 0、hidden-info violation 0。
7. 「脳死同士ランキング」爆誕
| 順位 | 推奨デッキ | 直接7×7平均 | 最悪対面 |
|---|---|---|---|
| 1 | バフエルフ | 71.99% | ナイトメア 59.72% |
| 2 | 連携ロイヤル | 65.97% | エルフ 31.94% |
| 3 | ミッドレンジナイトメア | 54.17% | 40.3% |
| 4 | アーティファクトネメシス | 54.17% | 36.1% |
| 5 | ランプドラゴン | 53.70% | エルフ 25.0% |
| 6 | 進化ビショップ | 31.71% | ドラゴン 12.5% |
| 7 | カルギデンスラ型ウィッチ | 18.29% | エルフ 1.4% |
会話から生まれた雑な名称が「脳死同士ランキング」だった。「今フォロワーを出す」「今盤面を取る」「今殴る」がそのまま将来の得になりやすいデッキほど、現在のAIには扱いやすい。逆に、今は弱い行動をして2〜3ターン後の爆発を買うデッキは苦手らしい。
8. 人間大会を見たらウィッチだけ別の宇宙にいた
2026年8月8日のDexel Rising Cup #2は64チーム192名、提出384デッキ。魔手ウィッチは116デッキ、全体約30.2%で圧倒的最多。AF疾走ネメシス52、進化ビショップ34、連携進化ロイヤル29、ランプドラゴン25が続いた。
人間上位環境では魔手ウィッチがトップメタ級。一方、AIの直接7×7ではカルギデンスラ型ウィッチが18.29%で最下位。両者を同一40枚と決めつけてはいけないが、人間のウィッチ評価と現AIのウィッチ運用には巨大なズレがあることは明白だった。
一方、連携ロイヤルはAIでも人間大会でも強い。雑に言えば、AIでも強い+人間でも強い=多少の判断ミスで壊れにくい初心者候補という見方ができる。ロイヤルガイジ理論、まさかの実証研究へ。
9. Future Optionality監査――AIは「今得?」しか見てないのか
そこで全7リーダー24メカニクスを、RULE、STATE、VISIBILITY、IMMEDIATE VALUE、FUTURE VALUE、SEQUENCE、SEARCH、PLANへ分解して監査した。
27,810 decision、118,575 root candidatesを調べると、明示的なfuture valueが入ったcandidateは8,878、7.49%。24メカニクスすべてでルールとstateはSUPPORTED、即時価値も24/24 SUPPORTED。しかしsequenceは23/24 MISSING、planは20/24 MISSINGだった。
結論はかなり露骨だ。ルールは知っている。今の得も分かる。でも順番と長期計画がほぼない。
10. ウィッチ――スペブを知っていても、スペブの意味を知っているとは限らない
ウィッチではSpellboostのrule/stateは存在するが、visibilityとfuture valueはPARTIAL、sequenceとplanはMISSING。さらに重要なのがドロー順。
DRAW → SPELLなら、引いたカードがその後のスペルブースト対象になる可能性がある。SPELL → DRAWなら、その1回分は後から引いた札に届かない。同じカードを最終的に使っても未来状態は違う。
合成12 fixtureではDRAW_FIRST_BETTERが4、SPELL_FIRST_BETTERが0、EQUIVALENTが8。実50状態の総括はSTATE_DEPENDENT。だから「常にドロー先」という新しい脳死ルールを作るのも間違いで、引いた後にもう一度考え直せることが必要だった。
11. ドラゴン――PP+1ではなく未来の行動権を買っている
ランプドラゴンも同じ構造を持つ。PP最大値+1は数字の+1だけではない。次ターンの合法手、高コスト回答、複数枚play、回復、除去、フィニッシャーが変わる。特に6→7は覚醒という不連続な閾値を跨ぐ。
Future Optionality監査のMYOPIC_REVERSALはDragoncraftで計12件。内訳はPPブースト6、覚醒6。他クラスは0。即時評価ではcontrol actionが上なのに、t+2のdiagnostic continuationではsetup側が逆転したケースだった。
ここで「やっぱりランプしろ!」とhard-codeするのは研究員2回目の逮捕なので禁止した。
12. 他の5クラスにも同じ病気の候補があった
エルフはコンボ閾値、低コスト生成、バウンス順。ロイヤルは連携9→10と複数展開。ナイトメアは墓場だけでなくリアニメイトpoolの中身とHP支払い。ビショップはカウントダウンと、使わず残すこと自体に価値があるアクト。ネメシスは0コストtokenやcopyが同一ターンのsequence数を爆発させる。
さらにEP、SEP、後攻Extra PP、手札9枚、場5枠、リーダーエリア5枠も「今使う」と「未来の選択権を残す」の交換だ。Future Optionalityはウィッチ専用の病名ではなく、全クラス共通の診断軸になった。
13. なら3ターン先まで実際に見せよう――closed-loop planner
次の実験は単純明快だった。最低3ターン先まで実エンジン状態を進める。 3手先ではない。現在ターンの残り→相手ターン→自分ターン→相手ターンまで見る。
しかもopen-loopで3ターン分を決め打ちしない。最初の1 actionだけ実行し、ドロー・生成・random結果など新情報を観測したら、またその状態から3ターン先まで再計算する。Receding Horizon / Model Predictive Controlに近いclosed-loop構造だ。
未来の自分のドロー順も相手の実手札も覗かず、belief samplingを使用。Spellboost、Extra PP、Countdown、Act、連携、墓場、破壊済みフォロワーpoolなどをFutureRelevantStateに保持した。固定optionality bonus、Witch専用bonus、ramp bonusはゼロ。
14. 実装は成功した。AIはさらに弱くなった。
そして素晴らしい事故が起きた。
Ablationは56 actual engine games。root actionは3,979 / 3,979を全件評価。3ターン完走率100%、hidden-information violation 0。観測後replan 81,621回、plan変更35,821回。つまり「本当は3ターン見てない」「ドロー後に考え直してない」という実装疑惑はかなり消えた。
しかし性能は、v1-baseとwidenがhuman-prior-v1比**-37.5pt**、replan/state/robustが**-25.0pt**。事前登録した-10pt floorを全候補が突破して全滅。REJECT_ACTIVE_UNCHANGED。targeted、balanced broad、market 7×7、final holdoutはgateに従ってNOT_RUN。
未来予知を実装したら、より遠くまで見ながら間違えるAIが完成した。
15. これは「3ターンが無意味」ではない
ここは慎重に切る必要がある。消えたのは「実装上3ターン見ていない」疑いであって、3ターンあれば十分とは証明していない。またbase -37.5ptからreplan -25ptへの改善も方向性として面白いが、各候補8条件なので因果確定には小さい。
さらにDragonの旧MYOPIC_REVERSAL 12件を実エンジン3ターンsearchで再評価すると、実際にramp側へrankingが変わったのは1/12。旧proxyを正解ラベルとして使えないことも分かった。
次の有力容疑者は、探索範囲より3ターン後のleaf stateを何点と採点するterminal evaluatorと、tree内で仮定しているopponent responseになった。
16. 次は「AI、この未来-150点って言ったけど、そこから100回やったら何勝するの?」
次の研究では評価関数をすぐ直さない。まずroot actionごとの3ターン後leafを固定保存し、evaluatorを項目ごとに完全分解する。HP、board、hand、resource、setup、future damage、lethal proximityなど、raw feature→normalization→weight→contribution→final scoreまで追う。特に-150級の異常値をどのtermが作っているかを特定する。
次に同じleafからゲーム終了まで32〜128回rolloutし、実際のempirical win rateを作る。raw scoreを確率と見なさず、score→win probabilityを別途calibrateしてBrier score、log loss、reliability diagramを出す。同時にSpearman、Kendall、same-root argmax accuracy、pairwise ranking accuracy、decision regretを見る。
さらにopponent responseをhuman-prior-v1、reference-v5、search-based stress responseでcross-playする。これで「leaf採点が悪い」「相手の返し想定が悪い」「weight/scaleが悪い」「state表現が足りない」「3ターン自体がまだ短い」を分離する。
17. 結論――未来は見える。でも未来の良し悪しを間違える
この研究の現在地を一行で言う。
AIは『今強い』だけを見る段階から、『3ターン先を見る』段階までは進んだ。しかし、見えた3ターン後の未来の採点がまだ信用できない。
最初はロイヤル79.8%という異常値から始まり、人間の知恵を入れて弱くなり、Adaptiveでウィッチを壊し、因果分析でactorを取り違え、市場総当たりで「脳死同士ランキング」を作り、Future Optionalityを見つけ、ついに3ターン未来予知を実装した。
そして最新の成果がこれである。
未来は見える。採点が下手。
疾走ドーンしたかっただけなのに、次の研究テーマはBrier scoreとleaf-value calibrationになった。シャドバ、いつから大学院だったんだ。
データ付録
- Fixed Set 8 card DB: 826 cards
- Historical baseline: 12,480 engine games
- Set 8 policy research: 31,406 confirmed actual engine games
- Policy final status:
PAUSED_COMPLETE_NO_PROMOTION - Active policy:
human-prior-v1 - Market corpus: 52 decks / 25 archetypes / 7 leaders
- Market analysis: 46,900 actual engine games
- Direct recommended 7×7: 1,512 games
- Future Optionality audit: 27,810 decisions / 118,575 root candidates / explicit future-value coverage 7.49%
- Mechanics audit: 24 mechanics; sequence MISSING 23, plan MISSING 20
- Dragon diagnostic MYOPIC_REVERSAL: 12 total = ramp 6 + Awakening 6
- Three-turn planner Ablation: 56 actual engine games
- Root action coverage: 3,979 / 3,979
- Three-turn completion: 100%
- Observation replans: 81,621
- Plan changes: 35,821
- Result:
REJECT_ACTIVE_UNCHANGED - Old and new final holdouts:
NOT_RUN
参考資料
- Shadowverse: Worlds Beyond 公式 Deck Portal / 人気デッキ・クラス特徴
- Dexel Rising Cup #2 デッキリスト・環境レポート(2026-08-08)
- Silver & Veness (2010), Monte-Carlo Planning in Large POMDPs (POMCP)
- Cowling, Powley & Whitehouse (2012), Information Set Monte Carlo Tree Search
- Model Predictive Control / Receding Horizon Control literature
- Calibration literature: Brier score, reliability diagrams, grouped/clustered validation
