脳死AIに3ターン先を見せたらさらに弱くなった――シャドバWB市場分析4万6900戦とAI研究で見えた「未来は見える、でも採点が下手」問題

題材:『Shadowverse: Worlds Beyond』

『Shadowverse: Worlds Beyond』で「今いちばん強いデッキ」を知りたい。公開デッキを集め、ルールを固定し、CPU同士を何万戦も殴らせれば、人間は結果だけ読めばいい。最初の発想はそれだけだった。

読書機能の使い方

聴く:本文を読み上げます。速読:語句を順に表示し、速さを調整できます。語学練習:別の言語版と対訳を読み比べます。保存:このブラウザーにブックマークし、プレイヤーの保存済み一覧から開けます。

この記事をシェア
広告
広告

1. 疾走ドーンしたかっただけなのに研究所が建った

『Shadowverse: Worlds Beyond』で「今いちばん強いデッキ」を知りたい。公開デッキを集め、ルールを固定し、CPU同士を何万戦も殴らせれば、人間は結果だけ読めばいい。最初の発想はそれだけだった。

ところが最初に分かったのは、ルールを正しく処理するAIと、カードゲームを強くプレイするAIは別物という当たり前だった。Set 8を固定し、カードDB 826枚、上流engine commit、environment hash、legal deck、seedを保存。過去の基準実験は12,480戦、rule coverage 100%、unsupported 0、rule gap 0。それでも生のAIはロイヤル約79.8%、エルフ63.7%、ドラゴン60.9%、ウィッチ25.6%という異世界の成績表を出した。

1万回回したら真実になるのではない。1万回、高速で同じ勘違いをする機械になることもある。

2. 人間の知恵を入れたら弱くなった

次に、人間が普通に言う「大事な札は温存」「セットアップを壊すな」「進化権を雑に使うな」のような知識を human-prior-v1 として入れた。exact A/Bは2,016 paired units、4,032 engine games。baseline 50.99%に対しhuman-prior-v1は49.36%、差は-1.64ptだった。

AI、人間の話を聞いたら弱くなる。

ただし理由は自然だった。人間の助言は条件付きである。「温存しろ」は、今使わないと死ぬ局面では無効。「盤面を取れ」は、唯一のコンボを破壊してまで取れという意味ではない。文章の知恵を固定weightに変えると、文脈だけが先に墓場へ行く。

3. Adaptive v2――平均は上がった、ウィッチは落ちた

そこでLETHAL、SURVIVE、STABILIZE、SETUP、RESOURCE、PRESSUREなどの目的を切り替えるAdaptive v2を作った。短い探索、hidden handの近似、将来価値も入れた。全体ではv1比+0.74pt。しかしウィッチは-6.25pt。事前登録したleader floor -5ptを突破したためREJECT。

v3/T11もv1比+0.30ptだったが、reference-v5比-2.38pt、ナイトメア-16.67pt。これもREJECT。

平均点だけ見れば合格、答案を開いたら一教科が火事。

4. 原因分析をしたら研究員側が先に逮捕された

原因分析では、max_nodes=160がplannerへ実際には接続されておらず、名目上限を超えたdecisionが9,067件あった。ところが接続しても広い勝率は改善しない。つまり「本物の実装欠陥だが、性能犯ではない」。

さらに、ある介入を「loss→win」と因果判定したところ、固定player視点と実際に行動したactor視点を取り違えていた。actorから見ればwin→loss。犯人を捕まえた研究員が、被害者の写真を指していた。

actor attribution、direction、invariantを修正し、分析基盤のSYSTEMIC ROOT CAUSEは解決。しかしAI性能の真犯人は逃走を続けた。

5. 31,406戦で「分からない」を正式な結論にした

Set 8の方策研究は20実験、確認済みactual engine games 31,406戦で正式完結。439 discordant unitsを分類し、性能原因を因果的に説明できたもの0、部分説明11、未解決428。無理にAdaptive v4を作らず、PAUSED_COMPLETE_NO_PROMOTIONで閉じた。

active policyはhuman-prior-v1のまま。予定していたfinal unseen holdout 8,064戦も未使用で封印した。

成果は「最強AI」ではない。強くなったように見えるだけのAIを誤採用しない研究装置だった。

6. そこで市場52デッキを4万6900戦殴り合わせた

次は実用へ戻る。「今の市場で何が強い?」「7リーダーで何を握る?」を調べるため、公開市場から52デッキ、25アーキタイプ、7リーダーを固定。quick、broad、1〜3枚の局所最適化、未見seedランキング、guide traceまで含めて市場分析は46,900 actual engine gamesになった。

最後に各リーダーの推奨7デッキを未見seedで直接round robin。21 unordered pairs、1,512 games。各非対角cell 72戦、reference-v5 756戦、human-prior-v1 756戦、先攻756・後攻756。coverage 100%、unsupported 0、rule gap 0、hidden-info violation 0。

7. 「脳死同士ランキング」爆誕

順位 推奨デッキ 直接7×7平均 最悪対面
1 バフエルフ 71.99% ナイトメア 59.72%
2 連携ロイヤル 65.97% エルフ 31.94%
3 ミッドレンジナイトメア 54.17% 40.3%
4 アーティファクトネメシス 54.17% 36.1%
5 ランプドラゴン 53.70% エルフ 25.0%
6 進化ビショップ 31.71% ドラゴン 12.5%
7 カルギデンスラ型ウィッチ 18.29% エルフ 1.4%

会話から生まれた雑な名称が「脳死同士ランキング」だった。「今フォロワーを出す」「今盤面を取る」「今殴る」がそのまま将来の得になりやすいデッキほど、現在のAIには扱いやすい。逆に、今は弱い行動をして2〜3ターン後の爆発を買うデッキは苦手らしい。

8. 人間大会を見たらウィッチだけ別の宇宙にいた

2026年8月8日のDexel Rising Cup #2は64チーム192名、提出384デッキ。魔手ウィッチは116デッキ、全体約30.2%で圧倒的最多。AF疾走ネメシス52、進化ビショップ34、連携進化ロイヤル29、ランプドラゴン25が続いた。

人間上位環境では魔手ウィッチがトップメタ級。一方、AIの直接7×7ではカルギデンスラ型ウィッチが18.29%で最下位。両者を同一40枚と決めつけてはいけないが、人間のウィッチ評価と現AIのウィッチ運用には巨大なズレがあることは明白だった。

一方、連携ロイヤルはAIでも人間大会でも強い。雑に言えば、AIでも強い+人間でも強い=多少の判断ミスで壊れにくい初心者候補という見方ができる。ロイヤルガイジ理論、まさかの実証研究へ。

9. Future Optionality監査――AIは「今得?」しか見てないのか

そこで全7リーダー24メカニクスを、RULE、STATE、VISIBILITY、IMMEDIATE VALUE、FUTURE VALUE、SEQUENCE、SEARCH、PLANへ分解して監査した。

27,810 decision、118,575 root candidatesを調べると、明示的なfuture valueが入ったcandidateは8,878、7.49%。24メカニクスすべてでルールとstateはSUPPORTED、即時価値も24/24 SUPPORTED。しかしsequenceは23/24 MISSING、planは20/24 MISSINGだった。

結論はかなり露骨だ。ルールは知っている。今の得も分かる。でも順番と長期計画がほぼない。

10. ウィッチ――スペブを知っていても、スペブの意味を知っているとは限らない

ウィッチではSpellboostのrule/stateは存在するが、visibilityとfuture valueはPARTIAL、sequenceとplanはMISSING。さらに重要なのがドロー順。

DRAW → SPELLなら、引いたカードがその後のスペルブースト対象になる可能性がある。SPELL → DRAWなら、その1回分は後から引いた札に届かない。同じカードを最終的に使っても未来状態は違う。

合成12 fixtureではDRAW_FIRST_BETTERが4、SPELL_FIRST_BETTERが0、EQUIVALENTが8。実50状態の総括はSTATE_DEPENDENT。だから「常にドロー先」という新しい脳死ルールを作るのも間違いで、引いた後にもう一度考え直せることが必要だった。

11. ドラゴン――PP+1ではなく未来の行動権を買っている

ランプドラゴンも同じ構造を持つ。PP最大値+1は数字の+1だけではない。次ターンの合法手、高コスト回答、複数枚play、回復、除去、フィニッシャーが変わる。特に6→7は覚醒という不連続な閾値を跨ぐ。

Future Optionality監査のMYOPIC_REVERSALはDragoncraftで計12件。内訳はPPブースト6、覚醒6。他クラスは0。即時評価ではcontrol actionが上なのに、t+2のdiagnostic continuationではsetup側が逆転したケースだった。

ここで「やっぱりランプしろ!」とhard-codeするのは研究員2回目の逮捕なので禁止した。

12. 他の5クラスにも同じ病気の候補があった

エルフはコンボ閾値、低コスト生成、バウンス順。ロイヤルは連携9→10と複数展開。ナイトメアは墓場だけでなくリアニメイトpoolの中身とHP支払い。ビショップはカウントダウンと、使わず残すこと自体に価値があるアクト。ネメシスは0コストtokenやcopyが同一ターンのsequence数を爆発させる。

さらにEP、SEP、後攻Extra PP、手札9枚、場5枠、リーダーエリア5枠も「今使う」と「未来の選択権を残す」の交換だ。Future Optionalityはウィッチ専用の病名ではなく、全クラス共通の診断軸になった。

13. なら3ターン先まで実際に見せよう――closed-loop planner

次の実験は単純明快だった。最低3ターン先まで実エンジン状態を進める。 3手先ではない。現在ターンの残り→相手ターン→自分ターン→相手ターンまで見る。

しかもopen-loopで3ターン分を決め打ちしない。最初の1 actionだけ実行し、ドロー・生成・random結果など新情報を観測したら、またその状態から3ターン先まで再計算する。Receding Horizon / Model Predictive Controlに近いclosed-loop構造だ。

未来の自分のドロー順も相手の実手札も覗かず、belief samplingを使用。Spellboost、Extra PP、Countdown、Act、連携、墓場、破壊済みフォロワーpoolなどをFutureRelevantStateに保持した。固定optionality bonus、Witch専用bonus、ramp bonusはゼロ。

14. 実装は成功した。AIはさらに弱くなった。

そして素晴らしい事故が起きた。

Ablationは56 actual engine games。root actionは3,979 / 3,979を全件評価。3ターン完走率100%、hidden-information violation 0。観測後replan 81,621回、plan変更35,821回。つまり「本当は3ターン見てない」「ドロー後に考え直してない」という実装疑惑はかなり消えた。

しかし性能は、v1-baseとwidenがhuman-prior-v1比**-37.5pt**、replan/state/robustが**-25.0pt**。事前登録した-10pt floorを全候補が突破して全滅。REJECT_ACTIVE_UNCHANGED。targeted、balanced broad、market 7×7、final holdoutはgateに従ってNOT_RUN。

未来予知を実装したら、より遠くまで見ながら間違えるAIが完成した。

15. これは「3ターンが無意味」ではない

ここは慎重に切る必要がある。消えたのは「実装上3ターン見ていない」疑いであって、3ターンあれば十分とは証明していない。またbase -37.5ptからreplan -25ptへの改善も方向性として面白いが、各候補8条件なので因果確定には小さい。

さらにDragonの旧MYOPIC_REVERSAL 12件を実エンジン3ターンsearchで再評価すると、実際にramp側へrankingが変わったのは1/12。旧proxyを正解ラベルとして使えないことも分かった。

次の有力容疑者は、探索範囲より3ターン後のleaf stateを何点と採点するterminal evaluatorと、tree内で仮定しているopponent responseになった。

16. 次は「AI、この未来-150点って言ったけど、そこから100回やったら何勝するの?」

次の研究では評価関数をすぐ直さない。まずroot actionごとの3ターン後leafを固定保存し、evaluatorを項目ごとに完全分解する。HP、board、hand、resource、setup、future damage、lethal proximityなど、raw feature→normalization→weight→contribution→final scoreまで追う。特に-150級の異常値をどのtermが作っているかを特定する。

次に同じleafからゲーム終了まで32〜128回rolloutし、実際のempirical win rateを作る。raw scoreを確率と見なさず、score→win probabilityを別途calibrateしてBrier score、log loss、reliability diagramを出す。同時にSpearman、Kendall、same-root argmax accuracy、pairwise ranking accuracy、decision regretを見る。

さらにopponent responseをhuman-prior-v1、reference-v5、search-based stress responseでcross-playする。これで「leaf採点が悪い」「相手の返し想定が悪い」「weight/scaleが悪い」「state表現が足りない」「3ターン自体がまだ短い」を分離する。

17. 結論――未来は見える。でも未来の良し悪しを間違える

この研究の現在地を一行で言う。

AIは『今強い』だけを見る段階から、『3ターン先を見る』段階までは進んだ。しかし、見えた3ターン後の未来の採点がまだ信用できない。

最初はロイヤル79.8%という異常値から始まり、人間の知恵を入れて弱くなり、Adaptiveでウィッチを壊し、因果分析でactorを取り違え、市場総当たりで「脳死同士ランキング」を作り、Future Optionalityを見つけ、ついに3ターン未来予知を実装した。

そして最新の成果がこれである。

未来は見える。採点が下手。

疾走ドーンしたかっただけなのに、次の研究テーマはBrier scoreとleaf-value calibrationになった。シャドバ、いつから大学院だったんだ。

データ付録

  • Fixed Set 8 card DB: 826 cards
  • Historical baseline: 12,480 engine games
  • Set 8 policy research: 31,406 confirmed actual engine games
  • Policy final status: PAUSED_COMPLETE_NO_PROMOTION
  • Active policy: human-prior-v1
  • Market corpus: 52 decks / 25 archetypes / 7 leaders
  • Market analysis: 46,900 actual engine games
  • Direct recommended 7×7: 1,512 games
  • Future Optionality audit: 27,810 decisions / 118,575 root candidates / explicit future-value coverage 7.49%
  • Mechanics audit: 24 mechanics; sequence MISSING 23, plan MISSING 20
  • Dragon diagnostic MYOPIC_REVERSAL: 12 total = ramp 6 + Awakening 6
  • Three-turn planner Ablation: 56 actual engine games
  • Root action coverage: 3,979 / 3,979
  • Three-turn completion: 100%
  • Observation replans: 81,621
  • Plan changes: 35,821
  • Result: REJECT_ACTIVE_UNCHANGED
  • Old and new final holdouts: NOT_RUN

参考資料

  • Shadowverse: Worlds Beyond 公式 Deck Portal / 人気デッキ・クラス特徴
  • Dexel Rising Cup #2 デッキリスト・環境レポート(2026-08-08)
  • Silver & Veness (2010), Monte-Carlo Planning in Large POMDPs (POMCP)
  • Cowling, Powley & Whitehouse (2012), Information Set Monte Carlo Tree Search
  • Model Predictive Control / Receding Horizon Control literature
  • Calibration literature: Brier score, reliability diagrams, grouped/clustered validation

PRこの記事の作品を探す

  • 『Shadowverse: Worlds Beyond』

    この記事で扱った『Shadowverse: Worlds Beyond』の検索結果です。

この記事には広告(アフィリエイトリンク)が含まれます。 広告について

広告

今日これ読んで

この記事を読んだ人の次の疑問に、それぞれ答える記事です。

すべての記事から探す「カード・ボードゲーム」の記事をもっと見る

他の記事を探す

すべての記事

めんどいちゃん

このサイトの運営者

めんどいちゃん

仕事や日常の「めんどい」を構造化して、次に動きやすくする記事を書いています。

広告

新着記事

  1. 1一度動くと担当になる職場――思いつき、追加業務、責任範囲をどう切るか
  2. 2能力不足を責める前に業務を設計せよ――解雇論が示すマネジメントの基本
  3. 3休んでいるつもりなのに休めないのはなぜか:脳の検索窓が閉じていない日の話
  4. 4男子トイレの床はなぜ濡れるのか
  5. 5税・社保サブスク、払ったなら使い倒せ――GPIF約318兆円、資格最大80%、UR「4ナイ」まで合法テイカー入門
広告