1. 疾走ドーンしたかっただけなのに研究所が建った
最初の目的は「今いちばん強いデッキをAIで調べたい」だけだった。Set 8を固定し、カードDB 826枚、engine commit、環境hash、合法deck、seedを保存。過去の基準実験は12,480戦、rule coverage 100%、unsupported 0、rule gap 0だった。それでも生のAIはロイヤル約79.8%、ウィッチ25.6%という異世界の成績表を出した。
1万回回したら真実になるのではない。1万回、高速で同じ勘違いをする機械にもなれる。
2. 人間の知恵を入れたら弱くなり、平均だけ見る危険が出た
human-prior-v1へ「重要札を温存」「セットアップを壊さない」などを入れ、2,016 paired units / 4,032 engine gamesでexact A/Bした。baseline 50.99%に対しhuman-prior-v1は49.36%、-1.64pt。さらにAdaptive v2は全体+0.74ptでもRunecraft -6.25ptでleader floorを失敗しREJECT。T11もAbysscraft -16.67ptなどでREJECTした。
人間の助言は条件付きなのに、固定weightへすると文脈が死ぬ。平均点は合格、答案を開いたら一教科が燃えているを正式に検知する必要が出た。
3. 原因分析をしたら研究員側のバグも見つかった
max_nodes=160がplannerへつながっていない実装欠陥、actorとfixed playerの視点を取り違える因果分析バグなどを発見した。actor attribution、direction、invariantは修正したが、広い性能は回復しなかった。
Set 8方策研究は20実験、31,406 actual engine gamesでPAUSED_COMPLETE_NO_PROMOTION。439 discordant units中、完全な性能原因説明0、部分説明11、未解決428。activeはhuman-prior-v1のまま、予定していた8,064戦final unseen holdoutも未使用で封印した。
4. 市場52デッキを46,900戦殴らせたら「脳死同士ランキング」が生まれた
市場corpusは52 decks / 25 archetypes / 7 leaders。市場分析46,900戦とは別に、推奨7デッキの直接7×7を1,512戦実施した。直接平均はBuff Forest 71.99%、Rally Sword 65.97%、Midrange Abyss 54.17%、Artifact Portal 54.17%、Ramp Dragon 53.70%、Evolution Haven 31.71%、Calgidensula Witch 18.29%。これはsimulator-direct値でありladder WRではない。
「今強い行動」がそのまま未来でも強いdeckほど現AIに扱いやすく、今を犠牲にして未来を買うdeckほど苦手に見えた。雑な命名が脳死同士ランキング。名前は雑、問題は真面目。
5. 人間大会とAIでウィッチ評価が別世界だった
2026年8月8日のDexel Rising Cup #2では384提出deck中Hand Witchが116、約30.2%で最多。一方、AI直接7×7のCalgidensula Witchは18.29%で最下位だった。両者を同一40枚と断定はできないが、人間上位環境と現AIのWitch運用には大きなズレがある。
逆にRally SwordはAIでも人間でも強い。そこで「単純AIでも壊れにくいdeckは初心者にも扱いやすいかもしれない」という実用仮説も出た。ロイヤルガイジ理論、なぜか研究対象になる。
6. Future Optionality監査で「ルールは知ってる、順番と計画がない」が見えた
全7 leader・24 mechanicsをRULE / STATE / VISIBILITY / IMMEDIATE VALUE / FUTURE VALUE / SEQUENCE / SEARCH / PLANへ分解。27,810 decisions、118,575 root candidatesで、explicit future valueを持つcandidateは8,878、7.49%。rule/state/immediate valueは24/24 supportedだが、sequenceは23/24 MISSING、planは20/24 MISSINGだった。
WitchはDRAW→SPELLとSPELL→DRAWで未来が変わる。DragonはPP+1が単なる+1ではなく、Awakeningや未来の合法手を開く。DragonのMYOPIC_REVERSAL診断12件はramp 6 + Awakening 6。ただしproxyは正解ラベルではないので「ランプ+10点」は禁止した。
7. 本当に3ターン先まで見るclosed-loop plannerを作った
最低3 future turn boundariesまで実engineを進め、1手だけ実行してdraw/random/opponent actionを観測したら毎回replanするclosed-loop構造を実装。hidden handやfuture draw orderは覗かない。
Ablationは56 actual engine games、root action 3,979/3,979、3-turn completion 100%、hidden-info violation 0、observation replans 81,621、plan changes 35,821。実装は動いた。性能はhuman-prior-v1比-25.0pt〜-37.5pt。未来予知を実装したら、より遠くまで見ながら間違えるAIが完成した。 REJECT_ACTIVE_UNCHANGED。
8. 3ターン先を見ても弱い原因をleafまで分解した
3,979 root-action leavesを捕捉し、1,009 unique leavesへ54,208 terminal rollout rowsを作成。順位逆転73件の最初の発生点はleaf weighting 59、chance aggregation 12、opponent backup 2だった。
つまり「3ターンが短い」だけでは説明できない。3ターン後に着いた未来へ何点を付けるかが主要容疑者になった。なお旧Dragon reversal 12件を実3-turn searchで見るとramp側へ順位が変わったのは1/12で、診断proxyをground truth扱いしない重要性も確認した。
9. 学習valueは予測を改善し、最善手選択を悪化させた
新しい未見holdout v1.1は全7 actor leader、727 leaves / 104 roots / 22,768 terminal rollouts。Brierは0.1144→0.0972、pairwise accuracyは75.7%→78.9%と改善した。
しかしroot argmaxは59.6%→39.4%、top2 contains empirical bestは73.1%→64.4%、top3は82.7%→76.0%、mean decision regretは4.42pt→5.29ptと悪化。Forest/Haven/Portalのleader floorも失敗した。判定はHOLD_OFFLINE。
AI「確率予測うまくなりました!」 QC「1位どれ?」 AI「前より外します!」――予測精度と意思決定品質は別物だった。
10. 次は「3ターン後の写真」ではなくリーサルから逆算する
新仮説はgoal/regression planning型。まずLETHALを置き、必要damage→PP→cards→Spellboost/Awakening/Rally等のthreshold→今のactionへ逆算する。
Dragonでrampが価値を持つのは「rampだから+8」ではなく、具体的な勝ちrouteに8PPが必要で今rampしないと間に合わない時。Witchのdraw-firstも固定ボーナスではなく、勝ちrouteの必要条件として評価する。後ろから「どう勝つ?」、前向きengineで「本当に通る?」を確認する。
11. 勝ち筋だけではダメ。負け筋からも逆算する
SELF_LOSSから相手の必要damage、board damage、手札から必要な追加damage、Ward除去、PP、公開情報へ逆算し、今のactionが相手の勝ちrouteを切れるかを見る。
ただしsafetyを絶対優先すると、回復だけして5ターン後に丁寧に負けるAIができる。そこでRISK_REQUIREDを正式状態にする。安全策ではほぼ勝てないなら、forced lossでない範囲で最も勝率が残るriskを取る。目標は長生きではない。勝つこと。
12. 「強制勝ち」は証明範囲を書け。高確率と強制を混ぜない
勝ち側をPROVEN_WIN_NOW / FORCED_WIN_FULLY_OBSERVABLE_SUBTREE / FORCED_WIN_WITHIN_ENUMERATED_RESPONSE_SET / ROBUST_WIN_BELIEF / CONDITIONAL_WINへ分離。負け側もPROVEN_LOSS_NOW、proof-scoped forced loss、HIGH_RISK_LOSS_BELIEF、CONDITIONAL_LOSSへ分ける。
proof searchではself=OR、opponent=AND。相手の列挙済み有効responseを全部突破して初めてそのscope内でforcedと言う。chanceで確定を名乗るなら全到達可能outcomeを扱う。hidden hand真値やfuture draw orderを覗かず、ISMCTSが問題にするstrategy fusionも禁止。観測後だけreplanする。
13. action優先順位は謎の点数足し算ではなく段階gate
優先順位は①PROVEN_WIN_NOW、②完全観測部分木forced win、③列挙response内forced win、④防げるproof-level forced lossを除外、⑤expected final win probability最大化、⑥ほぼ同率ならnear-loss risk、⑦robustness、⑧win-route progress / opponent-route cut、⑨validated continuation value。
ROBUST_WIN_BELIEFやCONDITIONAL_WINはforced扱いしない。勝率も低くloss riskも高いactionだけをDOMINATEDとして落とす。最終質問は「盤面何点?」ではなく「このボタンを押したら最終的に何%勝つ?」。
14. 3ターンは終点ではなく最低距離。曖昧な枝だけ5まで伸ばす
初期研究設定はH_MIN=3、selective H_MAX=5。lethal sequence、forced response、重要threshold、delayed payoff、top候補near-tieが3ターン境界に残る枝だけ4〜5へ延長する。全部5ターンにして計算爆発はさせない。
rolloutはinitial 32/candidate、曖昧な上位だけ64→128→256。rootはUNIQUE_BEST / PRACTICAL_TIE / UNRESOLVEDへ分類。epsilon_decision候補0.02/0.03/0.05はdevelopment-onlyで比較し、新holdout前にfreezeする。Best-arm identificationの「曖昧な上位へ計算を集中」の設計原理を参考にするが、SVWB実装をTrack-and-Stopとは呼ばない。
15. 新QC――最強AIを作る前に「自信満々の間違い」を本番へ逃がさない
Primary gateはhidden-info 0、future-draw-order violation 0、rule gap 0、strategy-fusion violation 0、PROVEN_* false positive 0、FORCED_* scope mislabel 0、chance completeness violation 0、immediate lethal miss 0、avoidable forced-loss selection 0、split leakage 0。その上で全7 leader coverage、UNIQUE_BEST argmax、mean/p90/p95 regret、leader floor、top2 best-setを評価する。
Brier、log loss、pairwise、Spearman、Kendall、calibrationはSecondary。Secondaryが良くてもPrimary failureは救済しない。v1.1 holdoutは消費済みで、trainingやthreshold tuningへ再利用禁止。
未来を見せたら弱くなった。勝率を学習させたら予測は上手くなったのに最善手はもっと外した。だから次は、勝ち方から逆算し、死に方からも逆算し、証明できるものだけを「強制」と呼ぶ。
最強AIを作るぞ、AIで。なお現在、ゲームAIよりQCの方が強い疑惑がある。たぶん正常です。
