1. はじまりは「シャドバで勝ちたい」だった
やりたいことは単純だった。PPを増やす。守護をどける。疾走ドーン。勝ちたい。
それだけのはずが、カードゲームをAIに何千戦もやらせて安定して強いデッキを調べ始めると、「同じ条件で比べないと偶然かもしれない」「平均勝率だけ高くても一つの対面が壊滅していたら危ない」「相手の手札は見えないから確率で考える必要がある」「AIが弱くなったなら行動ログを取って原因を切り分けよう」と話が巨大化した。
気づけば出てくる単語が、モンテカルロ法、ベイズ更新、ナッシュ均衡、動的計画法、部分観測マルコフ決定過程、ロバスト最適化、因果推論、反実仮想。
「シャドバやりたい」から入ったのに、急に大学の講義棟が生えてきた。
しかも人間が全部の数式を暗算しているわけではない。全部抱えるとワーキングメモリが死ぬ。だから、人間は「何を知りたいか」を決め、AIとコードは「どう確かめるか」を大量処理する。
2. 「シャドバ先生」という職種を勝手に作る
人間っぽくプレイするAIを作るのは、新人教育に近い。
仮にAIを「シャドバ先生インターン」と呼ぶ。先生には、マリガン、温存、進化権、相手の返し、2〜3ターン先、リーサル、手札上限、盤面の空きまで判断してもらう。
一度に全部を頭でやるのはしんどいので業務を分解する。
まず勝ち筋を決める。次に今使ってはいけない資源を決める。最後に次のターン死なないか確認する。
会社でいえば、業務設計、マニュアル、研修、OJT、評価制度まで作る。そしてAIに数千戦させる。
インターンなのに実習4,000戦。ブラック研究室である。
3. 人のアドバイスを「その通り実行する」のが難しすぎる
人間の攻略ノウハウをAIへ入れても、単純には強くならなかった。
「このカードは温存」「進化権は後半へ」「ドラゴンはPPを伸ばす」「コンボ札はフィニッシュまで持つ」。文章だけなら正しい。
でも実戦では、「基本は温存。ただし今使わないと死ぬ」「進化は残す。ただし今使えば相手の次ターンを潰せる」「PPは伸ばす。ただし盤面を放置したら死ぬ」という但し書きが大量にある。
人間同士なら「温存ね」で空気を読む。AIは真面目だ。
「温存ですね。了解しました」
そのまま死亡。
良い実行者は命令文をコピーするのではなく、目的・条件・例外を復元している。
4. ノード探索――「この手の次、その次」を木で読む
今の手が3つあるとする。
A:敵を倒す。B:相手の顔を攻撃する。C:カードを使わず温存する。
A、B、Cの先には別々の未来があり、その先で相手も複数の返しを持つ。これを木として読むのが木探索(Tree Search)。
ただし毎回10個候補があるなら、1手先10、2手先100、3手先1,000、4手先10,000と枝が爆発する。
そこで、何手先まで読むかを決める深さ制限、良さそうな上位だけ残すビーム探索、最大何個の未来を見るかを決めるノード予算を使う。
問題は削りすぎると、「今は弱そうだけど2ターン後に超強い手」を捨てること。コンボデッキでこれをやると、未来のためのカードをAIが「今弱いですね」とゴミ箱へ投げる。
探索の本体は、ただ深く読むことではない。どの未来を残すかである。
5. ほかの理論も、実は全部役割が違う
- モンテカルロ法:未来を何度も試して平均を見る。
- ベイズ更新:相手の行動を見て「このカードを持っていそう」の確率を変える。
- 部分観測マルコフ決定過程(POMDP):相手手札のような見えない情報を、見える情報と予想で扱う。
- ミニマックス法:相手も最善の返しをすると考える。
- ナッシュ均衡:お互い対策した末に、片方だけ戦略を変えても得しにくい状態を考える。
- 無後悔学習:「別の戦略にすればよかった」という長期の後悔を小さくする。
- ロバスト最適化:平均だけでなく、苦手対面で大事故しない強さを求める。
- CVaR:悪い方の結果のまとまりを見る。
- 対応ありA/B比較:同じ乱数・先後・デッキで方策だけ変える。
- 信頼区間:「+1%!」のうちどれだけが偶然かを見る。
- アブレーション実験:AIの部品を一個ずつ外して犯人を探す。
- 反実仮想:「あの時別の手なら?」を同じ盤面から試す。
- 因果推論:「一緒に起きた」ではなく、本当にそれを変えると結果が変わるかを見る。
英語だとラスボス軍団。日本語だと、何回も試す、予想を更新する、最悪も見る、同じ条件で比べる、犯人を一個ずつ調べる。
急に親しみやすい。
6. 大学レベルと大学院レベルはどこで分かれるのか
大学では、統計、信頼区間、モンテカルロ法、動的計画法、ゲーム理論、ナッシュ均衡、ベイズ、最適化など「道具」に出会う。
大学院っぽくなるのは、難しい単語より研究の回し方だ。
- AIが弱くなった。
- 原因候補を複数に分ける。
- 各原因なら何が観測されるか先に決める。
- 行動ログを追加する。
- 部品を一個ずつ変える。
- 同じ盤面から別の手を試す。
- 開発中に使っていないデータで最終試験する。
- ダメなら採用しない。
学部は道具箱を増やす。大学院は、どの道具でどう証拠を作るか考える。
7. 文系・理系で分けると、実はかなり混ざっている
木探索、動的計画法、強化学習、確率、統計、アルゴリズムは理系・情報系寄り。
ゲーム理論、ナッシュ均衡、パレート最適、リスク評価、意思決定、ロバスト最適化、CVaRは経済・経営科学でも出てくる。
因果推論は経済学、医学、社会科学、AIの全部に出る。
現実の問題は学部の壁を守ってくれない。
シャドバの盤面で学際研究が始まる。誰が予想した。
8. 大学や専門学校の本当の強みは「全部覚えること」ではない
学校で習った公式を何年後も全部覚えている必要はない。
一度でも「モンテカルロ法がある」「ベイズで確率を更新する」「最適化とゲーム理論は別の道具」と知っていると、必要になった時に問題へ名前を付けられる。
完全な未知なら、何を検索すればいいかすら分からない。
一度触れていれば、「これベイズっぽくない?」「最適化の話では?」「同じ条件で比較するなら統計を使えるな」と取っ掛かれる。
学校の価値は、知識の倉庫だけではない。脳内に『世界にはこういう道具があります』という目次を作ることでもある。
専門学校も同じ。基礎を触り、実務で必要になった瞬間に深掘る。
9. AIがあると「基礎だけ知っている」の価値が跳ね上がる
昔なら、理論名を知っていても「数式を組めない」「実装できない」「統計処理まで無理」で止まった。
今は「これモンテカルロ使える?」「相手手札が見えないならPOMDPっぽい?」「この勝率差が偶然か調べて」「原因をアブレーションで切って」と方向を示せば、AIに実装・計算・検証を手伝わせられる。
基礎知識の役割が、全部自分で解くための知識から、AIに正しい仕事を振るための索引へ広がった。
九九を覚えたから電卓に負けた、ではない。九九を知っているから、電卓に何を計算させればいいか分かる。
10. 「知識アレルギーがない」はかなり強い
POMDP、PSRO、CVaR、クラスタ・ブートストラップ。
文字だけ見ると圧が強い。
でも「無理」ではなく「知らんけど、何に使うやつ?」で入れると強い。
POMDPは見えない情報を予想する。PSROは強い対抗策を追加していく。CVaRは悪い方の成績を見る。クラスタ・ブートストラップは似たデータをまとめて誤差を見る。
最初から全部理解する必要はない。
一回触る。分からないところだけAIと掘る。実践で使う。
11. ワーキングメモリが弱いなら、頭の外へ出せばいい
カードゲームだけで、手札、盤面、PP、進化権、相手の返し、2ターン先、温存札、守護、回復、リーサルを持つ。
研究までやると、seed、hash、実験条件、信頼区間、仮説番号、テスト結果が増える。
全部脳内で持ったら終わる。
だから、記録はファイル、条件はconfig、計算はコード、大量比較はAI、実験履歴はログへ出す。
人間の頭には、「何を知りたいか」「この結果おかしくないか」だけ残す。
これはズルではない。電卓と同じで、脳の使いどころを変えている。
12. 結論:疾走ドーンしたいだけだったのに、教育の意味が分かった
カードゲームで勝ちたいだけだった。
なのに、人間のアドバイス、AIの先読み、確率、統計、ゲーム理論、因果推論、大学、専門学校、AI時代の学び方まで全部つながった。
学校の基礎は、その場で全部使いこなせなくてもいい。
一度見たことがある。名前を聞いたことがある。怖くない。
それだけで、数年後に実践へつながる入口になる。
AIがあると、その入口から先へ進むコストが一気に下がる。
人間は問いを持つ。AIは計算する。結果がおかしければ、人間がまた問い直す。
「全部自分でできる人」だけが研究できる時代から、「問いを立てて、道具を組み合わせられる人」も研究っぽいことができる時代へ。
なお、最初の目的は忘れてはいけない。
守護をどける。進化する。
疾走ドーン。
大学教育の伏線回収先、そこなんだ。
