疾走ドーンしたいだけなのに、大学で聞いた理論が全部つながった――AI時代の「基礎だけ学んで実践」が強すぎる

やりたいことは単純だった。PPを増やす。守護をどける。疾走ドーン。勝ちたい。

読書機能の使い方

聴く:本文を読み上げます。速読:語句を順に表示し、速さを調整できます。語学練習:別の言語版と対訳を読み比べます。保存:このブラウザーにブックマークし、プレイヤーの保存済み一覧から開けます。

この記事をシェア
広告
広告

1. はじまりは「シャドバで勝ちたい」だった

やりたいことは単純だった。PPを増やす。守護をどける。疾走ドーン。勝ちたい。

それだけのはずが、カードゲームをAIに何千戦もやらせて安定して強いデッキを調べ始めると、「同じ条件で比べないと偶然かもしれない」「平均勝率だけ高くても一つの対面が壊滅していたら危ない」「相手の手札は見えないから確率で考える必要がある」「AIが弱くなったなら行動ログを取って原因を切り分けよう」と話が巨大化した。

気づけば出てくる単語が、モンテカルロ法、ベイズ更新、ナッシュ均衡、動的計画法、部分観測マルコフ決定過程、ロバスト最適化、因果推論、反実仮想。

「シャドバやりたい」から入ったのに、急に大学の講義棟が生えてきた。

しかも人間が全部の数式を暗算しているわけではない。全部抱えるとワーキングメモリが死ぬ。だから、人間は「何を知りたいか」を決め、AIとコードは「どう確かめるか」を大量処理する。

2. 「シャドバ先生」という職種を勝手に作る

人間っぽくプレイするAIを作るのは、新人教育に近い。

仮にAIを「シャドバ先生インターン」と呼ぶ。先生には、マリガン、温存、進化権、相手の返し、2〜3ターン先、リーサル、手札上限、盤面の空きまで判断してもらう。

一度に全部を頭でやるのはしんどいので業務を分解する。

まず勝ち筋を決める。次に今使ってはいけない資源を決める。最後に次のターン死なないか確認する。

会社でいえば、業務設計、マニュアル、研修、OJT、評価制度まで作る。そしてAIに数千戦させる。

インターンなのに実習4,000戦。ブラック研究室である。

3. 人のアドバイスを「その通り実行する」のが難しすぎる

人間の攻略ノウハウをAIへ入れても、単純には強くならなかった。

「このカードは温存」「進化権は後半へ」「ドラゴンはPPを伸ばす」「コンボ札はフィニッシュまで持つ」。文章だけなら正しい。

でも実戦では、「基本は温存。ただし今使わないと死ぬ」「進化は残す。ただし今使えば相手の次ターンを潰せる」「PPは伸ばす。ただし盤面を放置したら死ぬ」という但し書きが大量にある。

人間同士なら「温存ね」で空気を読む。AIは真面目だ。

「温存ですね。了解しました」

そのまま死亡。

良い実行者は命令文をコピーするのではなく、目的・条件・例外を復元している。

4. ノード探索――「この手の次、その次」を木で読む

今の手が3つあるとする。

A:敵を倒す。B:相手の顔を攻撃する。C:カードを使わず温存する。

A、B、Cの先には別々の未来があり、その先で相手も複数の返しを持つ。これを木として読むのが木探索(Tree Search)。

ただし毎回10個候補があるなら、1手先10、2手先100、3手先1,000、4手先10,000と枝が爆発する。

そこで、何手先まで読むかを決める深さ制限、良さそうな上位だけ残すビーム探索、最大何個の未来を見るかを決めるノード予算を使う。

問題は削りすぎると、「今は弱そうだけど2ターン後に超強い手」を捨てること。コンボデッキでこれをやると、未来のためのカードをAIが「今弱いですね」とゴミ箱へ投げる。

探索の本体は、ただ深く読むことではない。どの未来を残すかである。

5. ほかの理論も、実は全部役割が違う

  • モンテカルロ法:未来を何度も試して平均を見る。
  • ベイズ更新:相手の行動を見て「このカードを持っていそう」の確率を変える。
  • 部分観測マルコフ決定過程(POMDP):相手手札のような見えない情報を、見える情報と予想で扱う。
  • ミニマックス法:相手も最善の返しをすると考える。
  • ナッシュ均衡:お互い対策した末に、片方だけ戦略を変えても得しにくい状態を考える。
  • 無後悔学習:「別の戦略にすればよかった」という長期の後悔を小さくする。
  • ロバスト最適化:平均だけでなく、苦手対面で大事故しない強さを求める。
  • CVaR:悪い方の結果のまとまりを見る。
  • 対応ありA/B比較:同じ乱数・先後・デッキで方策だけ変える。
  • 信頼区間:「+1%!」のうちどれだけが偶然かを見る。
  • アブレーション実験:AIの部品を一個ずつ外して犯人を探す。
  • 反実仮想:「あの時別の手なら?」を同じ盤面から試す。
  • 因果推論:「一緒に起きた」ではなく、本当にそれを変えると結果が変わるかを見る。

英語だとラスボス軍団。日本語だと、何回も試す、予想を更新する、最悪も見る、同じ条件で比べる、犯人を一個ずつ調べる。

急に親しみやすい。

6. 大学レベルと大学院レベルはどこで分かれるのか

大学では、統計、信頼区間、モンテカルロ法、動的計画法、ゲーム理論、ナッシュ均衡、ベイズ、最適化など「道具」に出会う。

大学院っぽくなるのは、難しい単語より研究の回し方だ。

  1. AIが弱くなった。
  2. 原因候補を複数に分ける。
  3. 各原因なら何が観測されるか先に決める。
  4. 行動ログを追加する。
  5. 部品を一個ずつ変える。
  6. 同じ盤面から別の手を試す。
  7. 開発中に使っていないデータで最終試験する。
  8. ダメなら採用しない。

学部は道具箱を増やす。大学院は、どの道具でどう証拠を作るか考える。

7. 文系・理系で分けると、実はかなり混ざっている

木探索、動的計画法、強化学習、確率、統計、アルゴリズムは理系・情報系寄り。

ゲーム理論、ナッシュ均衡、パレート最適、リスク評価、意思決定、ロバスト最適化、CVaRは経済・経営科学でも出てくる。

因果推論は経済学、医学、社会科学、AIの全部に出る。

現実の問題は学部の壁を守ってくれない。

シャドバの盤面で学際研究が始まる。誰が予想した。

8. 大学や専門学校の本当の強みは「全部覚えること」ではない

学校で習った公式を何年後も全部覚えている必要はない。

一度でも「モンテカルロ法がある」「ベイズで確率を更新する」「最適化とゲーム理論は別の道具」と知っていると、必要になった時に問題へ名前を付けられる。

完全な未知なら、何を検索すればいいかすら分からない。

一度触れていれば、「これベイズっぽくない?」「最適化の話では?」「同じ条件で比較するなら統計を使えるな」と取っ掛かれる。

学校の価値は、知識の倉庫だけではない。脳内に『世界にはこういう道具があります』という目次を作ることでもある。

専門学校も同じ。基礎を触り、実務で必要になった瞬間に深掘る。

9. AIがあると「基礎だけ知っている」の価値が跳ね上がる

昔なら、理論名を知っていても「数式を組めない」「実装できない」「統計処理まで無理」で止まった。

今は「これモンテカルロ使える?」「相手手札が見えないならPOMDPっぽい?」「この勝率差が偶然か調べて」「原因をアブレーションで切って」と方向を示せば、AIに実装・計算・検証を手伝わせられる。

基礎知識の役割が、全部自分で解くための知識から、AIに正しい仕事を振るための索引へ広がった。

九九を覚えたから電卓に負けた、ではない。九九を知っているから、電卓に何を計算させればいいか分かる。

10. 「知識アレルギーがない」はかなり強い

POMDP、PSRO、CVaR、クラスタ・ブートストラップ。

文字だけ見ると圧が強い。

でも「無理」ではなく「知らんけど、何に使うやつ?」で入れると強い。

POMDPは見えない情報を予想する。PSROは強い対抗策を追加していく。CVaRは悪い方の成績を見る。クラスタ・ブートストラップは似たデータをまとめて誤差を見る。

最初から全部理解する必要はない。

一回触る。分からないところだけAIと掘る。実践で使う。

11. ワーキングメモリが弱いなら、頭の外へ出せばいい

カードゲームだけで、手札、盤面、PP、進化権、相手の返し、2ターン先、温存札、守護、回復、リーサルを持つ。

研究までやると、seed、hash、実験条件、信頼区間、仮説番号、テスト結果が増える。

全部脳内で持ったら終わる。

だから、記録はファイル、条件はconfig、計算はコード、大量比較はAI、実験履歴はログへ出す。

人間の頭には、「何を知りたいか」「この結果おかしくないか」だけ残す。

これはズルではない。電卓と同じで、脳の使いどころを変えている。

12. 結論:疾走ドーンしたいだけだったのに、教育の意味が分かった

カードゲームで勝ちたいだけだった。

なのに、人間のアドバイス、AIの先読み、確率、統計、ゲーム理論、因果推論、大学、専門学校、AI時代の学び方まで全部つながった。

学校の基礎は、その場で全部使いこなせなくてもいい。

一度見たことがある。名前を聞いたことがある。怖くない。

それだけで、数年後に実践へつながる入口になる。

AIがあると、その入口から先へ進むコストが一気に下がる。

人間は問いを持つ。AIは計算する。結果がおかしければ、人間がまた問い直す。

「全部自分でできる人」だけが研究できる時代から、「問いを立てて、道具を組み合わせられる人」も研究っぽいことができる時代へ。

なお、最初の目的は忘れてはいけない。

守護をどける。進化する。

疾走ドーン。

大学教育の伏線回収先、そこなんだ。


PRこのテーマの本を探す

この記事には広告(アフィリエイトリンク)が含まれます。 広告について Amazonのアソシエイトとして、mendoi-appsは適格販売により収入を得ています。

今日これ読んで

この記事を読んだ人の次の疑問に、それぞれ答える記事です。

すべての記事から探す「AI」の記事をもっと見る

広告

他の記事を探す

すべての記事

めんどいちゃん

この記事を書いた人

めんどいちゃん

仕事や日常の「めんどい」を構造化して、次に動きやすくする記事を書いています。

このサイトについて
広告

新着記事

  1. 1『氷の城壁』『氷の城壁』小雪は冷たいんじゃないの。中で味噌が発酵してるのよ――「分かるわお姉さん」と読む反芻・脳内予想・境界線
  2. 2面接で「圧が強い人がいても大丈夫?」を3回聞かれたら、もう会社説明になってない?
  3. 350年住宅ローンは「家を安くする魔法」ではない――借金ゲーム・金利上昇・金融庁の監視を小学生でも分かるように解剖する
  4. 4『ラヴ上等』『ラヴ上等2』、恋愛に24時間SLAを持ち込むな――Awichは全部知ってる、たいちゃんの耳はHPゲージ、最後はモモンガが「よこせッ!」
  5. 5『ちいかわ』装備:モモンガ、属性:六角堂帰り――人類は他人の「設定資料集」を勝手に書く
広告