1. 一開始只是想贏卡牌遊戲
原本目標很單純:加PP,拆守護,疾馳打臉,贏。
但一旦開始讓AI自動打數千場、比較套牌,就會冒出一堆問題:差距只是運氣嗎?平均勝率夠嗎?某個對局爛到爆怎麼辦?對手手牌看不到要怎麼判斷?新策略變弱了,到底哪裡出錯?
接著蒙地卡羅法、貝葉斯更新、納許均衡、動態規劃、部分可觀測馬可夫決策過程、穩健最佳化、因果推論、反事實,全跑出來。
重點是,人不必把所有計算塞進腦子。人負責決定“我想知道什麼”,AI和程式負責大量重複、記錄、統計與比較。
2. 假裝我們創了一個職業:卡牌遊戲老師
要把AI訓練得像強玩家,其實很像帶新人。
這位“實習老師”要學換牌、留牌、進化資源、預測對手、兩三回合規劃、斬殺、手牌上限、場地空位。
全部一次放進人腦很累,所以把工作拆開:先決定勝利條件,再決定哪些資源不能現在花,最後確認下回合會不會死。
接著讓AI實習數千場。
實習4,000場,已經不是實習,是工業級新人訓練。
3. 人類建議照字面執行,反而可能變弱
攻略常說:“這張要留。”“SEP留後面。”“龍族早點跳費。”“Combo零件留到終結。”
通常沒錯,但都有隱藏條件。
要留,除非現在不用就會死。 進化要省,除非現在交能完全封住對手。 要跳費,除非跳費會直接把場面送掉。
人類會用經驗補上這些“但是”。AI可能只看到句子。
人:“基本要留。” AI:“收到。” AI:死亡。
所以遵守指示和理解指示目的、判斷例外,是兩種不同能力。
4. 樹搜尋:把“這一步、下一步、再下一步”變成樹
假設現在有三個選擇:A解怪、B打臉、C先不出牌。
每個選擇都會進入不同未來,對手也有不同回應。把這些分支連起來,就是樹搜尋。
但分支會爆炸。每一步10個候選,4步就可能有約10,000條分支。
所以實務上會限制深度、用束搜尋只保留較好的分支,再用節點預算限制計算量。
但砍太快會把“現在弱、兩回合後超強”的路線砍掉。Combo套牌最怕這件事。
因此搜尋不是單純“看更遠”。真正重要的是:哪些未來值得繼續保留。
5. 其他理論其實都各有工作
蒙地卡羅法:算不完,就多試幾次看平均。
貝葉斯更新:看到對手行動後,調整“他持有某牌”的機率。
POMDP:真實狀態有一部分看不到時,用可見資訊和預測決策。
極小極大法:假設對手會給最難受的回應。
納許均衡:雙方互相調整後,單方改策略也難以多賺。
無悔學習:減少“早知道選另一個”的長期後悔。
穩健最佳化:不只平均強,也避免某些對局直接崩掉。
CVaR:看壞結果那一整段,不只最差一個點。
配對A/B:相同seed、先後、套牌,只改策略比較。
信賴區間:先看差距可能有多少只是隨機波動。
消融實驗:一次拔掉一個零件,看哪個真的有效。
反事實:同一局面試“如果走另一手呢?”
因果推論:不把同時發生當成原因,而是驗證改原因後結果是否改變。
英文很兇,翻成人話就是:多試、更新猜測、看壞情況、公平比較、一次查一個嫌疑犯、試另一條時間線。
6. 大學和研究所感覺差在哪
統計、蒙地卡羅、動態規劃、賽局理論、貝葉斯、最佳化,很多大學就會碰到。
更像研究所的部分不是難字,而是研究流程:發現退化、列出原因假設、先定義應該看到什麼證據、加行動紀錄、一次只改一個部分、從同一局面測另一個行動、最後用沒見過的資料做測試,沒過就不採用。
大學比較像拿到工具箱。研究比較像決定:怎麼用工具做出可靠證據。
7. 文科還理科?現實問題會混在一起
樹搜尋、演算法、機率、強化學習很偏資訊與理工。
賽局理論、納許均衡、帕累托最適、風險、決策,也大量存在於經濟與管理科學。
因果推論更橫跨經濟、醫學、社會科學與AI。
現實問題不會乖乖待在科系邊界內。
一張卡牌桌也可能突然長成跨領域研究室。
8. 大學與專門教育的價值,不是永遠記得所有公式
幾年後忘記公式很正常。
但只要知道:“有蒙地卡羅這種方法。”“貝葉斯可以更新機率。”“最佳化跟賽局理論是不同工具。”
遇到問題時,起點就不一樣。
完全沒接觸過,連搜尋什麼都不知道。
接觸過一次,就可以說:“這是不是有點像貝葉斯?”“這應該算最佳化問題吧?”“要不要固定條件做統計比較?”
教育會在腦中建立工具目錄。
專門學校也一樣:先學基礎,工作真的用到時再深入。
9. AI讓“只知道基礎”的價值變大
以前知道理論名字,但不會推數學、不會實作、不會統計,常常還是停住。
現在可以先定方向:“這裡適合蒙地卡羅嗎?”“隱藏資訊是不是POMDP問題?”“幫我看差距是不是隨機。”“做消融,把原因拆開。”
AI可以協助實作與計算。
基礎知識不只用來自己全部解完,還變成正確指揮AI的索引。
10. 沒有“知識過敏”很強
POMDP、PSRO、CVaR、cluster bootstrap。
名字看起來很有攻擊性。
但如果第一反應是“這是幹嘛的?”而不是“我不行”,就能進門。
POMDP:處理隱藏資訊。 PSRO:不斷加入強反制。 CVaR:看壞結果區域。 cluster bootstrap:考慮相關資料群組後估誤差。
不用先完全懂。先碰,再和AI一起往下挖。
11. 工作記憶不夠,就把東西搬到腦外
卡牌遊戲本來就要記手牌、盤面、PP、進化、對手反擊、守護、回血、斬殺、未來回合。
研究還多seed、hash、config、假設、信賴區間、實驗歷史。
全部放腦子沒有必要。
條件放config,計算交給程式,歷史交給log,大量比較交給AI。
人腦只留:“我想知道什麼?”“這結果是不是怪怪的?”
這不是作弊,是把腦力留給判斷。
12. 結論:只是想疾馳打臉,卻意外懂了教育的意義
一款卡牌遊戲把搜尋、機率、統計、賽局理論、因果推論、教育和AI工作流串在一起。
學校基礎不必當場全部精通。
看過、知道名字、不害怕,就可能在多年後變成實戰入口。
AI再把“聽過”到“真的拿來驗證”的成本大幅降低。
人提出問題。AI計算。結果怪,人再問。
最後還是原本那件事。
拆守護。進化。
疾馳打臉。
教育伏筆居然在這裡回收。
