1. 本來只想疾走打臉,結果長出一座研究所
最初的問題非常單純:現在什麼牌組最強?收集公開牌組、固定規則,讓CPU互毆幾萬場,最後看排名就好。
現實很快給出第一個答案:能正確執行規則的AI,不等於會打牌的AI。 Set 8固定了826張卡、engine commit、environment hash、合法牌組與seed。歷史baseline 12,480場已做到rule coverage 100%、unsupported 0、rule gap 0,但原始AI仍然給出皇家約79.8%、精靈63.7%、龍60.9%、巫師25.6%的異世界成績。
把錯誤重複一萬次不會變成真理,只會做出一台非常穩定地犯錯的機器。
2. 加入人類經驗後,AI反而更弱
human-prior-v1加入保留重要資源、尊重setup、保護勝利路線、不要亂花進化資源等常見原則。exact A/B包含2,016 paired units與4,032 engine games。baseline為50.99%,human-prior-v1為49.36%,下降-1.64pt。
AI聽了人類建議,成績更差。
原因是人類建議有上下文。「留這張牌」在本回合不用就會死時當然不成立;「搶場」也不是叫你把唯一的combo路線拆掉。固定weight保留了句子,卻把條件先送進墓場。
3. Adaptive v2提高平均,卻把巫師打壞
Adaptive v2在LETHAL、SURVIVE、STABILIZE、SETUP、RESOURCE、PRESSURE等目標之間切換,並加入短搜尋、隱藏手牌近似與future value。整體相較v1為+0.74pt,但Runecraft下降-6.25pt,突破預先登記的leader floor -5pt,因此REJECT。
後續T11相較v1為+0.30pt,但相較reference-v5為-2.38pt,Abyss更是-16.67pt,再度REJECT。
平均成績看起來及格,打開考卷發現有一科正在燃燒。
4. 做根因分析時,研究員先被逮捕
先發現一個真的implementation defect:max_nodes=160沒有真正接到planner,導致9,067個decision超過名義上限。但接好後,廣泛對戰表現仍沒有改善。
更大的事故是actor attribution。一項被標示為「loss→win」的介入,是以fixed player視角正規化;從真正改變行動的actor視角來看,其實是win→loss。研究員把受害者當犯人抓了。
actor、direction與invariant修正後,分析平台更安全了,但AI表現的真兇仍然在逃。
5. 31,406場後,「還不知道」成為正式結論
Set 8方策研究最終包含20項實驗、31,406場確認的actual engine games。439個discordant units中,完整因果解釋表現原因的為0,部分解釋11,未解決428。
研究以PAUSED_COMPLETE_NO_PROMOTION結束,active仍為human-prior-v1,原定8,064場final unseen holdout完全沒有使用。
成果不是「超級AI」,而是不會因為某張漂亮圖表就錯誤晉升AI的研究裝置。
6. 接著讓52套市場牌組打了46,900場
市場corpus包含52 decks、25 archetypes、7 leaders。quick、broad、1~3張局部最佳化、unseen-seed排名與guide trace合計形成46,900場actual engine games。
最後7套推薦牌組再進行直接round robin:21 unordered pairs、1,512 games,每個非對角cell 72場,reference-v5與human-prior-v1各756場,先後手各756場。coverage 100%,unsupported、rule gap、hidden-info violation全部為0。
7. 「無腦互毆排名」誕生
| 排名 | 推薦牌組 | 直接7×7平均 | 最差對局 |
|---|---|---|---|
| 1 | Buff Forest | 71.99% | Abyss 59.72% |
| 2 | Rally Sword | 65.97% | Forest 31.94% |
| 3 | Midrange Abyss | 54.17% | 40.3% |
| 4 | Artifact Portal | 54.17% | 36.1% |
| 5 | Ramp Dragon | 53.70% | Forest 25.0% |
| 6 | Evolution Haven | 31.71% | Dragon 12.5% |
| 7 | Calgidensula Witch | 18.29% | Forest 1.4% |
凡是「現在下強牌、現在解場、現在打臉」通常也不會破壞未來的牌組,目前AI就比較會玩。需要用當前tempo交換兩三回合後爆發的牌組則更困難,因此得到「無腦互毆排名」這個非常不學術、卻意外有解釋力的名字。
8. 人類比賽裡,巫師像住在另一個宇宙
2026年8月8日Dexel Rising Cup #2共有64隊、192人、提交384套牌組。魔手巫師有116套,約占30.2%,明顯第一;AF疾走Portal 52、進化主教34、協作進化皇家29、Ramp Dragon 25。
人類高端環境把魔手巫師視為頂級meta;AI直接7×7中的Calgidensula Witch卻只有18.29%,排名最後。兩者不能直接假設是完全相同的40張牌,但「人類很強、現AI不會玩」的落差非常巨大。
Rally Sword則在人類與AI兩邊都強。於是出現一個粗糙但實用的推論:簡單AI也強+高手也強,可能代表對操作失誤較有容忍度。
9. Future Optionality全面監査
7個leader、24個mechanics被拆成RULE、STATE、VISIBILITY、IMMEDIATE VALUE、FUTURE VALUE、SEQUENCE、SEARCH、PLAN八層。
27,810個decision、118,575個root candidate中,只有8,878個——7.49%——帶有明確future value。24/24的rule、state與immediate value都SUPPORTED,但sequence有23/24 MISSING,plan有20/24 MISSING。
結論非常直接:AI知道規則,也懂「現在賺不賺」,但幾乎沒有順序與長期計畫。
10. 巫師:知道Spellboost存在,不等於理解Spellboost
Spellboost的rule/state存在,但visibility與future value為PARTIAL,sequence/plan為MISSING。尤其DRAW → SPELL與SPELL → DRAW會產生不同未來:先抽到的牌可能吃到後續boost,後抽到的牌不會回頭補上已經發生過的boost。
12個synthetic fixture中,DRAW_FIRST_BETTER=4、SPELL_FIRST_BETTER=0、EQUIVALENT=8。50個實際代表state的總結為STATE_DEPENDENT。所以正確方向不是新增「永遠先抽牌」的無腦規則,而是抽到之後重新規劃。
11. 龍:PP+1買的是未來行動權
Ramp現在可能虧場面,但max PP+1會解鎖下回合更高費牌、多牌組合、回復、解場與終結手段。尤其6→7會跨過Awakening門檻。
Future Optionality監査記錄了Dragoncraft MYOPIC_REVERSAL共12件:ramp 6+Awakening 6。即時control原本較高,但t+2 diagnostic continuation有時會反轉排名。
當然不能因此hard-code「ramp +10」,否則只是發明另一種笨AI。
12. 其他五個職業也有同一種疾病的變體
Forest有combo threshold、低費生成與bounce順序;Sword有Rally 9→10與multi-summon;Abyss有Shadows、reanimate pool內容與HP資源;Haven有Countdown與Act,其中「現在不用」本身就是保留未來選擇;Portal的0費token與copy會讓同回合sequence space爆炸。
EP、SEP、Extra PP、9張手牌上限、5個場位、5個leader area槽位,也都是「現在花掉」與「保留未來選擇權」之間的交換。
13. 於是真的做了三回合closed-loop planner
新planner強制實際推進至少三個future turn boundary,不是三個action,也不是三張牌。同時不固定三回合腳本:只執行一個action,觀察draw、generation、random結果,再從新state重新計算三回合。結構接近Receding Horizon / Model Predictive Control。
它不偷看未來自己的抽牌順序,也不看對手真實手牌,而使用belief sampling。FutureRelevantState保存Spellboost、Extra PP、Countdown、Act、Rally、Shadows、destroyed follower pool等公開資訊。沒有任何fixed optionality、Witch或ramp bonus。
14. 實作成功了,表現往地下室衝
Ablation只有56場actual engine games,但實作完整性很高:3,979 / 3,979 root action全部評估,three-turn completion 100%,hidden-info violation 0;observation replan 81,621次,plan change 35,821次。
然而base/widen相對human-prior-v1為**-37.5pt**,replan/state/robust為**-25.0pt**。所有candidate都突破預先登記的-10pt floor,因此正確判定為REJECT_ACTIVE_UNCHANGED。targeted、balanced broad、market 7×7、final holdout全部NOT_RUN。
我們成功做出一台看得更遠、卻更有自信地選錯未來的AI。
15. 這不代表「三回合已經足夠」
被排除的是「implementation根本沒有看到三回合」這個疑點,不是「三回合在策略上一定足夠」。另外base -37.5→replan -25.0雖然方向有趣,但每個candidate只有8 conditions,不能直接做因果結論。
舊Dragon 12個MYOPIC_REVERSAL用真實三回合engine search重放後,只有1/12真的改成ramp排名更高。舊proxy顯然不是ground truth。
新的主要嫌疑人變成:替三回合leaf打分的terminal/leaf evaluator,以及tree中的opponent response model。
16. 下一個問題:「你說這個未來是-150分,那從這裡真的打100場會贏幾場?」
下一輪不先改weight。先固定每個三回合leaf,把evaluator拆成raw feature→normalization→weight→contribution,特別追查-150級極端值到底是哪個term造成的。
接著從同一個leaf重啟32~128次直到terminal,建立empirical win rate。raw score不是機率,因此先做score→probability calibration,再測Brier score、log loss與reliability;排序能力則另外用Spearman、Kendall、same-root argmax accuracy、pairwise concordance與decision regret。
最後讓opponent response在human-prior-v1、reference-v5與search-based stress response之間cross-play。如此才能區分:leaf打分錯、對手模型錯、scale/weight錯、state representation不足,或三回合仍然太短。
17. 結論:未來看得見,評分表很可疑
AI已經從「現在什麼最強?」進化到「我真的能模擬三回合」,但我們仍不能相信它如何判斷看見的未來是好是壞。
旅程從皇家79.8%開始,經歷人類建議反向最佳化、巫師崩壞、actor bug、46,900場市場分析、Future Optionality監査,最後真的裝上三回合預知。
然後它變得更弱。
本來只想疾走打臉,下一門課卻叫Brier score與leaf-value calibration。這到底是《闇影詩章》還是研究所?
資料附錄
- Set 8 card DB: 826
- baseline: 12,480 games
- policy research: 31,406 actual engine games
- status:
PAUSED_COMPLETE_NO_PROMOTION - active:
human-prior-v1 - market: 52 decks / 25 archetypes / 7 leaders
- market analysis: 46,900 games
- direct 7×7: 1,512 games
- optionality audit: 27,810 decisions / 118,575 candidates / 7.49%
- sequence MISSING 23/24; plan MISSING 20/24
- Dragon reversals: 12 = ramp 6 + Awakening 6
- RH3 Ablation: 56 games
- root coverage: 3,979/3,979; completion 100%
- replans: 81,621; plan changes: 35,821
- result:
REJECT_ACTIVE_UNCHANGED - final holdout:
NOT_RUN
參考資料
- Shadowverse: Worlds Beyond官方Deck Portal與職業機制頁
- Dexel Rising Cup #2環境報告
- Silver & Veness (2010), POMCP
- Cowling, Powley & Whitehouse (2012), ISMCTS
- Model Predictive Control / Receding Horizon Control
- Brier score、reliability與clustered validation研究
