給「無腦AI」裝上三回合預知後,它反而更弱了——《闇影詩章:凌越世界》46,900場市場模擬與獨立AI研究揭示的「看得見未來,卻不會替未來打分」問題

題材:《Shadowverse: Worlds Beyond》

最初的問題非常單純:現在什麼牌組最強?收集公開牌組、固定規則,讓CPU互毆幾萬場,最後看排名就好。

閱讀功能說明

收聽會朗讀正文;速讀會依序顯示短語,速度可調。語言練習可對照現有的不同語言版本。收藏儲存在本瀏覽器中,可從播放器的收藏清單再次開啟。

分享這篇文章
廣告
廣告

1. 本來只想疾走打臉,結果長出一座研究所

最初的問題非常單純:現在什麼牌組最強?收集公開牌組、固定規則,讓CPU互毆幾萬場,最後看排名就好。

現實很快給出第一個答案:能正確執行規則的AI,不等於會打牌的AI。 Set 8固定了826張卡、engine commit、environment hash、合法牌組與seed。歷史baseline 12,480場已做到rule coverage 100%、unsupported 0、rule gap 0,但原始AI仍然給出皇家約79.8%、精靈63.7%、龍60.9%、巫師25.6%的異世界成績。

把錯誤重複一萬次不會變成真理,只會做出一台非常穩定地犯錯的機器。

2. 加入人類經驗後,AI反而更弱

human-prior-v1加入保留重要資源、尊重setup、保護勝利路線、不要亂花進化資源等常見原則。exact A/B包含2,016 paired units與4,032 engine games。baseline為50.99%,human-prior-v1為49.36%,下降-1.64pt。

AI聽了人類建議,成績更差。

原因是人類建議有上下文。「留這張牌」在本回合不用就會死時當然不成立;「搶場」也不是叫你把唯一的combo路線拆掉。固定weight保留了句子,卻把條件先送進墓場。

3. Adaptive v2提高平均,卻把巫師打壞

Adaptive v2在LETHAL、SURVIVE、STABILIZE、SETUP、RESOURCE、PRESSURE等目標之間切換,並加入短搜尋、隱藏手牌近似與future value。整體相較v1為+0.74pt,但Runecraft下降-6.25pt,突破預先登記的leader floor -5pt,因此REJECT。

後續T11相較v1為+0.30pt,但相較reference-v5為-2.38pt,Abyss更是-16.67pt,再度REJECT。

平均成績看起來及格,打開考卷發現有一科正在燃燒。

4. 做根因分析時,研究員先被逮捕

先發現一個真的implementation defect:max_nodes=160沒有真正接到planner,導致9,067個decision超過名義上限。但接好後,廣泛對戰表現仍沒有改善。

更大的事故是actor attribution。一項被標示為「loss→win」的介入,是以fixed player視角正規化;從真正改變行動的actor視角來看,其實是win→loss。研究員把受害者當犯人抓了。

actor、direction與invariant修正後,分析平台更安全了,但AI表現的真兇仍然在逃。

5. 31,406場後,「還不知道」成為正式結論

Set 8方策研究最終包含20項實驗、31,406場確認的actual engine games。439個discordant units中,完整因果解釋表現原因的為0,部分解釋11,未解決428。

研究以PAUSED_COMPLETE_NO_PROMOTION結束,active仍為human-prior-v1,原定8,064場final unseen holdout完全沒有使用。

成果不是「超級AI」,而是不會因為某張漂亮圖表就錯誤晉升AI的研究裝置。

6. 接著讓52套市場牌組打了46,900場

市場corpus包含52 decks、25 archetypes、7 leaders。quick、broad、1~3張局部最佳化、unseen-seed排名與guide trace合計形成46,900場actual engine games。

最後7套推薦牌組再進行直接round robin:21 unordered pairs、1,512 games,每個非對角cell 72場,reference-v5與human-prior-v1各756場,先後手各756場。coverage 100%,unsupported、rule gap、hidden-info violation全部為0。

7. 「無腦互毆排名」誕生

排名 推薦牌組 直接7×7平均 最差對局
1 Buff Forest 71.99% Abyss 59.72%
2 Rally Sword 65.97% Forest 31.94%
3 Midrange Abyss 54.17% 40.3%
4 Artifact Portal 54.17% 36.1%
5 Ramp Dragon 53.70% Forest 25.0%
6 Evolution Haven 31.71% Dragon 12.5%
7 Calgidensula Witch 18.29% Forest 1.4%

凡是「現在下強牌、現在解場、現在打臉」通常也不會破壞未來的牌組,目前AI就比較會玩。需要用當前tempo交換兩三回合後爆發的牌組則更困難,因此得到「無腦互毆排名」這個非常不學術、卻意外有解釋力的名字。

8. 人類比賽裡,巫師像住在另一個宇宙

2026年8月8日Dexel Rising Cup #2共有64隊、192人、提交384套牌組。魔手巫師有116套,約占30.2%,明顯第一;AF疾走Portal 52、進化主教34、協作進化皇家29、Ramp Dragon 25。

人類高端環境把魔手巫師視為頂級meta;AI直接7×7中的Calgidensula Witch卻只有18.29%,排名最後。兩者不能直接假設是完全相同的40張牌,但「人類很強、現AI不會玩」的落差非常巨大。

Rally Sword則在人類與AI兩邊都強。於是出現一個粗糙但實用的推論:簡單AI也強+高手也強,可能代表對操作失誤較有容忍度。

9. Future Optionality全面監査

7個leader、24個mechanics被拆成RULE、STATE、VISIBILITY、IMMEDIATE VALUE、FUTURE VALUE、SEQUENCE、SEARCH、PLAN八層。

27,810個decision、118,575個root candidate中,只有8,878個——7.49%——帶有明確future value。24/24的rule、state與immediate value都SUPPORTED,但sequence有23/24 MISSING,plan有20/24 MISSING。

結論非常直接:AI知道規則,也懂「現在賺不賺」,但幾乎沒有順序與長期計畫。

10. 巫師:知道Spellboost存在,不等於理解Spellboost

Spellboost的rule/state存在,但visibility與future value為PARTIAL,sequence/plan為MISSING。尤其DRAW → SPELL與SPELL → DRAW會產生不同未來:先抽到的牌可能吃到後續boost,後抽到的牌不會回頭補上已經發生過的boost。

12個synthetic fixture中,DRAW_FIRST_BETTER=4、SPELL_FIRST_BETTER=0、EQUIVALENT=8。50個實際代表state的總結為STATE_DEPENDENT。所以正確方向不是新增「永遠先抽牌」的無腦規則,而是抽到之後重新規劃。

11. 龍:PP+1買的是未來行動權

Ramp現在可能虧場面,但max PP+1會解鎖下回合更高費牌、多牌組合、回復、解場與終結手段。尤其6→7會跨過Awakening門檻。

Future Optionality監査記錄了Dragoncraft MYOPIC_REVERSAL共12件:ramp 6+Awakening 6。即時control原本較高,但t+2 diagnostic continuation有時會反轉排名。

當然不能因此hard-code「ramp +10」,否則只是發明另一種笨AI。

12. 其他五個職業也有同一種疾病的變體

Forest有combo threshold、低費生成與bounce順序;Sword有Rally 9→10與multi-summon;Abyss有Shadows、reanimate pool內容與HP資源;Haven有Countdown與Act,其中「現在不用」本身就是保留未來選擇;Portal的0費token與copy會讓同回合sequence space爆炸。

EP、SEP、Extra PP、9張手牌上限、5個場位、5個leader area槽位,也都是「現在花掉」與「保留未來選擇權」之間的交換。

13. 於是真的做了三回合closed-loop planner

新planner強制實際推進至少三個future turn boundary,不是三個action,也不是三張牌。同時不固定三回合腳本:只執行一個action,觀察draw、generation、random結果,再從新state重新計算三回合。結構接近Receding Horizon / Model Predictive Control。

它不偷看未來自己的抽牌順序,也不看對手真實手牌,而使用belief sampling。FutureRelevantState保存Spellboost、Extra PP、Countdown、Act、Rally、Shadows、destroyed follower pool等公開資訊。沒有任何fixed optionality、Witch或ramp bonus。

14. 實作成功了,表現往地下室衝

Ablation只有56場actual engine games,但實作完整性很高:3,979 / 3,979 root action全部評估,three-turn completion 100%,hidden-info violation 0;observation replan 81,621次,plan change 35,821次。

然而base/widen相對human-prior-v1為**-37.5pt**,replan/state/robust為**-25.0pt**。所有candidate都突破預先登記的-10pt floor,因此正確判定為REJECT_ACTIVE_UNCHANGED。targeted、balanced broad、market 7×7、final holdout全部NOT_RUN。

我們成功做出一台看得更遠、卻更有自信地選錯未來的AI。

15. 這不代表「三回合已經足夠」

被排除的是「implementation根本沒有看到三回合」這個疑點,不是「三回合在策略上一定足夠」。另外base -37.5→replan -25.0雖然方向有趣,但每個candidate只有8 conditions,不能直接做因果結論。

舊Dragon 12個MYOPIC_REVERSAL用真實三回合engine search重放後,只有1/12真的改成ramp排名更高。舊proxy顯然不是ground truth。

新的主要嫌疑人變成:替三回合leaf打分的terminal/leaf evaluator,以及tree中的opponent response model。

16. 下一個問題:「你說這個未來是-150分,那從這裡真的打100場會贏幾場?」

下一輪不先改weight。先固定每個三回合leaf,把evaluator拆成raw feature→normalization→weight→contribution,特別追查-150級極端值到底是哪個term造成的。

接著從同一個leaf重啟32~128次直到terminal,建立empirical win rate。raw score不是機率,因此先做score→probability calibration,再測Brier score、log loss與reliability;排序能力則另外用Spearman、Kendall、same-root argmax accuracy、pairwise concordance與decision regret。

最後讓opponent response在human-prior-v1、reference-v5與search-based stress response之間cross-play。如此才能區分:leaf打分錯、對手模型錯、scale/weight錯、state representation不足,或三回合仍然太短。

17. 結論:未來看得見,評分表很可疑

AI已經從「現在什麼最強?」進化到「我真的能模擬三回合」,但我們仍不能相信它如何判斷看見的未來是好是壞。

旅程從皇家79.8%開始,經歷人類建議反向最佳化、巫師崩壞、actor bug、46,900場市場分析、Future Optionality監査,最後真的裝上三回合預知。

然後它變得更弱。

本來只想疾走打臉,下一門課卻叫Brier score與leaf-value calibration。這到底是《闇影詩章》還是研究所?

資料附錄

  • Set 8 card DB: 826
  • baseline: 12,480 games
  • policy research: 31,406 actual engine games
  • status: PAUSED_COMPLETE_NO_PROMOTION
  • active: human-prior-v1
  • market: 52 decks / 25 archetypes / 7 leaders
  • market analysis: 46,900 games
  • direct 7×7: 1,512 games
  • optionality audit: 27,810 decisions / 118,575 candidates / 7.49%
  • sequence MISSING 23/24; plan MISSING 20/24
  • Dragon reversals: 12 = ramp 6 + Awakening 6
  • RH3 Ablation: 56 games
  • root coverage: 3,979/3,979; completion 100%
  • replans: 81,621; plan changes: 35,821
  • result: REJECT_ACTIVE_UNCHANGED
  • final holdout: NOT_RUN

參考資料

  • Shadowverse: Worlds Beyond官方Deck Portal與職業機制頁
  • Dexel Rising Cup #2環境報告
  • Silver & Veness (2010), POMCP
  • Cowling, Powley & Whitehouse (2012), ISMCTS
  • Model Predictive Control / Receding Horizon Control
  • Brier score、reliability與clustered validation研究

廣告

今天讀這篇

每一篇都回答讀完本文後常有的下一個問題。

瀏覽全部文章更多「卡牌與桌遊」文章

尋找其他文章

所有文章

Mendoi-chan

本站經營者

Mendoi-chan

把工作與日常生活中的麻煩整理成清楚的結構與下一步行動。

廣告

最新文章

  1. 1偷內衣的神父會被抓,「播種大叔」卻是英雄?漫畫刪掉最挑受眾的癖好,原作甚至覺醒《想像懷孕》
  2. 2人類,這個真的打不贏——把《PRAGMATA》當月球美術館逛著逛著,我開始對機械文明的工業產能絕望了
  3. 3為什麼我的攻擊總是輸?——焰/光玩家,被一八的無形判定和鱷魚肚皮搞到破防
  4. 4給不擅長一個人行動的人:拆解「沒人陪就動不了」,培養你的「獨處行動 OS」
  5. 5月面基地還沒壞完,我的操作系統先崩了

推薦閱讀

廣告