用AI打造最強AI——看得到三回合未來卻變弱的闇影詩章WB AI,開始從勝路、敗路與「強制結果」的證明反推

題材:《Shadowverse: Worlds Beyond》

跑一萬次不會自動變真理,也可能只是高速重複同一個誤會。

閱讀功能說明

收聽會朗讀正文;速讀會依序顯示短語,速度可調。語言練習可對照現有的不同語言版本。收藏儲存在本瀏覽器中,可從播放器的收藏清單再次開啟。

分享這篇文章
廣告
廣告

1. 本來只想疾馳打臉,最後蓋了一間研究所

目標原本只是用AI找出目前最強牌組。固定Set 8、826張卡資料庫、engine commit、環境hash、合法deck與seed。歷史基準12,480局達到rule coverage 100%、unsupported 0、rule gap 0,raw AI仍交出Sword約79.8%、Rune約25.6%的異世界成績。

跑一萬次不會自動變真理,也可能只是高速重複同一個誤會。

2. 加入人類建議反而變弱,平均也會騙人

human-prior-v1 exact A/B為2,016 paired units / 4,032 games,baseline 50.99%,新策略49.36%,-1.64pt。Adaptive v2整體+0.74pt,卻因Runecraft -6.25pt觸發leader floor而REJECT;T11也因Abysscraft -16.67pt等失敗。

人類建議有條件,fixed weight卻可能把上下文殺掉。平均及格,不代表每個leader都沒有著火。

3. 根因分析先抓到研究系統自己的bug

發現max_nodes=160並未真正接到planner,以及actor與fixed-player視角混淆導致因果方向顛倒。平台bug修好後,廣泛性能仍未恢復。

Set 8 policy研究在20 experiments / 31,406 confirmed engine games後以PAUSED_COMPLETE_NO_PROMOTION結束。439 discordant units中完整解釋0、部分11、未解428。active保持human-prior-v1,8,064局final unseen holdout繼續封存。

4. 52套市場牌組打46,900局,誕生「腦死互毆榜」

市場corpus為52 decks / 25 archetypes / 7 leaders,市場分析46,900局;另有推薦7套直接7×7共1,512局。平均:Buff Forest 71.99%、Rally Sword 65.97%、Midrange Abyss 54.17%、Artifact Portal 54.17%、Ramp Dragon 53.70%、Evolution Haven 31.71%、Calgidensula Witch 18.29%。

這些是simulator-direct,不是天梯勝率。越是「現在強的操作未來也強」的牌組越容易被現AI駕馭;需要先吃虧換未來爆發的牌組更難。

5. 人類比賽裡Witch像在另一個宇宙

2026-08-08 Dexel Rising Cup #2的384份牌組中,Hand Witch有116份、約30.2%,為最多。AI直接7×7的Calgidensula Witch卻以18.29%墊底。不能假設兩者是同一40張,但人類與AI的Witch運用差距明顯。

Rally Sword在人類與AI兩邊都強,支持「對錯誤操作更耐受的策略可能更適合一般玩家」的實用假說。

6. Future Optionality:規則懂,順序與計畫幾乎沒有

審計7 leaders / 24 mechanics的RULE、STATE、VISIBILITY、IMMEDIATE VALUE、FUTURE VALUE、SEQUENCE、SEARCH、PLAN。27,810 decisions / 118,575 root candidates中僅8,878、7.49%有explicit future value。rule/state/immediate 24/24 supported,但sequence 23/24 MISSING、plan 20/24 MISSING。

Witch的抽牌順序、Dragon的PP與Awakening都顯示未來選擇權很重要。Dragon的12個MYOPIC_REVERSAL診斷=ramp 6 + Awakening 6,但沒有變成硬編碼bonus。

7. 真正做出三回合closed-loop planner

至少推進3個future turn boundaries,每次只執行一個action,觀察draw/random/opponent action後重新規劃,不偷看hidden hand或future draw order。

56局Ablation中root action 3,979/3,979、3-turn completion 100%、hidden-info 0、replans 81,621、plan changes 35,821。實作成功,性能卻比human-prior-v1低-25.0到-37.5pt。看得更遠,也錯得更遠。

8. leaf calibration拆開排序崩壞的位置

捕捉3,979 root-action leaves、1,009 unique leaves,生成54,208 terminal rollout rows。73個first divergence中leaf weighting 59、chance aggregation 12、opponent backup 2。

因此主要嫌疑不只是horizon,而是如何評價三回合後的leaf。舊Dragon 12個proxy在真實三回合search僅1/12實際改向ramp,再次證明proxy不是ground truth。

9. learned value預測更好,卻更不會選第一名

fresh holdout v1.1:727 leaves / 104 roots / 22,768 terminal rollouts、7 leaders。Brier 0.1144→0.0972,pairwise 75.7→78.9%改善。

但root argmax 59.6→39.4%、top2 73.1→64.4%、top3 82.7→76.0%、mean regret 4.42→5.29pt;Forest/Haven/Portal floor失敗。HOLD_OFFLINE。

預測漂亮不等於會按正確的牌。

10. 改成從lethal往回推

用LETHAL ← damage ← PP ← cards ← Spellboost/Awakening/Rally threshold ← current action做goal regression。Ramp的價值不是「+8分」,而是某條實際勝路需要按時抵達8PP。

從目標往後產生必要條件,再用真實engine往前驗證。

11. 也從自己的死亡往回推

從SELF_LOSS反推對手所需傷害、board damage、手牌追加damage、Ward處理、PP與公開資訊,判斷現在action切掉哪些對手勝路。

只追求安全會變成一直回血最後照樣輸的AI。RISK_REQUIRED允許在安全線幾乎無勝率時,選擇仍保留最高勝機的非forced-loss風險線。

12. 「強制」必須附證明範圍

勝方分PROVEN_WIN_NOW、FORCED_WIN_FULLY_OBSERVABLE_SUBTREE、FORCED_WIN_WITHIN_ENUMERATED_RESPONSE_SET、ROBUST_WIN_BELIEF、CONDITIONAL_WIN。敗方同樣區分proof、belief、conditional。

proof search中self=OR、opponent=AND;chance若稱確定必須涵蓋所有reachable outcomes。hidden hand truth、future draw order、strategy fusion一律禁止,只在觀測後replan。

13. action優先級改為階段gate

順序:proven win now → fully observable forced → enumerated forced → 排除可避免的proof-level forced loss → 最大expected final win probability → near-tie safety → robustness → route progress/cut → validated continuation value。

belief/conditional win不是forced。只有勝率更低且loss risk更高的action才能當strictly dominated排除。

14. 三回合是最低距離,不是一堵牆

初始H_MIN=3、selective H_MAX=5。只有lethal、forced response、重要threshold、delayed payoff或near tie尚未解決的branch延長。

rollout從32/candidate開始,模糊top候選追加64→128→256。root分UNIQUE_BEST / PRACTICAL_TIE / UNRESOLVED;epsilon 0.02/0.03/0.05只在development比較,新holdout前凍結。

15. 新QC:先抓自信滿滿的錯誤,再談最強AI

Primary要求hidden-info、future-draw、rule gap、strategy fusion、false proven、forced scope mislabel、chance completeness violation、lethal miss、avoidable forced loss、leakage全部0。再檢查7 leader coverage、argmax、mean/p90/p95 regret、leader floors、top2 best-set。

Brier/pairwise/calibration只是Secondary,不能救Primary failure。v1.1 holdout永久消耗,不再用於訓練與調參。

給AI未來,它變弱;教它勝率,預測變好但最佳動作變差。所以接下來同時從勝利與失敗反推,而且只有證據範圍真的支持時才叫「強制」。

用AI打造最強AI。目前QC可能比遊戲AI更強。這反而是健康的順序。


廣告

今天讀這篇

每一篇都回答讀完本文後常有的下一個問題。

瀏覽全部文章更多「卡牌與桌遊」文章

尋找其他文章

所有文章

Mendoi-chan

本站經營者

Mendoi-chan

把工作與日常生活中的麻煩整理成清楚的結構與下一步行動。