想到卡牌模擬器,最可怕的畫面就是一張張輸入名稱、費用、數值、效果與特殊處理。
但如果卡牌資料本來就是JSON等結構化格式,再加上已有可用的開源對戰引擎,工作會完全不同。資料可批次讀取,共通效果沿用既有規則,真正新的機制才需要個別處理。
這個案例裡,Beyond Decks已經有卡牌資料、牌組、seed、replay、Battle Sim、AI和benchmark。
因此不是重做遊戲,而是在現成沙盒上加研究設備與更好的腦袋。
1. 把演出全拿掉,一場卡牌對戰快得很好笑
真實客戶端會花時間在抽牌、拖曳、語音、進化、攻擊動畫、傷害顯示與人類思考。
模擬器大致只有:
狀態A
→ 列合法行動
→ 選行動
→ 更新狀態
→ 狀態B
直到有人輸。
真正昂貴的不是演出,而是AI要看多遠的未來。
2. 基礎模擬器不是玩具,而是相當認真的工程
現有系統已經有deterministic seed、replay、目標選擇、短期look-ahead、整回合規劃、lethal solver、職業機制、benchmark、全卡覆蓋稽核與runtime檢查。
作者也明說,它不是完美的比賽級人類AI,而是中等水準。
這反而適合研究。規則、卡牌、seed、replay、對戰裝置都已經有了,真正值得補的是人類式決策層。
3. 12,480局出現皇家約79.8%——大量樣本也會放大AI偏科
先前12,480局中,規則覆蓋很好,但皇家約79.8%、巫師約25.6%。
不能因為局數大就直接說皇家宇宙最強。
如果皇家AI只要「下從者、搶場、打臉」,而複雜牌組把組件、進化、手牌上限與未來全亂用,結果自然會歪。
大量模擬的危險是:把錯誤策略測得非常精確。
4. 所以加入人類打法知識——不是背答案,而是加入思考習慣
收集換牌、保留牌、進化資源、手牌/場面空間、攻守切換、對手強勢回合、替代勝法、2~3回合斬殺與常見失誤。
不要硬寫「這裡一定出X」。
改用:
hold_value +20
future_combo_value +30
opponent_counter_cost +25
過早使用 -40
人類攻略是搜尋方向的偏好,不是唯一答案。
5. 現在實際跑4,032局——2,016是比較條件數
56組 × 2方向 × 18 seed = 2,016 A/B條件
每個條件由基準策略與人類知識策略各打一局,所以實際是4,032局。
2,016不是神祕數字,而是兩個AI做同一批考題的數量。
6. 大量執行前先停下來檢查
正式跑之前先修「終結卡太早使用」的回歸問題,再用固定真實卡庫與牌表做先後手smoke。
同時驗證覆蓋率、未支援卡、規則缺口、DB hash、重複ID、引用缺失與知識庫版本。
因為已經知道:AI錯了也能很勤奮地跑一萬局。
先驗證前提,再花樣本。
7. human-prior v1仍不是真正的臨機應變
同一個跳費龍應該依局面改變目的:
正常 → 跳費
下回合要死 → 停止跳費,防守
對手沒資源 → 進攻
終結卡在手但準備不足 → 保留
準備完成 → 啟動
需要的是每回合重新計算現在最重要的目標。
8. Adaptive AI動態切換 ATTACK / SURVIVE / SETUP / RESOURCE / LETHAL
根據血量、場面、手牌、PP、進化資源、對手壓力、預估傷害與combo完成度,動態給模式打分。
快死時,SURVIVE必須高於RESOURCE。
臨機應變不是死規則,而是每次比較現在使用與未來保留的價值。
9. 看2~3回合未來,但用人類知識剪枝
全部展開會爆炸。
50合法行動
→ 人類先驗縮到20
→ 快速評分縮到10
→ 只搜尋前10個的2~3回合
現在+8但下回合死亡的路線,應該輸給現在+3但能生存反擊的路線。
10. 直接看隱藏手牌就是作弊——改成「可能有」
依職業、原型、已使用牌、剩餘牌庫、手牌數與行動建立多個可能世界。
有AOE 30%
沒有AOE 70%
在不同世界評估同一行動。
這樣才接近「可能有,所以稍微尊重,但不能什麼都怕」。
11. 順序很重要——4,032局中途不能換AI
目前實驗途中加v2會讓前後變成不同AI。
正確順序是:
固定v1
→ 完成4,032
→ 分析剩餘錯誤
→ Adaptive v2
→ quick A/B
→ 再跑約2,016條件
→ 12k級full
→ 40張最佳化
→ 對局診斷
12. 終點不是背攻略的CPU,而是必要時敢違背攻略的CPU
結合人類知識、遊戲樹、未來評分、隱藏手牌機率與動態目標。
於是AI可以做到:
「平常跳費,但會死就防守。」 「平常保留,但現在能斬就全交。」 「平常鋪場,但AOE很可能存在就留資源。」
攻略是參考,局面才是裁判。
13. 這方法不只適合一款遊戲——不要重做遊戲,做勝利研究室
寶可夢可用既有模擬器研究隊伍、選出、交換與招式。卡牌遊戲則研究構築、換牌、資源與對局政策。
重做遊戲和研究怎麼贏,是不同工作。
有好模擬器就借。
不用重蓋競技場,只要蓋一座研究如何獲勝的研究室。
皇家如果又接近80%,先問:
「這機器人是不是又只會下怪打臉?」
