原本以為要手動輸入826張卡,結果半天就開始蓋研究室了

閱讀功能說明

收聽會朗讀正文;速讀會依序顯示短語,速度可調。語言練習可對照現有的不同語言版本。收藏儲存在本瀏覽器中,可從播放器的收藏清單再次開啟。

分享這篇文章
廣告
廣告

想到卡牌模擬器,最可怕的畫面就是一張張輸入名稱、費用、數值、效果與特殊處理。

但如果卡牌資料本來就是JSON等結構化格式,再加上已有可用的開源對戰引擎,工作會完全不同。資料可批次讀取,共通效果沿用既有規則,真正新的機制才需要個別處理。

這個案例裡,Beyond Decks已經有卡牌資料、牌組、seed、replay、Battle Sim、AI和benchmark。

因此不是重做遊戲,而是在現成沙盒上加研究設備與更好的腦袋。

1. 把演出全拿掉,一場卡牌對戰快得很好笑

真實客戶端會花時間在抽牌、拖曳、語音、進化、攻擊動畫、傷害顯示與人類思考。

模擬器大致只有:

狀態A
→ 列合法行動
→ 選行動
→ 更新狀態
→ 狀態B

直到有人輸。

真正昂貴的不是演出,而是AI要看多遠的未來。

2. 基礎模擬器不是玩具,而是相當認真的工程

現有系統已經有deterministic seed、replay、目標選擇、短期look-ahead、整回合規劃、lethal solver、職業機制、benchmark、全卡覆蓋稽核與runtime檢查。

作者也明說,它不是完美的比賽級人類AI,而是中等水準。

這反而適合研究。規則、卡牌、seed、replay、對戰裝置都已經有了,真正值得補的是人類式決策層。

3. 12,480局出現皇家約79.8%——大量樣本也會放大AI偏科

先前12,480局中,規則覆蓋很好,但皇家約79.8%、巫師約25.6%。

不能因為局數大就直接說皇家宇宙最強。

如果皇家AI只要「下從者、搶場、打臉」,而複雜牌組把組件、進化、手牌上限與未來全亂用,結果自然會歪。

大量模擬的危險是:把錯誤策略測得非常精確。

4. 所以加入人類打法知識——不是背答案,而是加入思考習慣

收集換牌、保留牌、進化資源、手牌/場面空間、攻守切換、對手強勢回合、替代勝法、2~3回合斬殺與常見失誤。

不要硬寫「這裡一定出X」。

改用:

hold_value +20
future_combo_value +30
opponent_counter_cost +25
過早使用 -40

人類攻略是搜尋方向的偏好,不是唯一答案。

5. 現在實際跑4,032局——2,016是比較條件數

56組 × 2方向 × 18 seed = 2,016 A/B條件

每個條件由基準策略與人類知識策略各打一局,所以實際是4,032局。

2,016不是神祕數字,而是兩個AI做同一批考題的數量。

6. 大量執行前先停下來檢查

正式跑之前先修「終結卡太早使用」的回歸問題,再用固定真實卡庫與牌表做先後手smoke。

同時驗證覆蓋率、未支援卡、規則缺口、DB hash、重複ID、引用缺失與知識庫版本。

因為已經知道:AI錯了也能很勤奮地跑一萬局。

先驗證前提,再花樣本。

7. human-prior v1仍不是真正的臨機應變

同一個跳費龍應該依局面改變目的:

正常 → 跳費
下回合要死 → 停止跳費,防守
對手沒資源 → 進攻
終結卡在手但準備不足 → 保留
準備完成 → 啟動

需要的是每回合重新計算現在最重要的目標。

8. Adaptive AI動態切換 ATTACK / SURVIVE / SETUP / RESOURCE / LETHAL

根據血量、場面、手牌、PP、進化資源、對手壓力、預估傷害與combo完成度,動態給模式打分。

快死時,SURVIVE必須高於RESOURCE。

臨機應變不是死規則,而是每次比較現在使用與未來保留的價值。

9. 看2~3回合未來,但用人類知識剪枝

全部展開會爆炸。

50合法行動
→ 人類先驗縮到20
→ 快速評分縮到10
→ 只搜尋前10個的2~3回合

現在+8但下回合死亡的路線,應該輸給現在+3但能生存反擊的路線。

10. 直接看隱藏手牌就是作弊——改成「可能有」

依職業、原型、已使用牌、剩餘牌庫、手牌數與行動建立多個可能世界。

有AOE 30%
沒有AOE 70%

在不同世界評估同一行動。

這樣才接近「可能有,所以稍微尊重,但不能什麼都怕」。

11. 順序很重要——4,032局中途不能換AI

目前實驗途中加v2會讓前後變成不同AI。

正確順序是:

固定v1
→ 完成4,032
→ 分析剩餘錯誤
→ Adaptive v2
→ quick A/B
→ 再跑約2,016條件
→ 12k級full
→ 40張最佳化
→ 對局診斷

12. 終點不是背攻略的CPU,而是必要時敢違背攻略的CPU

結合人類知識、遊戲樹、未來評分、隱藏手牌機率與動態目標。

於是AI可以做到:

「平常跳費,但會死就防守。」 「平常保留,但現在能斬就全交。」 「平常鋪場,但AOE很可能存在就留資源。」

攻略是參考,局面才是裁判。

13. 這方法不只適合一款遊戲——不要重做遊戲,做勝利研究室

寶可夢可用既有模擬器研究隊伍、選出、交換與招式。卡牌遊戲則研究構築、換牌、資源與對局政策。

重做遊戲和研究怎麼贏,是不同工作。

有好模擬器就借。

不用重蓋競技場,只要蓋一座研究如何獲勝的研究室。

皇家如果又接近80%,先問:

「這機器人是不是又只會下怪打臉?」


廣告

尋找其他文章

所有文章

Mendoi-chan

作者

Mendoi-chan

把工作與日常生活中的麻煩整理成清楚的結構與下一步行動。

關於本站
廣告

最新文章

  1. 1Zero撤退的那一刻,黑色騎士團也該撤了|藤堂與「過度依賴Zero」的組織極限
  2. 2從第一季第25話等到R2:即時追番觀眾的地獄|槍口懸念之後,R2又像從「記憶被改寫」開始
  3. 3藍月亮,並不是藍色的月亮
  4. 4當外貌不再左右決定——從戀愛焦慮消失,到優先考慮契合度與生活設計
  5. 5「明明有回,卻被說『你根本沒回』」——把聊天引擎外包給一個人會發生什麼事

推薦閱讀

廣告