Nếu nghĩ phải nhập tên, cost, stat, text và hành vi đặc biệt cho hàng trăm card, việc làm simulator nghe rất nặng.
Nhưng nếu dữ liệu card đã có cấu trúc và battle engine tốt đã tồn tại, bài toán đổi hẳn. Import DB hàng loạt, tái dùng rule handler chung, chỉ code cơ chế mới thật sự.
Trong case này, Beyond Decks đã có data, deck, seed, replay, Battle Sim, AI và benchmark.
Không phải làm lại game. Mà là gắn thiết bị nghiên cứu và bộ não tốt hơn lên một sandbox có sẵn.
1. Bỏ animation đi, một trận nhanh đến buồn cười
Client thật tốn thời gian cho draw, kéo card, voice, evolution, attack, damage và con người suy nghĩ.
Simulator gần như chỉ:
state A
→ legal actions
→ chọn
→ update
→ state B
cho đến khi có người thua.
Phần tốn nhất không phải hiệu ứng, mà là AI phải nhìn tương lai sâu bao nhiêu.
2. Simulator nền tảng nghiêm túc hơn tưởng tượng
Nó đã có deterministic seed, replay inspection, target selection, tactical look-ahead, full-turn planning, lethal solver, class mechanics, benchmark, coverage audit và runtime check.
Tác giả cũng nói rõ AI không phải tournament oracle hoàn hảo; nó ở mức intermediate.
Điều này rất phù hợp. Luật, card, replay, seed và bộ máy trận đấu đã có. Cần tập trung vào chất lượng quyết định giống người.
3. 12.480 trận cho Royal gần 79,8%—sample lớn cũng phóng đại bias của policy
Rules coverage tốt nhưng Royal ~79,8% và Witch ~25,6%.
Không thể vì số trận lớn mà kết luận Royal tuyệt đối mạnh nhất.
Nếu Royal chỉ cần “thả follower, chiếm board, đánh face” còn deck phức tạp dùng combo, evolution và hand sai thời điểm, policy đang thiên vị lối chơi đơn giản.
Sample lớn có thể đo một policy sai cực kỳ chính xác.
4. Kiến thức người chơi được thêm như thói quen suy nghĩ, không phải đáp án cứng
Mulligan, hold card, evolution, hand/board space, đổi công-thủ, power turn đối thủ, win condition phụ, lethal 2–3 turn và lỗi thường gặp được cấu trúc hóa.
Dùng điểm:
hold_value +20
future_combo_value +30
opponent_counter_cost +25
dùng sớm -40
Guide người hướng search, không khóa search.
5. Hiện đang chạy 4.032 trận thật—2.016 là số điều kiện A/B
56 nhóm × 2 hướng × 18 seed = 2.016 điều kiện
reference và human-prior mỗi bên chơi một trận, tổng engine là 4.032.
2.016 là số câu hỏi giống nhau cho hai AI.
6. Trước batch lớn phải dừng để kiểm tra
Sửa regression finisher dùng quá sớm, rồi smoke test với DB/deck thật.
Kiểm tra coverage, unsupported, rule gap, DB hash, duplicate ID, missing reference và corpus version.
Bài học: xác minh thí nghiệm trước khi tăng sample.
7. human-prior v1 vẫn chưa thật sự linh hoạt
Cùng một Ramp Dragon nhưng mục tiêu phải đổi:
bình thường → ramp
sắp chết → defense
đối thủ cạn resource → attack
finisher chưa setup → hold
setup xong → dùng
AI phải tính lại điều gì quan trọng nhất bây giờ mỗi turn.
8. Adaptive AI chuyển ATTACK / SURVIVE / SETUP / RESOURCE / LETHAL
HP, board, hand, PP, evolution, pressure, damage dự kiến và combo readiness cho điểm từng mode.
Nếu HP 6 trước 14 damage, SURVIVE phải thắng RESOURCE.
Linh hoạt là so giá trị dùng ngay với giá trị chờ.
9. Nhìn 2–3 turn nhưng prune bằng kiến thức người
50 legal actions
→ human priors còn 20
→ cheap evaluator còn 10
→ search 2–3 turn cho top 10
+8 bây giờ nhưng chết turn sau phải thua +3 mà sống và phản công được.
10. Nhìn hidden hand là cheat—hãy dùng “có thể có”
Tạo nhiều possible world từ leader, archetype, card đã dùng, deck còn lại, hand size và hành vi.
có AoE 30%
không có 70%
Đánh giá cùng action trong nhiều world.
Đó là “có thể có nên respect, nhưng không thể sợ mọi thứ”.
11. Thứ tự rất quan trọng—đừng nâng cấp AI giữa 4.032 trận
freeze v1
→ xong 4.032
→ phân tích lỗi
→ Adaptive v2
→ quick A/B
→ chạy lại ~2.016 điều kiện
→ full ~12k
→ optimize 40 card
→ diagnosis
v2 nên sinh ra từ lỗi quan sát được.
12. Mục tiêu không phải CPU thuộc guide, mà là CPU được phép phá guide
Kết hợp human knowledge, game tree, future evaluation, hidden-hand probability và dynamic mode.
AI sẽ biết “bình thường ramp nhưng sắp chết thì phòng thủ”, “bình thường hold nhưng có lethal thì dùng hết”, “bình thường develop nhưng AoE có khả năng cao thì giữ resource”.
Guide gợi ý. Board quyết định.
13. Cách này dùng cho nhiều game—xây phòng lab để thắng
Pokémon có thể dùng simulator có sẵn để tối ưu team, selection, switching và move. Card game tối ưu deck, mulligan, resource và matchup.
Làm lại game và nghiên cứu cách thắng là hai công việc khác nhau.
Nếu simulator tốt đã tồn tại, dùng nó.
Không cần xây lại sân vận động. Xây phòng thí nghiệm tìm cách thắng bên trong.
Royal mà lại gần80%:
“Con bot này lại chỉ giỏi môn ‘thả lính rồi đánh face’ à?”
