Tưởng phải nhập tay 826 lá; nửa ngày sau phòng thí nghiệm đã bắt đầu hình thành

Cách dùng công cụ đọc

Nghe đọc bài thành tiếng. Đọc nhanh hiển thị lần lượt các cụm từ theo tốc độ bạn chọn. Luyện ngôn ngữ giúp đối chiếu các bản dịch hiện có. Lưu tạo dấu trang trong trình duyệt này; mở lại từ danh sách đã lưu của trình phát.

Chia sẻ bài viết này

Chia sẻ bài viết này

Quảng cáo
Quảng cáo

Nếu nghĩ phải nhập tên, cost, stat, text và hành vi đặc biệt cho hàng trăm card, việc làm simulator nghe rất nặng.

Nhưng nếu dữ liệu card đã có cấu trúc và battle engine tốt đã tồn tại, bài toán đổi hẳn. Import DB hàng loạt, tái dùng rule handler chung, chỉ code cơ chế mới thật sự.

Trong case này, Beyond Decks đã có data, deck, seed, replay, Battle Sim, AI và benchmark.

Không phải làm lại game. Mà là gắn thiết bị nghiên cứu và bộ não tốt hơn lên một sandbox có sẵn.

1. Bỏ animation đi, một trận nhanh đến buồn cười

Client thật tốn thời gian cho draw, kéo card, voice, evolution, attack, damage và con người suy nghĩ.

Simulator gần như chỉ:

state A
→ legal actions
→ chọn
→ update
→ state B

cho đến khi có người thua.

Phần tốn nhất không phải hiệu ứng, mà là AI phải nhìn tương lai sâu bao nhiêu.

2. Simulator nền tảng nghiêm túc hơn tưởng tượng

Nó đã có deterministic seed, replay inspection, target selection, tactical look-ahead, full-turn planning, lethal solver, class mechanics, benchmark, coverage audit và runtime check.

Tác giả cũng nói rõ AI không phải tournament oracle hoàn hảo; nó ở mức intermediate.

Điều này rất phù hợp. Luật, card, replay, seed và bộ máy trận đấu đã có. Cần tập trung vào chất lượng quyết định giống người.

3. 12.480 trận cho Royal gần 79,8%—sample lớn cũng phóng đại bias của policy

Rules coverage tốt nhưng Royal ~79,8% và Witch ~25,6%.

Không thể vì số trận lớn mà kết luận Royal tuyệt đối mạnh nhất.

Nếu Royal chỉ cần “thả follower, chiếm board, đánh face” còn deck phức tạp dùng combo, evolution và hand sai thời điểm, policy đang thiên vị lối chơi đơn giản.

Sample lớn có thể đo một policy sai cực kỳ chính xác.

4. Kiến thức người chơi được thêm như thói quen suy nghĩ, không phải đáp án cứng

Mulligan, hold card, evolution, hand/board space, đổi công-thủ, power turn đối thủ, win condition phụ, lethal 2–3 turn và lỗi thường gặp được cấu trúc hóa.

Dùng điểm:

hold_value +20
future_combo_value +30
opponent_counter_cost +25
dùng sớm -40

Guide người hướng search, không khóa search.

5. Hiện đang chạy 4.032 trận thật—2.016 là số điều kiện A/B

56 nhóm × 2 hướng × 18 seed = 2.016 điều kiện

reference và human-prior mỗi bên chơi một trận, tổng engine là 4.032.

2.016 là số câu hỏi giống nhau cho hai AI.

6. Trước batch lớn phải dừng để kiểm tra

Sửa regression finisher dùng quá sớm, rồi smoke test với DB/deck thật.

Kiểm tra coverage, unsupported, rule gap, DB hash, duplicate ID, missing reference và corpus version.

Bài học: xác minh thí nghiệm trước khi tăng sample.

7. human-prior v1 vẫn chưa thật sự linh hoạt

Cùng một Ramp Dragon nhưng mục tiêu phải đổi:

bình thường → ramp
sắp chết → defense
đối thủ cạn resource → attack
finisher chưa setup → hold
setup xong → dùng

AI phải tính lại điều gì quan trọng nhất bây giờ mỗi turn.

8. Adaptive AI chuyển ATTACK / SURVIVE / SETUP / RESOURCE / LETHAL

HP, board, hand, PP, evolution, pressure, damage dự kiến và combo readiness cho điểm từng mode.

Nếu HP 6 trước 14 damage, SURVIVE phải thắng RESOURCE.

Linh hoạt là so giá trị dùng ngay với giá trị chờ.

9. Nhìn 2–3 turn nhưng prune bằng kiến thức người

50 legal actions
→ human priors còn 20
→ cheap evaluator còn 10
→ search 2–3 turn cho top 10

+8 bây giờ nhưng chết turn sau phải thua +3 mà sống và phản công được.

10. Nhìn hidden hand là cheat—hãy dùng “có thể có”

Tạo nhiều possible world từ leader, archetype, card đã dùng, deck còn lại, hand size và hành vi.

có AoE 30%
không có 70%

Đánh giá cùng action trong nhiều world.

Đó là “có thể có nên respect, nhưng không thể sợ mọi thứ”.

11. Thứ tự rất quan trọng—đừng nâng cấp AI giữa 4.032 trận

freeze v1
→ xong 4.032
→ phân tích lỗi
→ Adaptive v2
→ quick A/B
→ chạy lại ~2.016 điều kiện
→ full ~12k
→ optimize 40 card
→ diagnosis

v2 nên sinh ra từ lỗi quan sát được.

12. Mục tiêu không phải CPU thuộc guide, mà là CPU được phép phá guide

Kết hợp human knowledge, game tree, future evaluation, hidden-hand probability và dynamic mode.

AI sẽ biết “bình thường ramp nhưng sắp chết thì phòng thủ”, “bình thường hold nhưng có lethal thì dùng hết”, “bình thường develop nhưng AoE có khả năng cao thì giữ resource”.

Guide gợi ý. Board quyết định.

13. Cách này dùng cho nhiều game—xây phòng lab để thắng

Pokémon có thể dùng simulator có sẵn để tối ưu team, selection, switching và move. Card game tối ưu deck, mulligan, resource và matchup.

Làm lại game và nghiên cứu cách thắng là hai công việc khác nhau.

Nếu simulator tốt đã tồn tại, dùng nó.

Không cần xây lại sân vận động. Xây phòng thí nghiệm tìm cách thắng bên trong.

Royal mà lại gần80%:

“Con bot này lại chỉ giỏi môn ‘thả lính rồi đánh face’ à?”


Chia sẻ bài viết này

Quảng cáo

Tìm bài viết khác

Tất cả bài viết

Mendoi-chan

Tác giả

Mendoi-chan

Biến những vướng mắc trong công việc và đời sống hằng ngày thành cấu trúc rõ ràng và bước tiếp theo thực tế.

Giới thiệu
Quảng cáo

Bài viết mới

  1. 1Bài 5: Khi Zero rút lui, Hắc Kỵ Sĩ Đoàn cũng nên rút theo|Todo và giới hạn của một tổ chức phụ thuộc quá nhiều vào Zero
  2. 2Bài 8: Địa ngục của khán giả phải chờ từ tập 25 mùa 1 đến R2|Từ cái kết chĩa súng vào nhau đến màn mở đầu với ký ức bị sửa đổi
  3. 3Trăng Xanh không phải là Mặt Trăng có màu xanh
  4. 4Khi vẻ đẹp không còn điều khiển quyết định: hết vội vàng trong tình yêu và ưu tiên sự tương hợp cùng thiết kế cuộc sống
  5. 5“Rõ ràng có trả lời mà vẫn bị nói là ‘chẳng bao giờ trả lời’” — chuyện gì xảy ra khi một người phải gánh toàn bộ động cơ hội thoại

Có thể bạn quan tâm

Quảng cáo