1. Ban đầu chỉ là muốn thắng game thẻ bài
Mục tiêu đầu tiên chẳng có gì học thuật: tăng PP, gỡ Ward, Storm vào leader, thắng.
Nhưng khi cho AI chơi hàng nghìn trận để so deck, câu hỏi xuất hiện liên tục: khác biệt là may mắn? chỉ nhìn trung bình có đủ? một matchup quá tệ thì sao? hand đối thủ bị ẩn thì suy luận thế nào? policy mới yếu đi vì sao?
Rồi Monte Carlo, Bayesian update, Nash equilibrium, dynamic programming, POMDP, robust optimization, causal inference, counterfactual cùng xuất hiện.
Con người không cần tự giữ toàn bộ phép tính trong đầu. Con người quyết định muốn biết gì; AI và code xử lý lặp lại, ghi chép, thống kê và so sánh.
2. Hãy tưởng tượng tạo một nghề: “giáo viên game thẻ bài”
Huấn luyện AI chơi giống người giỏi khá giống đào tạo nhân viên mới.
“Thực tập sinh” phải học mulligan, giữ card, dùng Evolution, đoán phản ứng, lên kế hoạch 2–3 turn, tính lethal, quản lý hand và board slot.
Quá nhiều thứ để nhớ cùng lúc, nên ta thiết kế công việc: xác định win condition, xác định resource chưa được phép dùng, rồi kiểm tra turn sau có chết không.
Sau đó cho AI luyện hàng nghìn game.
Thực tập 4.000 trận thì không còn là thực tập nữa, mà là nhà máy đào tạo.
3. Làm đúng lời khuyên của con người theo nghĩa đen có thể khiến AI yếu hơn
Guide nói “giữ lá này”, “reserve SEP”, “ramp sớm”, “giữ combo piece”.
Thường đúng, nhưng luôn có điều kiện.
Giữ, trừ khi không dùng bây giờ sẽ chết. Giữ Evolution, trừ khi dùng bây giờ phá hỏng hoàn toàn turn đối thủ. Ramp, trừ khi mất board khiến bạn chết.
Con người tự thêm ngoại lệ từ kinh nghiệm. AI có thể không.
Người: “Thông thường phải giữ.” AI: “Đã hiểu.” AI: chết.
Làm theo chỉ dẫn và hiểu mục đích của chỉ dẫn là hai kỹ năng khác nhau.
4. Tree search: đọc “nước này, nước tiếp theo, rồi nước tiếp theo”
Giả sử có ba action: A remove, B đánh leader, C hold.
Mỗi action mở ra tương lai khác nhau, đối thủ lại có nhiều phản ứng. Các nhánh này tạo thành cây.
Vấn đề là số nhánh bùng nổ. Mười lựa chọn mỗi bước có thể thành khoảng mười nghìn nhánh sau bốn bước.
Vì thế ta dùng depth limit, beam search và node budget.
Nhưng prune quá sớm có thể xóa nước yếu hiện tại nhưng mạnh nhất sau hai turn.
Search không chỉ là “nhìn xa hơn”. Cốt lõi là tương lai nào được phép tiếp tục tồn tại.
5. Các lý thuyết khác giải quyết các vấn đề khác nhau
Monte Carlo: mô phỏng nhiều lần rồi nhìn trung bình.
Bayesian update: thay đổi xác suất đối thủ có gì sau khi quan sát hành động.
POMDP: quyết định khi một phần state thật bị ẩn.
Minimax: giả sử đối thủ phản công tối ưu.
Nash equilibrium: trạng thái mà một bên đổi chiến lược riêng lẻ không dễ được lợi hơn.
No-regret learning: giảm “giá như chọn cách khác” theo thời gian.
Robust optimization: tìm chiến lược mạnh mà không sụp ở matchup xấu.
CVaR: nhìn vùng kết quả tệ.
Paired A/B: cùng seed, deck và thứ tự; chỉ đổi policy.
Confidence interval: đo xem chênh lệch có thể chỉ là noise đến đâu.
Ablation: bỏ từng bộ phận.
Counterfactual: từ cùng state, thử action khác.
Causal inference: kiểm tra thay đổi nguyên nhân có thật sự làm thay đổi kết quả không.
Tên tiếng Anh nghe khó, nhưng ý tưởng là: thử nhiều lần, cập nhật dự đoán, xem tình huống xấu, so công bằng, điều tra từng nghi phạm.
6. Đâu là mức đại học, đâu là kiểu nghiên cứu cao học?
Thống kê, Monte Carlo, dynamic programming, game theory, Bayes và optimization có thể gặp ở đại học.
Phần giống nghiên cứu cao học hơn là quy trình: phát hiện regression, chia thành giả thuyết, định nghĩa trước dấu hiệu cần thấy, thêm trace, thay từng bộ phận, thử counterfactual, dùng dữ liệu chưa thấy và từ chối policy nếu không đạt.
Đại học cho toolbox. Nghiên cứu hỏi cách dùng toolbox để tạo bằng chứng thuyết phục.
7. Khoa học tự nhiên hay xã hội? Vấn đề thật trộn cả hai
Tree search, thuật toán, xác suất, reinforcement learning rất kỹ thuật.
Game theory, Nash, Pareto, rủi ro và quyết định cũng thuộc kinh tế và operations research.
Causal inference dùng trong kinh tế, y học, xã hội học và AI.
Vấn đề thật không quan tâm biên giới khoa.
Một bàn card game cũng có thể thành phòng nghiên cứu liên ngành.
8. Giá trị của đại học hay trường nghề không phải nhớ mọi thứ
Quên công thức sau nhiều năm là bình thường.
Nhưng từng nghe Monte Carlo, Bayes, optimization hay game theory tạo ra một mục lục trong đầu.
Khi gặp vấn đề, bạn có thể nghĩ: “Cái này giống Bayes?”, “Có phải bài toán tối ưu?”, “Thử so dưới cùng điều kiện.”
Dễ hơn rất nhiều so với không biết phải tìm từ khóa gì.
Giáo dục tạo bản đồ công cụ. Trường nghề cũng tương tự: học nền tảng trước, đào sâu khi công việc thật sự cần.
9. AI làm “biết nền tảng” có giá trị hơn nhiều
Trước đây biết tên phương pháp nhưng không tự suy công thức, code và thống kê thì vẫn dễ dừng.
Giờ con người có thể định hướng: “Monte Carlo hợp ở đây không?”, “Đây có phải vấn đề hidden information?”, “Kiểm tra chênh lệch có thể do ngẫu nhiên không”, “Làm ablation để tách nguyên nhân.”
AI hỗ trợ implementation và calculation.
Kiến thức nền không còn chỉ để tự giải tất cả, mà còn là chỉ mục để giao đúng việc trí tuệ cho AI.
10. Không “dị ứng kiến thức” là lợi thế lớn
POMDP, PSRO, CVaR, cluster bootstrap.
Tên nhìn rất căng.
Nhưng nếu phản ứng đầu tiên là “nó dùng để làm gì?” thay vì “cái này không dành cho mình”, bạn đã bước vào rồi.
POMDP: hidden information. PSRO: thêm phản ứng mạnh. CVaR: nhìn vùng kết quả xấu. Cluster bootstrap: đo uncertainty với nhóm dữ liệu liên quan.
Không cần hiểu hoàn toàn trước khi chạm vào. Chạm trước, đào sâu cùng AI sau.
11. Working memory đầy thì chuyển bộ nhớ ra ngoài đầu
Card game đã cần nhớ hand, board, PP, Evolution, phản ứng đối thủ, Ward, heal, lethal, turn sau.
Nghiên cứu thêm seed, hash, config, giả thuyết, confidence interval, lịch sử thí nghiệm.
Không cần nhớ hết.
Điều kiện nằm trong config, tính toán nằm trong code, lịch sử nằm trong log, so sánh lớn giao cho AI.
Con người giữ câu hỏi và cảm giác “kết quả này lạ”.
Đó không phải gian lận. Đó là giữ não cho judgment.
12. Kết luận: chỉ muốn Storm vào mặt, cuối cùng lại hiểu ý nghĩa của giáo dục
Một game thẻ bài đã nối search, xác suất, thống kê, game theory, causal inference, giáo dục và AI.
Bạn không cần thành thạo tất cả khi học lần đầu.
Từng thấy, biết tên, không sợ — như vậy đã đủ để tạo cửa vào thực hành nhiều năm sau.
AI giảm mạnh chi phí từ “đã nghe qua” đến “có thể thử trên vấn đề thật”.
Con người hỏi. Máy tính. Kết quả lạ, con người hỏi lại.
Và mục tiêu ban đầu vẫn đơn giản.
Gỡ Ward. Evolution.
Storm vào leader.
Một nơi rất lạ để kiến thức học đường hoàn vốn.
