1. จุดเริ่มต้นง่ายมาก: อยากชนะเกมการ์ด
เป้าหมายแรกไม่ได้เป็นวิชาการเลย: เพิ่ม PP เอา Ward ออก Storm ใส่หน้า ชนะ
แต่พอเริ่มให้ AI เล่นจำลองเป็นพันเกมเพื่อเทียบเด็ค คำถามก็มาเป็นชุด: ต่างกันเพราะดวงไหม? ดูแค่ค่าเฉลี่ยพอไหม? ถ้ามี matchup หนึ่งพังหนักล่ะ? มือคู่แข่งมองไม่เห็นจะคิดอย่างไร? policy ใหม่อ่อนลงเพราะอะไร?
ทันใดนั้นก็มี Monte Carlo, Bayesian update, Nash equilibrium, dynamic programming, POMDP, robust optimization, causal inference และ counterfactual
มนุษย์ไม่จำเป็นต้องคำนวณทั้งหมดในหัว มนุษย์กำหนดคำถาม ส่วน AI กับโค้ดรับงานซ้ำ การบันทึก สถิติ และการเปรียบเทียบ
2. ลองสร้างตำแหน่งงานชื่อ “ครูเกมการ์ด”
การฝึก AI ให้เล่นเหมือนคนเก่ง คล้ายการฝึกพนักงานใหม่มาก
“เด็กฝึกงาน” ต้องเรียน mulligan, การเก็บการ์ด, ใช้ Evolution เมื่อไร, เดาคำตอบคู่แข่ง, วางแผน 2–3 เทิร์น, คำนวณ lethal, จัดมือ และเหลือช่องบอร์ด
เยอะเกินกว่าจะจำพร้อมกัน จึงแยกงาน: ก่อนอื่นกำหนด win condition ต่อมาระบุ resource ที่ยังห้ามใช้ สุดท้ายเช็กว่าเทิร์นหน้าจะตายไหม
แล้วให้ AI ฝึกเป็นพันเกม
ฝึก 4,000 เกมไม่ใช่อินเทิร์นแล้ว เป็นโรงงานฝึกงาน
3. ทำตามคำแนะนำมนุษย์ตรงตัว อาจทำให้อ่อนลง
ไกด์บอกว่า “เก็บใบนี้”, “สำรอง SEP”, “รีบ ramp”, “เก็บ combo piece”
ปกติถูก แต่มีเงื่อนไขซ่อนอยู่เสมอ
เก็บไว้ เว้นแต่ไม่ใช้ตอนนี้แล้วตาย สำรอง Evolution เว้นแต่ใช้ตอนนี้ทำลายเทิร์นคู่แข่ง Ramp เว้นแต่เสียบอร์ดแล้วตายทันที
มนุษย์เติมข้อยกเว้นจากประสบการณ์เอง AI อาจไม่เติม
คน: “ปกติเก็บนะ” AI: “รับทราบ” AI: ตาย
ทำตามคำสั่งกับเข้าใจเป้าหมายของคำสั่งเป็นคนละทักษะ
4. Tree search: อ่าน “ตานี้ แล้วตาถัดไป แล้วถัดไป”
สมมติมี 3 ทาง: A กำจัดตัวคู่แข่ง, B ตี leader, C เก็บการ์ด
แต่ละทางมีอนาคตต่างกัน คู่แข่งก็มีคำตอบหลายแบบ กิ่งเหล่านี้รวมเป็นต้นไม้
ปัญหาคือกิ่งระเบิด ถ้ามี 10 ทางทุกขั้น 4 ขั้นอาจกลายเป็นประมาณ 10,000 กิ่ง
จึงใช้ depth limit, beam search และ node budget
แต่ถ้าตัดกิ่งเร็วเกินไป เราอาจทิ้งทางที่ดูอ่อนตอนนี้แต่ดีที่สุดในอีกสองเทิร์น
Search ไม่ใช่แค่ “มองไกลขึ้น” แต่คือ เลือกว่าจะปล่อยอนาคตไหนให้ยังมีชีวิตอยู่
5. ทฤษฎีอื่นมีหน้าที่ต่างกัน
Monte Carlo: ลองอนาคตหลายครั้งแล้วดูค่าเฉลี่ย
Bayesian update: เห็นการเล่นคู่แข่งแล้วปรับโอกาสว่าเขาถืออะไร
POMDP: ตัดสินใจเมื่อข้อมูลจริงบางส่วนถูกซ่อน
Minimax: คิดว่าคู่แข่งจะตอบกลับดีที่สุด
Nash equilibrium: สถานะที่เปลี่ยนกลยุทธ์ฝ่ายเดียวแล้วไม่ง่ายที่จะได้ประโยชน์เพิ่ม
No-regret learning: ลดความเสียใจระยะยาวว่า “น่าจะเลือกอีกแบบ”
Robust optimization: หาแผนที่ไม่พังใน matchup แย่
CVaR: ดูช่วงผลลัพธ์แย่
Paired A/B: seed, deck, ลำดับเหมือนกัน เปลี่ยนแค่ policy
Confidence interval: ดูว่าส่วนต่างอาจเป็น noise ได้แค่ไหน
Ablation: เอาชิ้นส่วนออกทีละชิ้น
Counterfactual: จาก state เดิม ลองอีก action
Causal inference: เช็กว่าเปลี่ยนสาเหตุแล้วผลเปลี่ยนจริงไหม
ชื่ออังกฤษดุ แต่ความหมายคือ ลองหลายครั้ง อัปเดตการเดา ดูกรณีแย่ เทียบอย่างยุติธรรม และสอบสวนทีละผู้ต้องสงสัย
6. ตรงไหนระดับมหาวิทยาลัย ตรงไหนดูเป็นบัณฑิตศึกษา
สถิติ Monte Carlo dynamic programming game theory Bayes และ optimization พบได้ในระดับมหาวิทยาลัย
สิ่งที่ดูเป็นงานวิจัยมากขึ้นคือกระบวนการ: เจอ regression, แตกสาเหตุเป็นสมมติฐาน, กำหนดล่วงหน้าว่าควรเห็นหลักฐานอะไร, เพิ่ม trace, เปลี่ยนทีละชิ้น, ลอง counterfactual, ใช้ข้อมูล unseen และไม่ผ่านก็คือไม่รับ
มหาวิทยาลัยให้กล่องเครื่องมือ งานวิจัยถามว่าจะใช้เครื่องมือไหนสร้างหลักฐานที่น่าเชื่อถือ
7. สายศิลป์หรือสายวิทย์? ปัญหาจริงผสมกัน
Tree search อัลกอริทึม ความน่าจะเป็น และ reinforcement learning เป็นสายเทคนิคชัด
Game theory, Nash, Pareto, ความเสี่ยง และการตัดสินใจ ก็อยู่ในเศรษฐศาสตร์และ operations research
Causal inference ใช้ทั้งเศรษฐศาสตร์ แพทย์ สังคมศาสตร์ และ AI
ปัญหาจริงไม่สนกำแพงคณะ
โต๊ะเกมการ์ดก็กลายเป็นห้องทดลองสหวิทยาการได้
8. คุณค่าของมหาวิทยาลัยหรือสายวิชาชีพ ไม่ใช่จำสูตรทุกอย่าง
หลายปีผ่านไปลืมสูตรเป็นเรื่องปกติ
แต่ถ้าเคยรู้ว่า Monte Carlo, Bayes, optimization, game theory มีอยู่ เราจะมีสารบัญในหัว
เจอปัญหาก็คิดได้ว่า “นี่คล้าย Bayes ไหม?”, “นี่เป็น optimization หรือเปล่า?”, “ลองเทียบในเงื่อนไขเดียวกันดีกว่า”
ดีกว่าไม่รู้แม้แต่จะค้นคำว่าอะไร
การศึกษาสร้างแผนที่ของเครื่องมือ สายวิชาชีพก็คล้ายกัน: เรียนพื้นฐานก่อน แล้วค่อยลึกเมื่อการทำงานต้องใช้
9. AI ทำให้ “รู้พื้นฐาน” มีค่ามากขึ้น
เมื่อก่อนรู้ชื่อทฤษฎีแต่ทำสมการไม่ได้ เขียนโค้ดไม่ได้ ทำสถิติไม่ได้ ก็อาจหยุด
ตอนนี้คนกำหนดทิศทางได้: “ตรงนี้ใช้ Monte Carlo ไหม?”, “นี่เป็น hidden information problem หรือเปล่า?”, “ช่วยเช็กว่าส่วนต่างเป็นดวงไหม”, “ทำ ablation แยกสาเหตุ”
AI ช่วย implementation และ calculation
พื้นฐานจึงไม่ใช่แค่เพื่อแก้เองทั้งหมด แต่คือ ดัชนีสำหรับมอบงานที่ถูกให้ AI
10. ไม่มี “อาการแพ้ความรู้” เป็นข้อได้เปรียบ
POMDP, PSRO, CVaR, cluster bootstrap
ชื่อดูน่ากลัว
แต่ถ้าคำถามแรกคือ “มันใช้ทำอะไร?” ไม่ใช่ “ไม่ใช่เรื่องของฉัน” เราก็เข้าไปในเรื่องได้แล้ว
POMDP: ข้อมูลซ่อน PSRO: เพิ่มคำตอบที่แข็งแรง CVaR: ดูผลลัพธ์แย่ cluster bootstrap: วัดความไม่แน่นอนโดยรักษากลุ่มข้อมูลที่สัมพันธ์กัน
ไม่ต้องเข้าใจหมดก่อน แตะก่อน แล้วค่อยขุดกับ AI
11. Working memory เต็ม ก็ย้ายความจำออกจากหัว
เกมการ์ดเองก็ต้องจำ hand, board, PP, Evolution, คำตอบคู่แข่ง, Ward, heal, lethal และเทิร์นหน้า
งานวิจัยเพิ่ม seed, hash, config, hypothesis, confidence interval และประวัติทดลอง
ไม่จำเป็นต้องเก็บทุกอย่างในหัว
เงื่อนไขอยู่ใน config การคำนวณอยู่ใน code ประวัติอยู่ใน log การเทียบจำนวนมากให้ AI
คนเก็บแค่คำถามและความรู้สึกว่า “ผลนี้แปลกนะ”
นี่ไม่ใช่โกง แต่เป็นการเก็บสมองไว้ใช้ตัดสินใจ
12. สรุป: แค่อยาก Storm ใส่หน้า แต่กลับเข้าใจความหมายของการศึกษา
เกมการ์ดหนึ่งเกมเชื่อม search, probability, statistics, game theory, causal inference, การศึกษา และ AI เข้าด้วยกัน
ไม่จำเป็นต้องเชี่ยวชาญทุกอย่างตอนเรียนครั้งแรก
แค่เคยเห็น รู้ชื่อ และไม่กลัว ก็เป็นประตูให้ใช้จริงในอีกหลายปีได้
AI ลดต้นทุนจาก “เคยได้ยิน” ไปสู่ “เอามาทดสอบกับปัญหาจริงได้”
คนถาม เครื่องคำนวณ ผลแปลก คนถามใหม่
สุดท้ายเป้าหมายเดิมยังง่ายมาก
เอา Ward ออก Evolution
Storm ใส่หน้า
ใครจะคิดว่าค่าเรียนจะมาคืนทุนตรงนี้
