1. เดิมทีแค่อยากตีหน้า แต่ดันได้ห้องแล็บ
เป้าหมายแรกง่ายมาก: หาเด็คที่แข็งที่สุดตอนนี้ รวบรวมเด็คสาธารณะ ล็อกกฎ แล้วปล่อย CPU ตีกันหลายหมื่นเกม จากนั้นอ่านอันดับ
ปัญหาแรกคือ AI ที่ทำตามกฎถูกต้อง ไม่เท่ากับ AI ที่เล่นเก่ง Set 8 ถูกตรึงด้วยการ์ด 826 ใบ, engine commit, environment hash, เด็คถูกกฎหมาย และ seed คงที่ baseline เก่า 12,480 เกมมี rule coverage 100%, unsupported 0, rule gap 0 แต่ AI ดิบกลับให้ Sword ราว 79.8%, Forest 63.7%, Dragon 60.9%, Rune 25.6%
การทำผิดซ้ำหนึ่งหมื่นครั้งไม่ได้ทำให้มันถูก แค่ทำให้ความผิดพลาดสม่ำเสมอมากขึ้น
2. ใส่คำแนะนำมนุษย์แล้ว AI อ่อนลง
human-prior-v1 ใส่แนวคิดอย่างเก็บ resource สำคัญ รักษา setup และอย่าใช้ evolution มั่ว exact A/B ใช้ 2,016 paired units และ 4,032 engine games baseline 50.99%, human-prior-v1 49.36%, ลด -1.64pt
AI ฟังมนุษย์แล้วแพ้มากขึ้น
เหตุผลคือคำแนะนำมนุษย์มีเงื่อนไข “เก็บใบนี้ไว้” ไม่จริงถ้าไม่ใช้แล้วตายทันที fixed weight เก็บประโยคไว้แต่ฆ่าบริบททิ้ง
3. Adaptive v2 เพิ่มค่าเฉลี่ย แต่ทำ Witch พัง
Adaptive v2 สลับ LETHAL, SURVIVE, STABILIZE, SETUP, RESOURCE, PRESSURE พร้อม search สั้นและ future value ภาพรวม +0.74pt เทียบ v1 แต่ Runecraft -6.25pt ต่ำกว่า preregistered leader floor -5pt จึง REJECT
T11 ต่อมา +0.30 เทียบ v1 แต่ -2.38 เทียบ reference-v5 และ Abyss -16.67 จึง REJECT เช่นกัน
คะแนนเฉลี่ยผ่าน แต่ข้อสอบวิชาหนึ่งกำลังไหม้
4. วิเคราะห์สาเหตุแล้วนักวิจัยโดนจับก่อน
พบ bug จริงว่า max_nodes=160 ไม่ได้ต่อกับ planner ทำให้ 9,067 decisions เกิน nominal limit แต่แก้แล้ว performance กว้างก็ไม่ดีขึ้น
จากนั้นเจอ actor attribution bug การแทรกแซงที่บอกว่า “loss→win” ถูกมองจาก fixed player แต่จาก actor ที่เปลี่ยน action จริงกลับเป็น win→loss นักวิจัยจับเหยื่อแทนคนร้าย
แก้ actor/direction/invariant แล้ว แต่สาเหตุ performance หลักยังหนีอยู่
5. หลัง 31,406 เกม “ยังไม่รู้” กลายเป็นข้อสรุปที่ยอมรับได้
งานวิจัย policy Set 8 ปิดที่ 20 experiments และ 31,406 confirmed actual engine games จาก discordant 439 units มีสาเหตุ performance ที่อธิบายเชิงเหตุครบ 0, บางส่วน 11, unresolved 428
สถานะ PAUSED_COMPLETE_NO_PROMOTION, active ยังเป็น human-prior-v1, final unseen holdout 8,064 เกมไม่ถูกใช้
ความสำเร็จไม่ใช่ super AI แต่เป็นระบบที่ไม่เลื่อน AI เพียงเพราะกราฟบางรูปดูสวย
6. จากนั้นให้ 52 เด็คตลาดตีกัน 46,900 เกม
market corpus มี 52 decks, 25 archetypes, 7 leaders รวม quick/broad, local optimization 1–3 ใบ, unseen-seed ranking และ guide trace เป็น 46,900 actual engine games
เด็คแนะนำ 7 เด็คเล่น direct round robin: 21 unordered pairs, 1,512 games, 72 ต่อ non-diagonal cell, reference-v5 756 และ human-prior-v1 756, first/second 756/756 coverage 100%, unsupported/rule gap/hidden-info violation เท่ากับ 0
7. เกิด “อันดับ AI สมองตายตีกันเอง”
| อันดับ | เด็ค | ค่าเฉลี่ย 7×7 | คู่ต่อสู้แย่สุด |
|---|---|---|---|
| 1 | Buff Forest | 71.99% | Abyss 59.72% |
| 2 | Rally Sword | 65.97% | Forest 31.94% |
| 3 | Midrange Abyss | 54.17% | 40.3% |
| 4 | Artifact Portal | 54.17% | 36.1% |
| 5 | Ramp Dragon | 53.70% | Forest 25.0% |
| 6 | Evolution Haven | 31.71% | Dragon 12.5% |
| 7 | Calgidensula Witch | 18.29% | Forest 1.4% |
เด็คที่ “เล่นของแรงตอนนี้” แล้วมักยังดีในอนาคตเหมาะกับ AI ปัจจุบัน ส่วนเด็คที่ยอมเสีย tempo เพื่อซื้อพลังในอีก 2–3 เทิร์นกลับยากกว่า จึงได้ชื่อเล่นนี้
8. ในทัวร์นาเมนต์มนุษย์ Witch อยู่คนละจักรวาล
Dexel Rising Cup #2 วันที่ 8 ส.ค. 2026: 64 ทีม 192 คน 384 เด็ค Hand Witch ถูกนำมา 116 เด็ค ประมาณ 30.2% มากที่สุดชัดเจน AF/Storm Portal 52, Evolution Haven 34, Rally/Evolution Sword 29, Ramp Dragon 25
มนุษย์ระดับสูงมอง Witch เป็น top meta แต่ Calgidensula Witch ใน AI 7×7 จบสุดท้าย 18.29% ห้ามถือว่าเป็นลิสต์ 40 ใบเหมือนกันทุกใบ แต่ช่องว่างมนุษย์กับ AI ชัดมาก
Rally Sword แข็งทั้งสองฝั่ง จึงเกิด heuristic หยาบ ๆ ว่า แข็งกับ AI ง่าย + แข็งกับมนุษย์เก่ง อาจหมายถึงทนต่อ decision error ได้ดี
9. Future Optionality audit
ตรวจ 24 mechanics ของ 7 leaders ผ่าน RULE, STATE, VISIBILITY, IMMEDIATE VALUE, FUTURE VALUE, SEQUENCE, SEARCH, PLAN
จาก 27,810 decisions และ 118,575 root candidates มีเพียง 8,878 หรือ 7.49% ที่มี explicit future value rule/state/immediate รองรับ 24/24 แต่ sequence MISSING 23/24 และ plan MISSING 20/24
AI รู้กฎและรู้ “กำไรตอนนี้” แต่แทบไม่มีตัวแทนของลำดับและแผนยาว
10. Witch: รู้ว่า Spellboost มีอยู่ ไม่เท่ากับเข้าใจมัน
Spellboost มี rule/state แต่ visibility/future value PARTIAL และ sequence/plan MISSING DRAW → SPELL ต่างจาก SPELL → DRAW เพราะใบที่จั่วก่อนอาจได้รับ boost แต่ใบที่จั่วหลังไม่ย้อนกลับไปได้รับ boost ที่เกิดแล้ว
12 synthetic fixtures: DRAW_FIRST_BETTER 4, SPELL_FIRST_BETTER 0, EQUIVALENT 8 ส่วน 50 representative real states สรุป STATE_DEPENDENT ดังนั้นไม่ควรสร้างกฎ “จั่วก่อนเสมอ” แต่ต้อง replan หลังเห็นผลจั่ว
11. Dragon: +1 max PP คือซื้อสิทธิ์การกระทำในอนาคต
Ramp อาจเสียบอร์ดตอนนี้ แต่เปิดไพ่แพง multi-card turn, heal, removal, finisher และ 6→7 ข้าม Awakening threshold
audit พบ Dragoncraft MYOPIC_REVERSAL 12: ramp 6 + Awakening 6 immediate control สูงกว่า แต่ diagnostic continuation t+2 บางครั้งพลิกอันดับ ห้ามแก้ด้วย ramp bonus แบบ hard-code
12. อีกห้าคลาสก็มีโรคเวอร์ชันของตัวเอง
Forest มี combo threshold, generation และ bounce order; Sword มี Rally 9→10 และ multi-summon; Abyss มี Shadows, reanimate pool และ HP resource; Haven มี Countdown/Act ซึ่งการไม่ใช้ตอนนี้รักษาสิทธิ์ในอนาคต; Portal มี 0-cost token/copy ที่ทำให้ sequence space ระเบิด
EP, SEP, Extra PP, มือ 9 ใบ, บอร์ด 5 ช่อง, leader area 5 ช่อง ก็เป็น trade-off ระหว่างค่าปัจจุบันกับ optionality อนาคต
13. จึงสร้าง closed-loop planner 3 เทิร์นจริง
planner ต้องเดิน engine อย่างน้อยสาม future turn boundary ไม่ใช่สาม action และไม่ล็อก script ล่วงหน้า ทำหนึ่ง action → สังเกต draw/generation/random → คำนวณสามเทิร์นใหม่จาก state ใหม่ คล้าย Receding Horizon / MPC
ไม่มอง future draw order ของตัวเองหรือ true hand ของคู่ต่อสู้ ใช้ belief sampling และ FutureRelevantState เก็บ Spellboost, Extra PP, Countdown, Act, Rally, Shadows, destroyed-follower pool ไม่มี fixed optionality/Witch/ramp bonus
14. Implementation ผ่าน แต่ performance พังลงล่าง
Ablation 56 actual engine games ประเมิน 3,979 / 3,979 root actions, three-turn completion 100%, hidden-info violation 0 observation replan 81,621 ครั้ง และ plan change 35,821 ครั้ง
แต่ base/widen = -37.5pt เทียบ human-prior-v1 ส่วน replan/state/robust = -25.0pt ทุก candidate ต่ำกว่า preregistered -10pt floor จึง REJECT_ACTIVE_UNCHANGED และ targeted/broad/market 7×7/final holdout ไม่ถูก run
เราได้ AI ที่มองไกลกว่าเดิมและผิดด้วยความมั่นใจมากกว่าเดิม
15. นี่ไม่ได้พิสูจน์ว่า 3 เทิร์นเพียงพอ
สิ่งที่หายไปคือข้อสงสัยว่า implementation ไม่ถึง 3 เทิร์น ไม่ได้พิสูจน์ว่า horizon 3 เทิร์นเพียงพอเชิงกลยุทธ์ และการดีขึ้นจาก -37.5 ไป -25.0 ของ replan เป็นเพียง directional signal เพราะแต่ละ candidate มี 8 conditions เท่านั้น
Dragon reversal เก่า 12 กรณีเมื่อใช้ real three-turn search มีเพียง 1/12 ที่เปลี่ยนอันดับไป ramp จริง ๆ ดังนั้น proxy เดิมไม่ใช่ ground truth
ผู้ต้องสงสัยใหม่คือ terminal/leaf evaluator และ opponent response model
16. คำถามถัดไป: “บอกว่าอนาคตนี้ -150 แล้วถ้าเล่นจริงจากตรงนี้ 100 ครั้งชนะกี่ครั้ง?”
รอบต่อไปยังไม่แก้ weight แต่ freeze leaf 3 เทิร์น แล้วแยก evaluator เป็น raw feature→normalization→weight→contribution เพื่อหาว่า term ไหนสร้างค่า -150
จาก leaf เดิม run จนจบ 32–128 ครั้งเพื่อหา empirical win rate raw score ไม่ใช่ probability จึงต้อง calibrate score→probability แล้ววัด Brier score, log loss, reliability ส่วน ranking วัด Spearman, Kendall, same-root argmax accuracy, pairwise concordance, decision regret
opponent response ทำ cross-play ระหว่าง human-prior-v1, reference-v5 และ search-based stress response แล้วจึงแยกได้ว่า leaf scoring ผิด, opponent model ผิด, scale/weight ผิด, state representation ขาด หรือ 3 เทิร์นยังสั้น
17. สรุป: เห็นอนาคตแล้ว แต่ใบตรวจคะแนนน่าสงสัย
AI เดินทางจาก “อะไรแรงตอนนี้” มาถึง “ฉันจำลองอนาคต 3 เทิร์นได้จริง” แล้ว แต่เรายังเชื่อวิธีที่มันให้คะแนนอนาคตไม่ได้
จาก Sword 79.8%, human advice ที่ย้อนศร, Witch พัง, actor bug, market 46,900 เกม, Future Optionality audit จนถึง three-turn foresight จริง
แล้วมันอ่อนลง
เดิมแค่อยากตีหน้า วิชาต่อไปกลับเป็น Brier score กับ leaf-value calibration นี่ Shadowverse หรือปริญญาโทกันแน่
ภาคผนวกข้อมูล
- Set 8 card DB: 826
- baseline: 12,480 games
- policy research: 31,406 games
- status:
PAUSED_COMPLETE_NO_PROMOTION - active:
human-prior-v1 - market: 52 decks / 25 archetypes / 7 leaders
- market analysis: 46,900 games
- direct 7×7: 1,512 games
- optionality: 27,810 decisions / 118,575 candidates / 7.49%
- sequence MISSING 23/24; plan MISSING 20/24
- Dragon reversals: 12 = ramp 6 + Awakening 6
- RH3 Ablation: 56 games
- root coverage: 3,979/3,979; completion 100%
- replans 81,621; plan changes 35,821
- result:
REJECT_ACTIVE_UNCHANGED - final holdout:
NOT_RUN
- Shadowverse: Worlds Beyond official Deck Portal
- Dexel Rising Cup #2
- Silver & Veness (2010), POMCP
- Cowling, Powley & Whitehouse (2012), ISMCTS
- Model Predictive Control / Receding Horizon Control
- Brier score / reliability / clustered validation literature
