ให้ AI “สมองตาย” มองอนาคต 3 เทิร์น แล้วมันกลับอ่อนลง — สิ่งที่ตลาดจำลอง 46,900 เกมและงานวิจัย AI แยกสายบอกเราเกี่ยวกับ “เห็นอนาคต แต่ให้คะแนนอนาคตผิด”

หยิบยกจาก: “Shadowverse: Worlds Beyond”

เป้าหมายแรกง่ายมาก: หาเด็คที่แข็งที่สุดตอนนี้ รวบรวมเด็คสาธารณะ ล็อกกฎ แล้วปล่อย CPU ตีกันหลายหมื่นเกม จากนั้นอ่านอันดับ

วิธีใช้เครื่องมืออ่าน

ฟังจะอ่านบทความออกเสียง อ่านเร็วแสดงวลีทีละช่วงตามความเร็วที่เลือก ฝึกภาษาใช้เปรียบเทียบบทความฉบับแปลที่มีอยู่ บันทึกจะเก็บบุ๊กมาร์กในเบราว์เซอร์นี้ และเปิดอีกครั้งได้จากรายการที่บันทึกในเครื่องเล่น

แชร์บทความนี้
โฆษณา
โฆษณา

1. เดิมทีแค่อยากตีหน้า แต่ดันได้ห้องแล็บ

เป้าหมายแรกง่ายมาก: หาเด็คที่แข็งที่สุดตอนนี้ รวบรวมเด็คสาธารณะ ล็อกกฎ แล้วปล่อย CPU ตีกันหลายหมื่นเกม จากนั้นอ่านอันดับ

ปัญหาแรกคือ AI ที่ทำตามกฎถูกต้อง ไม่เท่ากับ AI ที่เล่นเก่ง Set 8 ถูกตรึงด้วยการ์ด 826 ใบ, engine commit, environment hash, เด็คถูกกฎหมาย และ seed คงที่ baseline เก่า 12,480 เกมมี rule coverage 100%, unsupported 0, rule gap 0 แต่ AI ดิบกลับให้ Sword ราว 79.8%, Forest 63.7%, Dragon 60.9%, Rune 25.6%

การทำผิดซ้ำหนึ่งหมื่นครั้งไม่ได้ทำให้มันถูก แค่ทำให้ความผิดพลาดสม่ำเสมอมากขึ้น

2. ใส่คำแนะนำมนุษย์แล้ว AI อ่อนลง

human-prior-v1 ใส่แนวคิดอย่างเก็บ resource สำคัญ รักษา setup และอย่าใช้ evolution มั่ว exact A/B ใช้ 2,016 paired units และ 4,032 engine games baseline 50.99%, human-prior-v1 49.36%, ลด -1.64pt

AI ฟังมนุษย์แล้วแพ้มากขึ้น

เหตุผลคือคำแนะนำมนุษย์มีเงื่อนไข “เก็บใบนี้ไว้” ไม่จริงถ้าไม่ใช้แล้วตายทันที fixed weight เก็บประโยคไว้แต่ฆ่าบริบททิ้ง

3. Adaptive v2 เพิ่มค่าเฉลี่ย แต่ทำ Witch พัง

Adaptive v2 สลับ LETHAL, SURVIVE, STABILIZE, SETUP, RESOURCE, PRESSURE พร้อม search สั้นและ future value ภาพรวม +0.74pt เทียบ v1 แต่ Runecraft -6.25pt ต่ำกว่า preregistered leader floor -5pt จึง REJECT

T11 ต่อมา +0.30 เทียบ v1 แต่ -2.38 เทียบ reference-v5 และ Abyss -16.67 จึง REJECT เช่นกัน

คะแนนเฉลี่ยผ่าน แต่ข้อสอบวิชาหนึ่งกำลังไหม้

4. วิเคราะห์สาเหตุแล้วนักวิจัยโดนจับก่อน

พบ bug จริงว่า max_nodes=160 ไม่ได้ต่อกับ planner ทำให้ 9,067 decisions เกิน nominal limit แต่แก้แล้ว performance กว้างก็ไม่ดีขึ้น

จากนั้นเจอ actor attribution bug การแทรกแซงที่บอกว่า “loss→win” ถูกมองจาก fixed player แต่จาก actor ที่เปลี่ยน action จริงกลับเป็น win→loss นักวิจัยจับเหยื่อแทนคนร้าย

แก้ actor/direction/invariant แล้ว แต่สาเหตุ performance หลักยังหนีอยู่

5. หลัง 31,406 เกม “ยังไม่รู้” กลายเป็นข้อสรุปที่ยอมรับได้

งานวิจัย policy Set 8 ปิดที่ 20 experiments และ 31,406 confirmed actual engine games จาก discordant 439 units มีสาเหตุ performance ที่อธิบายเชิงเหตุครบ 0, บางส่วน 11, unresolved 428

สถานะ PAUSED_COMPLETE_NO_PROMOTION, active ยังเป็น human-prior-v1, final unseen holdout 8,064 เกมไม่ถูกใช้

ความสำเร็จไม่ใช่ super AI แต่เป็นระบบที่ไม่เลื่อน AI เพียงเพราะกราฟบางรูปดูสวย

6. จากนั้นให้ 52 เด็คตลาดตีกัน 46,900 เกม

market corpus มี 52 decks, 25 archetypes, 7 leaders รวม quick/broad, local optimization 1–3 ใบ, unseen-seed ranking และ guide trace เป็น 46,900 actual engine games

เด็คแนะนำ 7 เด็คเล่น direct round robin: 21 unordered pairs, 1,512 games, 72 ต่อ non-diagonal cell, reference-v5 756 และ human-prior-v1 756, first/second 756/756 coverage 100%, unsupported/rule gap/hidden-info violation เท่ากับ 0

7. เกิด “อันดับ AI สมองตายตีกันเอง”

อันดับ เด็ค ค่าเฉลี่ย 7×7 คู่ต่อสู้แย่สุด
1 Buff Forest 71.99% Abyss 59.72%
2 Rally Sword 65.97% Forest 31.94%
3 Midrange Abyss 54.17% 40.3%
4 Artifact Portal 54.17% 36.1%
5 Ramp Dragon 53.70% Forest 25.0%
6 Evolution Haven 31.71% Dragon 12.5%
7 Calgidensula Witch 18.29% Forest 1.4%

เด็คที่ “เล่นของแรงตอนนี้” แล้วมักยังดีในอนาคตเหมาะกับ AI ปัจจุบัน ส่วนเด็คที่ยอมเสีย tempo เพื่อซื้อพลังในอีก 2–3 เทิร์นกลับยากกว่า จึงได้ชื่อเล่นนี้

8. ในทัวร์นาเมนต์มนุษย์ Witch อยู่คนละจักรวาล

Dexel Rising Cup #2 วันที่ 8 ส.ค. 2026: 64 ทีม 192 คน 384 เด็ค Hand Witch ถูกนำมา 116 เด็ค ประมาณ 30.2% มากที่สุดชัดเจน AF/Storm Portal 52, Evolution Haven 34, Rally/Evolution Sword 29, Ramp Dragon 25

มนุษย์ระดับสูงมอง Witch เป็น top meta แต่ Calgidensula Witch ใน AI 7×7 จบสุดท้าย 18.29% ห้ามถือว่าเป็นลิสต์ 40 ใบเหมือนกันทุกใบ แต่ช่องว่างมนุษย์กับ AI ชัดมาก

Rally Sword แข็งทั้งสองฝั่ง จึงเกิด heuristic หยาบ ๆ ว่า แข็งกับ AI ง่าย + แข็งกับมนุษย์เก่ง อาจหมายถึงทนต่อ decision error ได้ดี

9. Future Optionality audit

ตรวจ 24 mechanics ของ 7 leaders ผ่าน RULE, STATE, VISIBILITY, IMMEDIATE VALUE, FUTURE VALUE, SEQUENCE, SEARCH, PLAN

จาก 27,810 decisions และ 118,575 root candidates มีเพียง 8,878 หรือ 7.49% ที่มี explicit future value rule/state/immediate รองรับ 24/24 แต่ sequence MISSING 23/24 และ plan MISSING 20/24

AI รู้กฎและรู้ “กำไรตอนนี้” แต่แทบไม่มีตัวแทนของลำดับและแผนยาว

10. Witch: รู้ว่า Spellboost มีอยู่ ไม่เท่ากับเข้าใจมัน

Spellboost มี rule/state แต่ visibility/future value PARTIAL และ sequence/plan MISSING DRAW → SPELL ต่างจาก SPELL → DRAW เพราะใบที่จั่วก่อนอาจได้รับ boost แต่ใบที่จั่วหลังไม่ย้อนกลับไปได้รับ boost ที่เกิดแล้ว

12 synthetic fixtures: DRAW_FIRST_BETTER 4, SPELL_FIRST_BETTER 0, EQUIVALENT 8 ส่วน 50 representative real states สรุป STATE_DEPENDENT ดังนั้นไม่ควรสร้างกฎ “จั่วก่อนเสมอ” แต่ต้อง replan หลังเห็นผลจั่ว

11. Dragon: +1 max PP คือซื้อสิทธิ์การกระทำในอนาคต

Ramp อาจเสียบอร์ดตอนนี้ แต่เปิดไพ่แพง multi-card turn, heal, removal, finisher และ 6→7 ข้าม Awakening threshold

audit พบ Dragoncraft MYOPIC_REVERSAL 12: ramp 6 + Awakening 6 immediate control สูงกว่า แต่ diagnostic continuation t+2 บางครั้งพลิกอันดับ ห้ามแก้ด้วย ramp bonus แบบ hard-code

12. อีกห้าคลาสก็มีโรคเวอร์ชันของตัวเอง

Forest มี combo threshold, generation และ bounce order; Sword มี Rally 9→10 และ multi-summon; Abyss มี Shadows, reanimate pool และ HP resource; Haven มี Countdown/Act ซึ่งการไม่ใช้ตอนนี้รักษาสิทธิ์ในอนาคต; Portal มี 0-cost token/copy ที่ทำให้ sequence space ระเบิด

EP, SEP, Extra PP, มือ 9 ใบ, บอร์ด 5 ช่อง, leader area 5 ช่อง ก็เป็น trade-off ระหว่างค่าปัจจุบันกับ optionality อนาคต

13. จึงสร้าง closed-loop planner 3 เทิร์นจริง

planner ต้องเดิน engine อย่างน้อยสาม future turn boundary ไม่ใช่สาม action และไม่ล็อก script ล่วงหน้า ทำหนึ่ง action → สังเกต draw/generation/random → คำนวณสามเทิร์นใหม่จาก state ใหม่ คล้าย Receding Horizon / MPC

ไม่มอง future draw order ของตัวเองหรือ true hand ของคู่ต่อสู้ ใช้ belief sampling และ FutureRelevantState เก็บ Spellboost, Extra PP, Countdown, Act, Rally, Shadows, destroyed-follower pool ไม่มี fixed optionality/Witch/ramp bonus

14. Implementation ผ่าน แต่ performance พังลงล่าง

Ablation 56 actual engine games ประเมิน 3,979 / 3,979 root actions, three-turn completion 100%, hidden-info violation 0 observation replan 81,621 ครั้ง และ plan change 35,821 ครั้ง

แต่ base/widen = -37.5pt เทียบ human-prior-v1 ส่วน replan/state/robust = -25.0pt ทุก candidate ต่ำกว่า preregistered -10pt floor จึง REJECT_ACTIVE_UNCHANGED และ targeted/broad/market 7×7/final holdout ไม่ถูก run

เราได้ AI ที่มองไกลกว่าเดิมและผิดด้วยความมั่นใจมากกว่าเดิม

15. นี่ไม่ได้พิสูจน์ว่า 3 เทิร์นเพียงพอ

สิ่งที่หายไปคือข้อสงสัยว่า implementation ไม่ถึง 3 เทิร์น ไม่ได้พิสูจน์ว่า horizon 3 เทิร์นเพียงพอเชิงกลยุทธ์ และการดีขึ้นจาก -37.5 ไป -25.0 ของ replan เป็นเพียง directional signal เพราะแต่ละ candidate มี 8 conditions เท่านั้น

Dragon reversal เก่า 12 กรณีเมื่อใช้ real three-turn search มีเพียง 1/12 ที่เปลี่ยนอันดับไป ramp จริง ๆ ดังนั้น proxy เดิมไม่ใช่ ground truth

ผู้ต้องสงสัยใหม่คือ terminal/leaf evaluator และ opponent response model

16. คำถามถัดไป: “บอกว่าอนาคตนี้ -150 แล้วถ้าเล่นจริงจากตรงนี้ 100 ครั้งชนะกี่ครั้ง?”

รอบต่อไปยังไม่แก้ weight แต่ freeze leaf 3 เทิร์น แล้วแยก evaluator เป็น raw feature→normalization→weight→contribution เพื่อหาว่า term ไหนสร้างค่า -150

จาก leaf เดิม run จนจบ 32–128 ครั้งเพื่อหา empirical win rate raw score ไม่ใช่ probability จึงต้อง calibrate score→probability แล้ววัด Brier score, log loss, reliability ส่วน ranking วัด Spearman, Kendall, same-root argmax accuracy, pairwise concordance, decision regret

opponent response ทำ cross-play ระหว่าง human-prior-v1, reference-v5 และ search-based stress response แล้วจึงแยกได้ว่า leaf scoring ผิด, opponent model ผิด, scale/weight ผิด, state representation ขาด หรือ 3 เทิร์นยังสั้น

17. สรุป: เห็นอนาคตแล้ว แต่ใบตรวจคะแนนน่าสงสัย

AI เดินทางจาก “อะไรแรงตอนนี้” มาถึง “ฉันจำลองอนาคต 3 เทิร์นได้จริง” แล้ว แต่เรายังเชื่อวิธีที่มันให้คะแนนอนาคตไม่ได้

จาก Sword 79.8%, human advice ที่ย้อนศร, Witch พัง, actor bug, market 46,900 เกม, Future Optionality audit จนถึง three-turn foresight จริง

แล้วมันอ่อนลง

เดิมแค่อยากตีหน้า วิชาต่อไปกลับเป็น Brier score กับ leaf-value calibration นี่ Shadowverse หรือปริญญาโทกันแน่

ภาคผนวกข้อมูล

  • Set 8 card DB: 826
  • baseline: 12,480 games
  • policy research: 31,406 games
  • status: PAUSED_COMPLETE_NO_PROMOTION
  • active: human-prior-v1
  • market: 52 decks / 25 archetypes / 7 leaders
  • market analysis: 46,900 games
  • direct 7×7: 1,512 games
  • optionality: 27,810 decisions / 118,575 candidates / 7.49%
  • sequence MISSING 23/24; plan MISSING 20/24
  • Dragon reversals: 12 = ramp 6 + Awakening 6
  • RH3 Ablation: 56 games
  • root coverage: 3,979/3,979; completion 100%
  • replans 81,621; plan changes 35,821
  • result: REJECT_ACTIVE_UNCHANGED
  • final holdout: NOT_RUN
  • Shadowverse: Worlds Beyond official Deck Portal
  • Dexel Rising Cup #2
  • Silver & Veness (2010), POMCP
  • Cowling, Powley & Whitehouse (2012), ISMCTS
  • Model Predictive Control / Receding Horizon Control
  • Brier score / reliability / clustered validation literature

วันนี้อ่านเรื่องนี้

แต่ละบทความตอบคำถามที่ผู้อ่านบทความนี้มักสงสัยต่อ

ดูบทความทั้งหมดบทความเรื่อง เกมการ์ดและบอร์ดเกม เพิ่มเติม

โฆษณา

อีกสักเรื่องไหม มีอะไรสนุก ๆ บ้าง

อ่านจบแล้วก็ลองต่อเลย: เรื่องใกล้เคียงไม่กี่เรื่อง และเรื่องที่ต่างไปเลยแต่สนุก

  1. เรื่องใกล้เคียงเริ่มจากแบบทดสอบความเข้ากันได้ แต่ทำไปทำมากลายเป็นการวิเคราะห์ “โหมดเสียหายของชีวิตแต่งงาน”
  2. ทำไมการโจมตีของฉันแพ้หมดเลยคนเล่น Pyra/Mythra ปะทะความไร้ตัวตนของ Kazuya และพุงจระเข้
  3. ต่างไปเลย แต่สนุกสุดท้ายก็หน้าตาหรือ?จาก “รางวัลทางเพศหลังวิ่ง 100 เมตร” ถึงเครือข่ายความกระอักกระอ่วน: บทสนทนาบ้า ๆ กลายเป็นการบริหารความเสี่ยงของความรัก
  4. ตี 5ร่างกายบอก “นอนได้แล้ว” แต่สมองบอก “ร้านยังเปิดครับ”
  5. ทำไมเด็กถึงพลังเหลือเฟือ?จากเครื่องยนต์ “เบื่อ → วิ่ง” สู่โหมดสงบในวัยรุ่นและยุคสมาร์ตโฟน
  6. เมื่อคำว่า “ปกป้องน้องสาว” กลายเป็นระบบปฏิบัติการของ Toshiki ความรักครอบครัวกับการตรวจสอบครอบครัวก็รันอยู่ในเครื่องเดียวกัน

หาบทความอื่น

บทความทั้งหมด

Mendoi-chan

ผู้ดูแลเว็บไซต์

Mendoi-chan

เรียบเรียงความยุ่งยากในที่ทำงานและชีวิตประจำวันให้เป็นโครงสร้างที่ชัดเจนและขั้นตอนถัดไปที่ทำได้จริง

โฆษณา

บทความล่าสุด

  1. 1บาทหลวงขโมยชุดชั้นในโดนจับ แต่ “ลุงนักผสมพันธุ์” กลับเป็นฮีโร่? มังงะตัดส่วนที่รสนิยมเฉพาะทางที่สุด ขณะที่เว็บโนเวลปลุกสกิล “ตั้งครรภ์จากจินตนาการ”
  2. 2มนุษย์ชนะอันนี้ไม่ได้ — เล่น PRAGMATA เหมือนเดินพิพิธภัณฑ์บนดวงจันทร์ แล้วเริ่มสิ้นหวังกับกำลังผลิตของอารยธรรมเครื่องจักร
  3. 3สำหรับคนที่ทำอะไรคนเดียวไม่ค่อยได้: แยกปัญหา “ไม่มีคนไปด้วยก็ไม่ไป” แล้วสร้าง “OS สำหรับการออกไปคนเดียว”
  4. 4ฐานบนดวงจันทร์ยังพังไม่หมด ระบบควบคุมของผมพังก่อน
  5. 5สินเชื่อบ้าน 50 ปีไม่ได้ทำให้บ้านถูกลง — เกมหนี้ ความเสี่ยงดอกเบี้ย และการจับตาของ FSA ญี่ปุ่น

บทความที่เกี่ยวข้อง

โฆษณา