สร้าง AI ที่เก่งที่สุดด้วย AI — บอต Shadowverse WB ที่มองล่วงหน้า 3 เทิร์นแล้วกลับอ่อนลง เริ่มคิดย้อนจากเส้นทางชนะ เส้นทางแพ้ และผล “บังคับ” ที่ต้องมีขอบเขตหลักฐาน

หยิบยกจาก: “Shadowverse: Worlds Beyond”

ทำผิดซ้ำหนึ่งหมื่นครั้งไม่ได้ทำให้มันกลายเป็นความจริง

วิธีใช้เครื่องมืออ่าน

ฟังจะอ่านบทความออกเสียง อ่านเร็วแสดงวลีทีละช่วงตามความเร็วที่เลือก ฝึกภาษาใช้เปรียบเทียบบทความฉบับแปลที่มีอยู่ บันทึกจะเก็บบุ๊กมาร์กในเบราว์เซอร์นี้ และเปิดอีกครั้งได้จากรายการที่บันทึกในเครื่องเล่น

แชร์บทความนี้

แชร์บทความนี้

โฆษณา
โฆษณา

1. แค่อยาก Storm ใส่หน้า แต่ดันได้ห้องแล็บ

เป้าหมายเดิมคือใช้ AI หาเด็คที่แข็งที่สุด โดยล็อก Set 8, ฐานข้อมูล 826 ใบ, engine commit, environment hash, deck ที่ถูกกติกา และ seed. baseline 12,480 เกมมี rule coverage 100%, unsupported 0, rule gap 0 แต่ raw AI ยังออกผลประหลาด เช่น Sword ~79.8% และ Rune ~25.6%.

ทำผิดซ้ำหนึ่งหมื่นครั้งไม่ได้ทำให้มันกลายเป็นความจริง

2. ใส่คำแนะนำมนุษย์แล้วบอตอ่อนลง และค่าเฉลี่ยก็หลอกได้

human-prior-v1 ทดสอบ 2,016 paired units / 4,032 games: baseline 50.99%, ใหม่ 49.36%, -1.64pt. Adaptive v2 โดยรวม +0.74pt แต่ Runecraft -6.25pt จนตก leader floor; T11 ก็ล้ม รวมถึง Abysscraft -16.67pt.

คำแนะนำมนุษย์ขึ้นกับสถานการณ์ แต่ fixed weight อาจฆ่าบริบท ค่าเฉลี่ยผ่านไม่ได้แปลว่าทุก leader ปลอดภัย

3. วิเคราะห์สาเหตุแล้วเจอบั๊กของห้องแล็บเอง

แก้ max_nodes=160 ที่ไม่ได้ต่อเข้า planner และบั๊กมุมมอง actor/fixed-player ที่กลับทิศข้อสรุปเชิงเหตุผล แต่ performance กว้างยังไม่ฟื้น

งาน policy Set 8 หยุดหลัง 20 experiments / 31,406 confirmed engine games ที่ PAUSED_COMPLETE_NO_PROMOTION. จาก 439 discordant units อธิบายครบ 0, บางส่วน 11, unresolved 428. human-prior-v1 ยัง active และ final unseen holdout 8,064 เกมยังปิดผนึก

4. ให้ 52 deck ตีกัน 46,900 เกม แล้วเกิด “อันดับสมองดับชนสมองดับ”

corpus มี 52 decks / 25 archetypes / 7 leaders. market analysis 46,900 เกม และ direct 7×7 แยกอีก 1,512 เกม. ค่าเฉลี่ย: Buff Forest 71.99%, Rally Sword 65.97%, Midrange Abyss 54.17%, Artifact Portal 54.17%, Ramp Dragon 53.70%, Evolution Haven 31.71%, Calgidensula Witch 18.29%.

นี่คือ simulator-direct ไม่ใช่ ladder WR. เด็คที่ “เก่งตอนนี้แล้วมักเก่งต่อ” ดูง่ายกว่าสำหรับ AI ปัจจุบัน

5. ในทัวร์มนุษย์ Witch อยู่คนละจักรวาล

Dexel Rising Cup #2 วันที่ 8 ส.ค. 2026 มี 384 deck; Hand Witch 116 deck หรือ ~30.2% มากที่สุด. แต่ Calgidensula Witch ใน direct 7×7 ของ AI จบสุดท้ายที่ 18.29%. ห้ามถือว่าเป็น 40 ใบเดียวกัน แต่ช่องว่างมนุษย์-AI ใหญ่มาก

Rally Sword แข็งทั้งสองฝั่ง จึงเกิดสมมติฐานว่า strategy ที่ทนต่อการตัดสินใจพลาดอาจเหมาะกับผู้เล่นทั่วไปกว่า

6. Future Optionality: รู้กติกา แต่แทบไม่มีลำดับและแผน

ตรวจ 7 leaders / 24 mechanics ใน RULE, STATE, VISIBILITY, IMMEDIATE VALUE, FUTURE VALUE, SEQUENCE, SEARCH, PLAN. จาก 27,810 decisions / 118,575 root candidates มี explicit future value เพียง 8,878 หรือ 7.49%. rule/state/immediate 24/24 supported แต่ sequence MISSING 23/24 และ plan MISSING 20/24.

Witch แสดงผลของลำดับ draw; Dragon แสดงว่า PP และ Awakening เปิดทางเลือกอนาคต. MYOPIC_REVERSAL 12 ของ Dragon = ramp 6 + Awakening 6 แต่ไม่ hard-code bonus.

7. สร้าง closed-loop planner 3 เทิร์นจริง

engine เดินอย่างน้อย 3 future turn boundaries, ทำเพียงหนึ่ง action แล้วดู draw/random/opponent action ก่อน replan. ไม่ดู hidden hand หรือ future draw order.

Ablation 56 เกม: root 3,979/3,979, 3-turn completion 100%, hidden-info 0, replans 81,621, plan changes 35,821. implementation ผ่าน แต่ performance -25.0 ถึง -37.5pt เทียบ human-prior-v1. มองไกลขึ้น แล้วผิดได้ไกลขึ้น

8. Leaf calibration แยกจุดที่ ranking พัง

เก็บ 3,979 root-action leaves, 1,009 unique leaves, 54,208 terminal rollout rows. first divergence 73 รายการ: leaf weighting 59, chance aggregation 12, opponent backup 2.

ผู้ต้องสงสัยหลักจึงเป็นการให้ค่าที่ leaf. proxy Dragon เดิม 12 รายการ เมื่อใช้ search 3 เทิร์นจริง เปลี่ยนไปทาง ramp เพียง 1/12.

9. Learned value ทำนายดีขึ้น แต่เลือกอันดับหนึ่งแย่ลง

fresh holdout v1.1: 727 leaves / 104 roots / 22,768 terminal rollouts, 7 leaders. Brier 0.1144→0.0972 และ pairwise 75.7→78.9% ดีขึ้น.

แต่ root argmax 59.6→39.4%, top2 73.1→64.4%, top3 82.7→76.0%, mean regret 4.42→5.29pt; Forest/Haven/Portal ตก floor. HOLD_OFFLINE.

ทำนายความน่าจะเป็นดี ไม่ได้แปลว่าเลือกการ์ดที่ดีที่สุดได้

10. ต่อไปคิดย้อนจาก lethal

ใช้ LETHAL ← damage ← PP ← cards ← threshold Spellboost/Awakening/Rally ← current action. Ramp ไม่ได้มีค่าเพราะ “+8 คะแนน” แต่เพราะ route ชนะจริงต้องมี 8PP ให้ทันเวลา

สร้างเงื่อนไขย้อนจากเป้าหมาย แล้วใช้ engine จริงตรวจไปข้างหน้า

11. คิดย้อนจากการตายของตัวเองด้วย

จาก SELF_LOSS ย้อนหาดาเมจที่คู่แข่งต้องการ, board damage, hand damage เพิ่ม, เงื่อนไขแก้ Ward, PP และข้อมูลสาธารณะ แล้วดูว่า action ปัจจุบันตัด route ชนะของคู่แข่งกี่ทาง

ถ้าเน้น safety อย่างเดียวจะได้ AI ที่ heal จนแพ้อย่างสุภาพ. RISK_REQUIRED อนุญาตเส้นเสี่ยงที่ไม่ใช่ forced loss เมื่อเส้นปลอดภัยแทบไม่มีโอกาสชนะ

12. คำว่า “forced” ต้องมีขอบเขตการพิสูจน์

ฝั่งชนะ: PROVEN_WIN_NOW, FORCED_WIN_FULLY_OBSERVABLE_SUBTREE, FORCED_WIN_WITHIN_ENUMERATED_RESPONSE_SET, ROBUST_WIN_BELIEF, CONDITIONAL_WIN. ฝั่งแพ้ก็แยก proof, belief, conditional เช่นกัน

proof search ใช้ self=OR, opponent=AND. ถ้าจะเรียก chance ว่าแน่นอน ต้องครอบคลุม reachable outcomes ทั้งหมด. ห้าม hidden-hand truth, future draw order และ strategy fusion; replan หลัง observation เท่านั้น

13. ลำดับ action เปลี่ยนเป็น gate เป็นขั้น

ลำดับคือ proven win now → fully observable forced → enumerated forced → ตัด forced loss ที่หลีกเลี่ยงได้ → max expected final win probability → near-tie safety → robustness → route progress/cut → validated continuation value.

belief/conditional ไม่ใช่ forced. ตัดเป็น strictly dominated ได้เฉพาะ action ที่แย่กว่าทั้งโอกาสชนะและ loss risk.

14. 3 เทิร์นคือขั้นต่ำ ไม่ใช่กำแพง

ค่าเริ่มต้น H_MIN=3, selective H_MAX=5. ต่อ branch เฉพาะเมื่อ lethal, forced response, threshold สำคัญ, delayed payoff หรือ near tie ยังไม่จบ

rollout เริ่ม 32/candidate; top ที่คลุมเครือเพิ่ม 64→128→256. root แบ่ง UNIQUE_BEST / PRACTICAL_TIE / UNRESOLVED. epsilon 0.02/0.03/0.05 เลือกบน development เท่านั้นและ freeze ก่อน holdout ใหม่

15. QC ใหม่: จับความผิดที่มั่นใจเกินไปก่อนตามหา AI ที่เก่งที่สุด

Primary ต้อง hidden-info, future-draw, rule gap, strategy fusion, false proven, forced-scope mislabel, chance-completeness violation, lethal miss, avoidable forced loss และ leakage = 0. จากนั้นดู coverage 7 leaders, argmax, mean/p90/p95 regret, leader floors, top2 best-set.

Brier/pairwise/calibration เป็น Secondary และช่วย Primary failure ไม่ได้. holdout v1.1 ใช้หมดแล้วถาวร

ให้บอตมองอนาคตแล้วมันอ่อนลง สอนความน่าจะเป็นแล้วทำนายดีขึ้นแต่เลือกดีที่สุดแย่ลง ต่อไปจึงคิดย้อนทั้งจากการชนะและการแพ้ และเรียก “forced” เฉพาะสิ่งที่หลักฐานพิสูจน์จริง

สร้าง AI ที่เก่งที่สุดด้วย AI. ตอนนี้ QC อาจเก่งกว่าบอตเกม ซึ่งน่าจะเป็นเรื่องดี


วันนี้อ่านเรื่องนี้

แต่ละบทความตอบคำถามที่ผู้อ่านบทความนี้มักสงสัยต่อ

ดูบทความทั้งหมดบทความเรื่อง เกมการ์ดและบอร์ดเกม เพิ่มเติม

แชร์บทความนี้

โฆษณา

อีกสักเรื่องไหม มีอะไรสนุก ๆ บ้าง

อ่านจบแล้วก็ลองต่อเลย: เรื่องใกล้เคียงไม่กี่เรื่อง และเรื่องที่ต่างไปเลยแต่สนุก

  1. เรื่องใกล้เคียงเริ่มจากแบบทดสอบความเข้ากันได้ แต่ทำไปทำมากลายเป็นการวิเคราะห์ “โหมดเสียหายของชีวิตแต่งงาน”
  2. ทำไมการโจมตีของฉันแพ้หมดเลยคนเล่น Pyra/Mythra ปะทะความไร้ตัวตนของ Kazuya และพุงจระเข้
  3. ต่างไปเลย แต่สนุกทำไมการ “ปฏิบัติกับเพื่อนที่มีความพิการแบบคนทั่วไป” จึงอาจยากขึ้น — เมื่อบทบาทผู้ช่วยและกฎ “ห้ามหัวเราะ” ทำลายความสัมพันธ์ที่เป็นธรรมชาติ
  4. อย่าเพิ่งเลิกใช้แอปเดตเลิกทำงานใน “โรงงานปัดโปรไฟล์” ก่อน: ออกแบบการหาคู่ใหม่ด้วย CPA ต่ำและการทดลองเจอตัวจริงหลายครั้ง
  5. ตี 5ร่างกายบอก “นอนได้แล้ว” แต่สมองบอก “ร้านยังเปิดครับ”
  6. ทำไมเด็กถึงพลังเหลือเฟือ?จากเครื่องยนต์ “เบื่อ → วิ่ง” สู่โหมดสงบในวัยรุ่นและยุคสมาร์ตโฟน

หาบทความอื่น

บทความทั้งหมด

Mendoi-chan

ผู้ดูแลเว็บไซต์

Mendoi-chan

เรียบเรียงความยุ่งยากในที่ทำงานและชีวิตประจำวันให้เป็นโครงสร้างที่ชัดเจนและขั้นตอนถัดไปที่ทำได้จริง

โฆษณา

บทความล่าสุด

  1. 1บาทหลวงขโมยชุดชั้นในโดนจับ แต่ “ลุงนักผสมพันธุ์” กลับเป็นฮีโร่? มังงะตัดส่วนที่รสนิยมเฉพาะทางที่สุด ขณะที่เว็บโนเวลปลุกสกิล “ตั้งครรภ์จากจินตนาการ”
  2. 2มนุษย์ชนะอันนี้ไม่ได้ — เล่น PRAGMATA เหมือนเดินพิพิธภัณฑ์บนดวงจันทร์ แล้วเริ่มสิ้นหวังกับกำลังผลิตของอารยธรรมเครื่องจักร
  3. 3สำหรับคนที่ทำอะไรคนเดียวไม่ค่อยได้: แยกปัญหา “ไม่มีคนไปด้วยก็ไม่ไป” แล้วสร้าง “OS สำหรับการออกไปคนเดียว”
  4. 4ฐานบนดวงจันทร์ยังพังไม่หมด ระบบควบคุมของผมพังก่อน
  5. 5สินเชื่อบ้าน 50 ปีไม่ได้ทำให้บ้านถูกลง — เกมหนี้ ความเสี่ยงดอกเบี้ย และการจับตาของ FSA ญี่ปุ่น
โฆษณา