1. แค่อยาก Storm ใส่หน้า แต่ดันได้ห้องแล็บ
เป้าหมายเดิมคือใช้ AI หาเด็คที่แข็งที่สุด โดยล็อก Set 8, ฐานข้อมูล 826 ใบ, engine commit, environment hash, deck ที่ถูกกติกา และ seed. baseline 12,480 เกมมี rule coverage 100%, unsupported 0, rule gap 0 แต่ raw AI ยังออกผลประหลาด เช่น Sword ~79.8% และ Rune ~25.6%.
ทำผิดซ้ำหนึ่งหมื่นครั้งไม่ได้ทำให้มันกลายเป็นความจริง
2. ใส่คำแนะนำมนุษย์แล้วบอตอ่อนลง และค่าเฉลี่ยก็หลอกได้
human-prior-v1 ทดสอบ 2,016 paired units / 4,032 games: baseline 50.99%, ใหม่ 49.36%, -1.64pt. Adaptive v2 โดยรวม +0.74pt แต่ Runecraft -6.25pt จนตก leader floor; T11 ก็ล้ม รวมถึง Abysscraft -16.67pt.
คำแนะนำมนุษย์ขึ้นกับสถานการณ์ แต่ fixed weight อาจฆ่าบริบท ค่าเฉลี่ยผ่านไม่ได้แปลว่าทุก leader ปลอดภัย
3. วิเคราะห์สาเหตุแล้วเจอบั๊กของห้องแล็บเอง
แก้ max_nodes=160 ที่ไม่ได้ต่อเข้า planner และบั๊กมุมมอง actor/fixed-player ที่กลับทิศข้อสรุปเชิงเหตุผล แต่ performance กว้างยังไม่ฟื้น
งาน policy Set 8 หยุดหลัง 20 experiments / 31,406 confirmed engine games ที่ PAUSED_COMPLETE_NO_PROMOTION. จาก 439 discordant units อธิบายครบ 0, บางส่วน 11, unresolved 428. human-prior-v1 ยัง active และ final unseen holdout 8,064 เกมยังปิดผนึก
4. ให้ 52 deck ตีกัน 46,900 เกม แล้วเกิด “อันดับสมองดับชนสมองดับ”
corpus มี 52 decks / 25 archetypes / 7 leaders. market analysis 46,900 เกม และ direct 7×7 แยกอีก 1,512 เกม. ค่าเฉลี่ย: Buff Forest 71.99%, Rally Sword 65.97%, Midrange Abyss 54.17%, Artifact Portal 54.17%, Ramp Dragon 53.70%, Evolution Haven 31.71%, Calgidensula Witch 18.29%.
นี่คือ simulator-direct ไม่ใช่ ladder WR. เด็คที่ “เก่งตอนนี้แล้วมักเก่งต่อ” ดูง่ายกว่าสำหรับ AI ปัจจุบัน
5. ในทัวร์มนุษย์ Witch อยู่คนละจักรวาล
Dexel Rising Cup #2 วันที่ 8 ส.ค. 2026 มี 384 deck; Hand Witch 116 deck หรือ ~30.2% มากที่สุด. แต่ Calgidensula Witch ใน direct 7×7 ของ AI จบสุดท้ายที่ 18.29%. ห้ามถือว่าเป็น 40 ใบเดียวกัน แต่ช่องว่างมนุษย์-AI ใหญ่มาก
Rally Sword แข็งทั้งสองฝั่ง จึงเกิดสมมติฐานว่า strategy ที่ทนต่อการตัดสินใจพลาดอาจเหมาะกับผู้เล่นทั่วไปกว่า
6. Future Optionality: รู้กติกา แต่แทบไม่มีลำดับและแผน
ตรวจ 7 leaders / 24 mechanics ใน RULE, STATE, VISIBILITY, IMMEDIATE VALUE, FUTURE VALUE, SEQUENCE, SEARCH, PLAN. จาก 27,810 decisions / 118,575 root candidates มี explicit future value เพียง 8,878 หรือ 7.49%. rule/state/immediate 24/24 supported แต่ sequence MISSING 23/24 และ plan MISSING 20/24.
Witch แสดงผลของลำดับ draw; Dragon แสดงว่า PP และ Awakening เปิดทางเลือกอนาคต. MYOPIC_REVERSAL 12 ของ Dragon = ramp 6 + Awakening 6 แต่ไม่ hard-code bonus.
7. สร้าง closed-loop planner 3 เทิร์นจริง
engine เดินอย่างน้อย 3 future turn boundaries, ทำเพียงหนึ่ง action แล้วดู draw/random/opponent action ก่อน replan. ไม่ดู hidden hand หรือ future draw order.
Ablation 56 เกม: root 3,979/3,979, 3-turn completion 100%, hidden-info 0, replans 81,621, plan changes 35,821. implementation ผ่าน แต่ performance -25.0 ถึง -37.5pt เทียบ human-prior-v1. มองไกลขึ้น แล้วผิดได้ไกลขึ้น
8. Leaf calibration แยกจุดที่ ranking พัง
เก็บ 3,979 root-action leaves, 1,009 unique leaves, 54,208 terminal rollout rows. first divergence 73 รายการ: leaf weighting 59, chance aggregation 12, opponent backup 2.
ผู้ต้องสงสัยหลักจึงเป็นการให้ค่าที่ leaf. proxy Dragon เดิม 12 รายการ เมื่อใช้ search 3 เทิร์นจริง เปลี่ยนไปทาง ramp เพียง 1/12.
9. Learned value ทำนายดีขึ้น แต่เลือกอันดับหนึ่งแย่ลง
fresh holdout v1.1: 727 leaves / 104 roots / 22,768 terminal rollouts, 7 leaders. Brier 0.1144→0.0972 และ pairwise 75.7→78.9% ดีขึ้น.
แต่ root argmax 59.6→39.4%, top2 73.1→64.4%, top3 82.7→76.0%, mean regret 4.42→5.29pt; Forest/Haven/Portal ตก floor. HOLD_OFFLINE.
ทำนายความน่าจะเป็นดี ไม่ได้แปลว่าเลือกการ์ดที่ดีที่สุดได้
10. ต่อไปคิดย้อนจาก lethal
ใช้ LETHAL ← damage ← PP ← cards ← threshold Spellboost/Awakening/Rally ← current action. Ramp ไม่ได้มีค่าเพราะ “+8 คะแนน” แต่เพราะ route ชนะจริงต้องมี 8PP ให้ทันเวลา
สร้างเงื่อนไขย้อนจากเป้าหมาย แล้วใช้ engine จริงตรวจไปข้างหน้า
11. คิดย้อนจากการตายของตัวเองด้วย
จาก SELF_LOSS ย้อนหาดาเมจที่คู่แข่งต้องการ, board damage, hand damage เพิ่ม, เงื่อนไขแก้ Ward, PP และข้อมูลสาธารณะ แล้วดูว่า action ปัจจุบันตัด route ชนะของคู่แข่งกี่ทาง
ถ้าเน้น safety อย่างเดียวจะได้ AI ที่ heal จนแพ้อย่างสุภาพ. RISK_REQUIRED อนุญาตเส้นเสี่ยงที่ไม่ใช่ forced loss เมื่อเส้นปลอดภัยแทบไม่มีโอกาสชนะ
12. คำว่า “forced” ต้องมีขอบเขตการพิสูจน์
ฝั่งชนะ: PROVEN_WIN_NOW, FORCED_WIN_FULLY_OBSERVABLE_SUBTREE, FORCED_WIN_WITHIN_ENUMERATED_RESPONSE_SET, ROBUST_WIN_BELIEF, CONDITIONAL_WIN. ฝั่งแพ้ก็แยก proof, belief, conditional เช่นกัน
proof search ใช้ self=OR, opponent=AND. ถ้าจะเรียก chance ว่าแน่นอน ต้องครอบคลุม reachable outcomes ทั้งหมด. ห้าม hidden-hand truth, future draw order และ strategy fusion; replan หลัง observation เท่านั้น
13. ลำดับ action เปลี่ยนเป็น gate เป็นขั้น
ลำดับคือ proven win now → fully observable forced → enumerated forced → ตัด forced loss ที่หลีกเลี่ยงได้ → max expected final win probability → near-tie safety → robustness → route progress/cut → validated continuation value.
belief/conditional ไม่ใช่ forced. ตัดเป็น strictly dominated ได้เฉพาะ action ที่แย่กว่าทั้งโอกาสชนะและ loss risk.
14. 3 เทิร์นคือขั้นต่ำ ไม่ใช่กำแพง
ค่าเริ่มต้น H_MIN=3, selective H_MAX=5. ต่อ branch เฉพาะเมื่อ lethal, forced response, threshold สำคัญ, delayed payoff หรือ near tie ยังไม่จบ
rollout เริ่ม 32/candidate; top ที่คลุมเครือเพิ่ม 64→128→256. root แบ่ง UNIQUE_BEST / PRACTICAL_TIE / UNRESOLVED. epsilon 0.02/0.03/0.05 เลือกบน development เท่านั้นและ freeze ก่อน holdout ใหม่
15. QC ใหม่: จับความผิดที่มั่นใจเกินไปก่อนตามหา AI ที่เก่งที่สุด
Primary ต้อง hidden-info, future-draw, rule gap, strategy fusion, false proven, forced-scope mislabel, chance-completeness violation, lethal miss, avoidable forced loss และ leakage = 0. จากนั้นดู coverage 7 leaders, argmax, mean/p90/p95 regret, leader floors, top2 best-set.
Brier/pairwise/calibration เป็น Secondary และช่วย Primary failure ไม่ได้. holdout v1.1 ใช้หมดแล้วถาวร
ให้บอตมองอนาคตแล้วมันอ่อนลง สอนความน่าจะเป็นแล้วทำนายดีขึ้นแต่เลือกดีที่สุดแย่ลง ต่อไปจึงคิดย้อนทั้งจากการชนะและการแพ้ และเรียก “forced” เฉพาะสิ่งที่หลักฐานพิสูจน์จริง
สร้าง AI ที่เก่งที่สุดด้วย AI. ตอนนี้ QC อาจเก่งกว่าบอตเกม ซึ่งน่าจะเป็นเรื่องดี
