เล่น 12,480 เกมแล้ว AI จะฉลาดขึ้นไหม? ไม่เสมอไป บางทีแค่ทำให้คำตอบผิดแม่นขึ้น

วิธีใช้เครื่องมืออ่าน

ฟังจะอ่านบทความออกเสียง อ่านเร็วแสดงวลีทีละช่วงตามความเร็วที่เลือก ฝึกภาษาใช้เปรียบเทียบบทความฉบับแปลที่มีอยู่ บันทึกจะเก็บบุ๊กมาร์กในเบราว์เซอร์นี้ และเปิดอีกครั้งได้จากรายการที่บันทึกในเครื่องเล่น

แชร์บทความนี้

แชร์บทความนี้

โฆษณา
โฆษณา

ตอนสร้างซิมูเลเตอร์เกมการ์ด สิ่งที่อยากทำก่อนคือ “รันเยอะ ๆ” 100 เกมเป็น 1,000 เกม 1,000 เป็น 10,000 แล้ว CSV ใหญ่ ๆ ก็ดูเหมือนงานวิจัยขึ้นมาทันที

แต่กับดักคือ ถ้านโยบายการเล่นผิด การรันเพิ่มก็แค่คำนวณพฤติกรรมที่ผิดให้แม่นกว่าเดิม

ในกรณีศึกษา เรารันกฎคงที่ครบ 12,480 เกม และส่วนกฎผ่านการตรวจได้ดี แต่ผลดิบกลับสุดโต่ง: Royal ราว 79.8% ส่วน Witch ราว 25.6% นี่ไม่ได้แปลว่า Royal ชนะจริง 80% แต่แปลว่าควรสงสัยนโยบายการเล่นของ AI

หลักข้อแรกจึงคือ ก่อนเพิ่มจำนวนเกม ตรวจให้แน่ใจก่อนว่า CPU เล่นเกมเป็นจริง ๆ

1. ซิมูเลเตอร์ไม่ใช่ AI ก้อนเดียว: แยกกฎ การตัดสินใจ และการให้คะแนน

อย่างน้อยต้องมีสามชั้น

  1. Rules engine: ตัดสินว่าแอ็กชันไหนถูกกฎ และคำนวณดาเมจ เป้าหมาย วิวัฒน์ และเอฟเฟกต์
  2. Play policy: เลือกหนึ่งแอ็กชันจากสิ่งที่ทำได้
  3. Evaluator: ตัดสินว่าเด็คหรือนโยบายดีจริงไหม

ถ้าปนกันหมด เวลาเลขแปลกจะไม่รู้ว่าเป็นบั๊กการ์ด, AI เล่นแย่, อคติจากการได้เริ่มก่อน หรือสูตรคะแนนพัง

ดังนั้นต้องทดสอบ ความถูกกฎ คุณภาพการตัดสินใจ และคุณภาพการประเมินแยกกัน

2. สร้าง rules engine ก่อน: ฟิสิกส์มาก่อนความฉลาด

ก่อนจะมี AI เก่ง ต้องมีโลกเกมที่สม่ำเสมอ

ระบบต้องจัดการความถูกต้องของเด็ค จำนวนการ์ดซ้ำ คลาส PP การจั่ว mulligan ขีดจำกัดบอร์ด การโจมตี Ward/Storm/Rush ระบบวิวัฒน์ เป้าหมาย การ์ดที่สร้างขึ้น token กลไกพิเศษ และเงื่อนไขชนะ

แต่ละการ์ดหรือกลไกควรมีสถานะ:

  • Full
  • Partial
  • Unsupported
  • Runtime gap

ถ้าการ์ดยังไม่รองรับ หยุดแล้วบอกตรง ๆ ดีกว่าสร้าง “ชนะ 57.3%” จากกฎที่ไม่ครบ

3. AI เล่นเกมต้องคิดมากกว่า “ตอนนี้อะไรแรงที่สุด”

เกมการ์ดชนะกันที่อนาคต

AI ควรดูมูลค่าบอร์ด มือ แผน 1–3 เทิร์น โอกาส lethal คุณค่าของการเก็บ combo piece ทรัพยากรวิวัฒน์ คำตอบที่คู่แข่งน่าจะมี ความเสี่ยงมือเต็ม พื้นที่บอร์ด และ win condition สำรอง

นโยบาย “เล่นอะไรได้ก็เล่น ตัวไหนใหญ่ก็ลง ตีหน้าได้ก็ตี” อาจดูดีในเด็ค tempo ง่าย ๆ แต่จะพังเร็วใน combo/control

4. ความรู้จากผู้เล่นควรเป็นคำใบ้ ไม่ใช่คุก

เอาคู่มือทั้งหมดไปเขียนเป็น if แข็ง ๆ จะได้หุ่นยนต์อ่านตำรา

ดีกว่าคือแปลงเป็น คะแนนบวก คะแนนลบ และลำดับความสำคัญ

เช่น เพิ่มค่าการ์ดกวาดบอร์ดเมื่อเจอ aggro, ลดคะแนนการใช้ combo piece เร็วเกินไป, เพิ่มคะแนนการเก็บวิวัฒน์ไว้ turn สำคัญ, ลดการลงของมากก่อน turn โต้กลับแรงของคู่แข่ง และเพิ่มค่าของอนาคตถ้ามี lethal ใน 2–3 turn

ความรู้แต่ละชิ้นควรมี pack, format, leader, archetype, matchup, first/second, phase, วันที่ และ confidence ถ้าความเห็นขัดกัน ให้เก็บหลาย policy candidate

5. A/B ที่ยุติธรรมต้องให้ทั้งสอง AI ทำข้อสอบชุดเดียวกัน

AI เก่ามือพัง แต่ AI ใหม่มือเทพ แบบนั้นเทียบไม่ได้

ใช้ random seed เดียวกัน แล้วสลับ first/second

seed 001: AI เก่า first / AI ใหม่ second
seed 001: AI ใหม่ first / AI เก่า second
...

นอกจากผลแพ้ชนะ ให้เก็บ missed lethal, ไพ่ไหม้, บอร์ดติด, ใช้วิวัฒน์เสียเปล่า, ใช้ combo เร็ว, mulligan พลาด และไม่เคารพ turn โต้กลับของคู่แข่ง

เพื่อจับเคส “ชนะก็จริง แต่เล่นโง่อยู่ดี”

6. ทำไม 2,016 เกม? ไม่ใช่เลขศักดิ์สิทธิ์ แค่คูณกัน

2,016 ไม่มีเวทมนตร์

56 ช่องทดสอบ matchup
× 18 seed
× 2 เกมคู่แบบสลับ first/second
= 2,016 เกม

สิ่งสำคัญคือกำหนด coverage ก่อน

  • quick: หลักสิบถึงหลักร้อย เอาไว้เช็กระบบ
  • standard: ราว 2,000 สำหรับ policy A/B และ matchup หลัก
  • full: 10,000+ สำหรับประเมินทั้ง environment

ถ้ารัน full ก่อนแล้วค่อยพบว่า AI โง่ ก็เท่ากับผลิตขยะที่แม่นมาก

7. หาเด็คดีที่สุดไม่ใช่ brute-force การ์ด 40 ใบทุกชุด

พื้นที่ค้นหาใหญ่เกินไป เริ่มจากเด็คแข่งหรือเด็คสาธารณะ แล้วสร้าง candidate ใกล้เคียง เช่น เปลี่ยน 1–3 ใบ ปรับจำนวนใบ แทนการ์ดบทบาทเดียวกัน ใส่ tech ตาม matchup หรือเปลี่ยน package

อย่าดูแค่ค่า win rate เฉลี่ย ต้องดู downside risk ความเสถียร first/second และพื้นของ matchup แย่ด้วย

ผลที่ซื่อตรงคือ “เด็คที่ดีที่สุดในกลุ่ม candidate ภายใต้ snapshot, policy, meta weight และงบ simulation นี้”

8. ระบบวินิจฉัยมีค่ากว่าเลข win rate เปล่า ๆ

เมื่อใส่เด็ค 40 ใบกับ leader/archetype ฝั่งตรงข้าม ระบบควรบอก win rate + ความไม่แน่นอน, first/second, mulligan, เป้าหมายต้น/กลาง/ท้ายเกม, win condition, ไพ่ที่ควรเก็บ, removal priority, จังหวะวิวัฒน์, turn โต้กลับของคู่แข่ง, lethal 2–3 turn, ความผิดพลาดที่พบบ่อย, ทางเลือก และ tech candidate

ตรงนี้ซิมูเลเตอร์จะกลายเป็นโค้ช

9. เหตุการณ์ Royal 79.8%: หรือ “ลงตัวแล้วตีหน้า” มันง่ายกับ AI เกินไป

สมมติฐานขำ ๆ แต่จริงจังคือ เด็คที่ตรงไปตรงมาอาจง่ายกว่าสำหรับ AI ที่ยังไม่เก่ง

Royal อาจทำแค่นี้:

ลง follower!
เอาบอร์ด!
หน้าว่าง!
ตี!
ชนะ!

แต่ Witch ที่ออกแบบไม่ดีอาจเป็น:

combo piece? ใช้ได้ตอนนี้! ใช้เลย!
ทรัพยากรวิวัฒน์? แรงตอนนี้! ใช้เลย!
มือเต็ม? ไม่รู้จัก!
อีกสาม turn? ให้ตัวฉันในอนาคตจัดการ!

นี่ไม่ใช่หลักฐานของ meta จริง แต่เป็นหลักฐานว่า แต่ละเด็คต้องการความสามารถคิดจาก AI ไม่เท่ากัน

10. เตรียมระบบให้พร้อมเมื่อ environment เปลี่ยน: ของจริงคือห้องทดลอง

เก็บ rotation ปัจจุบันเป็น environment แบบมีเวอร์ชัน

Environment 8
- card snapshot
- legal card pool
- engine version
- policy version
- meta decks
- human knowledge
- simulation results

พอ pack ใหม่มา ให้สร้าง environment ใหม่และ diff การ์ดใหม่ การ์ดหลุด rotation balance restriction archetype ใหม่ การรองรับของ engine และ meta weight

ถ้าเปลี่ยนแค่สัดส่วน meta ก็ reweight ตารางเดิม ถ้าการ์ดใหม่เข้าเด็คค่อยรันส่วนที่เกี่ยว ถ้ากลไกใหม่ยังไม่รองรับก็ห้าม promote snapshot

เป้าหมายจริงคือ traceability: เลขนี้มาจากกฎไหน policy ไหน card DB ไหน seed ไหน และ environment ไหน

ถ้า Royal กลับมาเกือบ 80% อีก อย่าเพิ่งสวมมงกุฎ

ถามก่อนว่า: บอทตัวนี้คิดว่าเกมทั้งหมดคือ “ลงตัว แล้วตีหน้า” หรือเปล่า?

วันนี้อ่านเรื่องนี้

แต่ละบทความตอบคำถามที่ผู้อ่านบทความนี้มักสงสัยต่อ

ดูบทความทั้งหมดบทความเรื่อง เกมการ์ดและบอร์ดเกม เพิ่มเติม

แชร์บทความนี้

โฆษณา

หาบทความอื่น

บทความทั้งหมด

Mendoi-chan

ผู้เขียน

Mendoi-chan

เรียบเรียงความยุ่งยากในที่ทำงานและชีวิตประจำวันให้เป็นโครงสร้างที่ชัดเจนและขั้นตอนถัดไปที่ทำได้จริง

เกี่ยวกับเว็บไซต์
โฆษณา

บทความล่าสุด

  1. 1ค่าเช่าสะสม 5 ล้านเยนคือ “เงินที่ทิ้งไป” จริงหรือ? สำหรับคนอยู่หนึ่งหรือสองคน การซื้อเฉพาะพื้นที่ที่ใช้จริงอาจคุ้มกว่า
  2. 2เงินเดือนปีละ 6 ล้านเยนสูงไหม? ถ้า “เพื่อนผม 30 คนได้กันหมด” คือกลุ่มตัวอย่างญี่ปุ่น ตัวหารก็ระเบิด
  3. 3ร่างกายมนุษย์ใช้งานยากเกินไป: ทำไมไม่มีค่าสเตตัส “พละกำลัง +1” อันเดียว
  4. 4อย่าตั้งด่านเก็บค่าผ่านทางไว้กลางบทความ: ปุ่ม “ถัดไป”, Pageview, Paywall และการรีเฟรชโฆษณา
  5. 5AI ชนขีดจำกัด สตรีมมิงก็ชนขีดจำกัด—แล้วเวลาว่างแบบ “ไม่มีอะไรทำจริง ๆ” ก็กลับมา
โฆษณา