0. สรุปห้าวินาที: AI แก้โจทย์ระดับโลกได้ แต่เคยหลงทางในเกมง่าย ๆ ที่ไม่มีคู่มือ
ความสามารถของ AI มีความไม่สมดุลอย่างแปลกประหลาดมานานแล้ว
คอมพิวเตอร์เหนือกว่ามนุษย์ในหมากรุกมานาน และในปี 2025 Gemini Deep Think รุ่นขั้นสูงทำคะแนน 35/42 ซึ่งอยู่ในระดับเหรียญทองของการแข่งขันคณิตศาสตร์โอลิมปิกระหว่างประเทศจากการตรวจอย่างเป็นทางการ แต่โมเดลแนวหน้ากลับยังเคยลำบากมากเมื่อถูกโยนเข้าไปในสภาพแวดล้อม 2D ง่าย ๆ ที่ไม่มีคำอธิบายและไม่มีเป้าหมายชัดเจน แล้วต้องหาวิธีเล่นเอง[1]
ARC-AGI-3 ถูกสร้างมาเพื่อวัดช่องว่างนี้โดยตรง เอเจนต์ต้องลงมือ สังเกตการเปลี่ยนแปลง อนุมานกลไก ค้นหาเป้าหมาย และวางแผนโดยไม่มีคำอธิบายกฎเป็นภาษาธรรมชาติ[2][3]
เดือนกันยายน 2026 GPT-6 Astra ทำได้ 62.71% บน ARC-AGI-3 Semi-Private ด้วย Standard harness และได้คะแนนยืนยันสูงสุด 99.95% ด้วย Provider Adapter ของ OpenAI[2][4]
นี่ไม่ได้พิสูจน์ว่า AGI เสร็จสมบูรณ์ คะแนนยังไม่ใช่ 100% และผล 99.95% ใช้ระบบจัดการบริบทเฉพาะผู้ให้บริการ
สิ่งที่สำคัญจริง ๆ คือ AI เก่งขึ้นมากในการเรียนรู้ภายในสภาพแวดล้อมใหม่ที่ตอนเริ่มต้นแม้แต่ตัวงานเองก็ยังไม่ชัดเจน
ถ้านำแนวคิดนี้ไปใช้กับตลาด บทบาทที่น่าสนใจกว่า “ทำนายราคาพรุ่งนี้” คือการเป็น นักวิจัยที่ค้นหา edge ที่เป็นไปได้ ทดสอบ และพยายามทำลายข้อสรุปของตัวเอง
1. AGI คืออะไร? และ 1, 2, 3 คือรุ่นของแบบทดสอบ ไม่ใช่ระดับของ AI
AGI ย่อมาจาก Artificial General Intelligence หรือปัญญาประดิษฐ์ทั่วไป
ARC Prize มอง AGI โดยคร่าว ๆ ว่าเป็นระบบที่สามารถเรียนรู้ทักษะที่มนุษย์เรียนได้ ด้วยประสิทธิภาพในการเรียนรู้ใกล้เคียงมนุษย์[2]
ARC-AGI-1, 2 และ 3 ไม่ได้หมายถึง “AGI ระดับ 1, 2, 3” แต่เป็นคนละรุ่นของ benchmark
- ARC-AGI-1: เริ่มในปี 2019 เป็นโจทย์กริดสีที่ต้องหากฎการแปลงที่ซ่อนอยู่จากตัวอย่างเพียงไม่กี่ชุด[5]
- ARC-AGI-2: รูปแบบเหมือนเดิมแต่ยากขึ้น ทุกโจทย์ที่ถูกเลือกได้รับการยืนยันว่ามีอย่างน้อยสองคนแก้ได้ภายในไม่เกินสองครั้ง[5][6]
- ARC-AGI-3: เปลี่ยนจากโจทย์ภาพนิ่งเป็นสภาพแวดล้อมแบบโต้ตอบที่ต้องเรียนรู้ผ่านการกระทำหลายขั้น[3]
ถ้าอธิบายให้เด็กฟัง:
1 = ปริศนาภาพ
2 = ปริศนาภาพที่โหดขึ้นมาก
3 = เกมใหม่ที่มีคนเอาคู่มือไปทิ้ง
2. “เกมที่ไม่รู้จัก” หน้าตาแบบไหน? โลก 2D ที่จะเข้าใจได้ก็ต่อเมื่อเริ่มลงมือ
ARC-AGI-3 ใช้สภาพแวดล้อมกริด 2D แบบผลัดกันเล่น สถานะเกมอาจแสดงบนกริดขนาดสูงสุด 64×64 และเอเจนต์เลือกจากการกระทำที่มีให้[7]
ประเด็นสำคัญคือ รู้ว่ามีปุ่มอะไรบ้างไม่ได้แปลว่ารู้ว่าต้องทำอะไรถึงจะชนะ
ตัวอย่างสมมติที่ไม่ใช่โจทย์จริงอาจเริ่มแบบนี้:
■■□□□□
■●□□▲□
□□□■□□
ไม่มีคำอธิบาย
กดขวาแล้ว ● ขยับ แตะ ▲ แล้วสีเปลี่ยน ไปอีกที่แล้วสิ่งที่ดูคล้ายประตูเปิด
มนุษย์จะเริ่มตั้งสมมติฐานทันที:
“● อาจเป็นตัวเรา”
“▲ อาจเป็นสวิตช์”
“อาจต้องเปลี่ยนสถานะก่อนเข้าประตู”
ARC-AGI-3 วัดวงจร สำรวจ → สร้างแบบจำลอง → หาเป้าหมาย → วางแผนและลงมือ[2]
benchmark ถูกออกแบบให้มนุษย์เข้าใจได้ค่อนข้างเร็ว แต่ไม่ได้หมายความว่าเด็กทุกคนจะผ่านทุกเกมได้ง่าย การศึกษามนุษย์ปี 2026 มีผู้เข้าร่วม 458 คน สภาพแวดล้อมถูกปรับให้มนุษย์แก้ได้ แต่ความสำเร็จรายบุคคลยังแตกต่างกัน[8]
3. ทำไม AI เก่งหมากรุกและคณิตศาสตร์ยาก ๆ แต่กลับอ่อนในเกมแบบนี้?
หมากรุกให้กฎครบตั้งแต่แรก โจทย์คณิตศาสตร์ก็บอกชัดว่าต้องพิสูจน์อะไร
งานอาจยากมหาศาล แต่ กรอบของปัญหาถูกกำหนดมาแล้ว
ARC-AGI-3 ถามคำถามก่อนหน้านั้น:
“อะไรนับว่าเป็นความคืบหน้า?”
“วัตถุนี้มีหน้าที่อะไร?”
“การกระทำเมื่อกี้ทำให้อะไรเปลี่ยน?”
มนุษย์ทำสิ่งนี้ตลอดเวลากับอุปกรณ์ เกม งาน และแอปใหม่ ๆ เราลองไม่กี่ครั้งแล้วสร้างแบบจำลองคร่าว ๆ ว่า “น่าจะทำงานแบบนี้”
โมเดลแนวหน้าในอดีตมีจุดอ่อนใหญ่ในการสร้างและรักษาแบบจำลองประเภทนี้จากประสบการณ์เพียงเล็กน้อย
มันอาจแก้ทฤษฎีบทยาก ๆ ได้ แต่กลับหลงในหน้าจอที่ดูเหมือนของเล่น
4. GPT-5.6 Sol: สมองแรง แต่เหมือนฉีกสมุดบันทึกทิ้งทุกก้าว
GPT-5.6 Sol Max ได้ 96.5% ใน ARC-AGI-1 และ 92.5% ใน ARC-AGI-2 แต่ได้เพียง 7.78% ใน ARC-AGI-3 Semi-Private[9]
OpenAI ตรวจสอบแล้วพบว่าส่วนหนึ่งของปัญหาอยู่ที่ harness หรือซอฟต์แวร์ที่เชื่อมโมเดลกับเกม ไม่ใช่ตัวโมเดลอย่างเดียว[10]
การให้เหตุผลที่ซ่อนอยู่ถูกทิ้งหลังการกระทำ และเมื่อประวัติยาวเกินไปข้อมูลเก่าก็ถูกตัด
ถ้าเป็นมนุษย์ก็เหมือน:
“เหยียบช่องแดงแล้วประตูเปิด”
→ เดินหนึ่งก้าว
→ ฉีกโน้ตที่เขียนการค้นพบนั้นทิ้ง
→ ก้าวถัดไปถามใหม่ว่า “ของสีแดงนี่คืออะไร?”
เมื่อ OpenAI เปิดการเก็บ reasoning และการบีบอัด context คะแนนของ Sol บน Public set เพิ่มจาก 13.3% เป็น 38.3%[10]
อย่าเอา 7.78 ไปเทียบ 38.3 ตรง ๆ เพราะตัวแรกเป็น Semi-Private ส่วนสองตัวหลังเป็น Public
บทเรียนชัดเจนว่า ความสามารถไม่ได้ขึ้นอยู่กับสมองของโมเดลอย่างเดียว แต่ขึ้นอยู่กับวิธีเก็บและบีบอัดประสบการณ์ด้วย
5. GPT-6 Astra: 62.71% กับ 99.95% ไม่ใช่ผลจากเงื่อนไขเดียวกัน
ARC Prize ยืนยันผล GPT-6 Astra เมื่อ 2 กันยายน 2026[4]
ผล Semi-Private ที่ดีที่สุดคือ:
| เงื่อนไข | คะแนนสูงสุดของ Astra |
|---|---|
| Standard harness | 62.71% (Max) |
| Provider Adapter | 99.95% (High) |
Standard harness ใกล้กับอินเทอร์เฟซขั้นต่ำร่วมกัน โดยโมเดลเลือกเองว่าจะเก็บโน้ตที่มองเห็นอะไรไว้
Provider Adapter เก็บสถานะ reasoning แบบไม่เปิดเผยเฉพาะผู้ให้บริการระหว่างคำขอ และใช้การบีบอัดเมื่อบริบทยาว[2][4]
ดังนั้นคำว่า “Astra ล้วน ๆ ทำ 99.95% โดยไม่มีตัวช่วย” ไม่แม่น คำอธิบายที่ถูกคือ Astra บวกการจัดการบริบทที่ OpenAI ออกแบบ ทำได้ 99.95%
แม้ดูแค่ Standard 62.71% ก็ยังเป็นการกระโดดครั้งใหญ่จาก Sol Max ที่ 7.78% บน Semi-Private[4][9]
การเทียบมนุษย์ก็ต้องอ่านให้ถูก Astra Max ภายใต้ Provider Adapter ได้ 98.55% และในด่านที่มันจบได้ 96.0% ของด่านใช้การกระทำน้อยกว่าค่าฐานมนุษย์ โดยเฉลี่ยใช้การกระทำน้อยกว่า 51.7% ต่อด่าน[2]
นี่ไม่ได้หมายความว่า “ฉลาดกว่ามนุษย์ 96%” แต่เป็นการเทียบประสิทธิภาพรายด่านกับค่ามัธยฐานของมนุษย์
6. Astra ทำอะไรจริง ๆ? เขียนตำราฟิสิกส์เล่มเล็กของตัวเองให้แต่ละเกม
ARC Prize สนใจพฤติกรรมของ Astra ไม่ใช่แค่คะแนน
แทนที่จะเก็บทุกสิ่งที่เห็นแบบดิบ ๆ Astra บีบอัดข้อมูลเกี่ยวกับ:
- ตำแหน่งวัตถุ
- ผลของการกระทำ
- สถานะปัจจุบัน
- แผนที่ยังไม่เสร็จ
- การกระทำที่ควรทำต่อ
มันถึงขั้นสร้างสัญลักษณ์ย่อของตัวเองเพื่อบรรยายกลไกเกม[2]
ในเชิงแนวคิด เช่น:
แดง + ขวา → สถานะ B
สถานะ B + เป้าหมายน้ำเงิน → ประตูเปิด
นี่คือ แบบจำลองโลก ขนาดเล็ก เป็นคู่มือภายในที่ใช้ทำนายว่าสภาพแวดล้อมจะเปลี่ยนอย่างไรต่อไป
จุดสำคัญคือไม่ได้ท่องคำตอบมาก่อน แต่ดึงโครงสร้างที่มีประโยชน์ออกมาจากการโต้ตอบ
7. งั้นนี่คือ AGI แล้วหรือยัง? ARC Prize บอกชัดว่ายัง
ARC Prize บรรยาย Astra ว่าเป็นการเปลี่ยนระดับความสามารถของโมเดลแนวหน้าอย่างเห็นได้ชัด แต่ไม่ได้อ้างว่าเป็นหลักฐานว่า AGI สำเร็จแล้ว[2]
ARC-AGI-3 ยังเป็นโลกที่มีขอบเขตจำกัด:
- กริด 2D
- แบบผลัดกันเล่น
- กลไกที่กำหนดแน่นอน
- เป้าหมายที่ปิดจบได้
โลกจริงมีกฎเปลี่ยน ตัวแปรซ่อน คู่แข่งที่ตอบโต้ และเป้าหมายที่คลุมเครือ
Grand Prize ยังต้องการ 100% ด้วย 99.95% ใกล้มาก แต่ไม่ใช่ 100% อย่างเป็นทางการ[11]
ข้อสรุปที่แม่นคือ AGI ยังไม่เสร็จ แต่จุดอ่อนเก่าเรื่องการเรียนรู้อย่างมีประสิทธิภาพในสภาพแวดล้อมใหม่ลดลงอย่างมาก
8. ใช้กับอะไรได้? งานที่มนุษย์เขียนกฎทั้งหมดล่วงหน้าไม่ได้
งานที่น่าสนใจจริงมีมากกว่าปริศนา
- จำลองโรงงานและโลจิสติกส์: เปลี่ยนคน สต็อก ลำดับงาน และเส้นทาง เพื่อหาสภาพที่ลดความล่าช้าและต้นทุน
- สำรวจซอฟต์แวร์: เรียนรู้ UI ที่ไม่เคยเห็นและหาสภาวะที่ทำให้บั๊กเกิดซ้ำได้
- เกมและหุ่นยนต์: เรียนรู้เหตุและผลของการกระทำจากการลองไม่กี่ครั้ง
- โฆษณา ราคา และงานปฏิบัติการ: สำรวจชุดการตัดสินใจและดูผล
- ช่วยงานวิจัย: สร้างสมมติฐาน ทดสอบ ตัดสิ่งที่ล้มเหลว และปรับแบบจำลองระบบ
คำสั่งจึงเปลี่ยนจาก “ทำตามกฎนี้” เป็น “ค้นหาว่ากฎไหนสำคัญจริง”
9. แล้วหุ้นกับ scalping ล่ะ? เครื่องค้นหา candidate edge สมเหตุผลกว่าเครื่องพยากรณ์
ในที่นี้ edge หมายถึงความได้เปรียบทางสถิติเล็ก ๆ ที่ทำซ้ำได้และยังเหลือหลังหักต้นทุนการเทรด
แนวทางแบบ Astra จะไม่เริ่มจากกฎสำเร็จรูปอย่าง “RSI ต่ำกว่า 30 ให้ซื้อ” แต่จะดู order book การซื้อขาย ราคา spread ปริมาณ และเวลา
แล้วถามว่า:
ชุดเงื่อนไขปัจจุบันแบบใดตามมาด้วยความเอนเอียงของผลตอบแทนในทิศหนึ่งเล็กน้อยภายในไม่กี่วินาทีหรือไม่กี่นาที?
AI อาจเสนอสมมติฐาน เช่น bid depth เพิ่มกะทันหัน market buy พุ่ง spread แคบ และอยู่ในช่วงเวลาหนึ่ง
แต่นั่นยังเป็นสมมติฐาน ไม่ใช่สูตรทำกำไร
ตลาดต่างจาก ARC อย่างพื้นฐาน เพราะกฎตลาดไม่คงที่ ผู้เล่น ข่าว สภาพคล่อง กฎระเบียบ และภาวะตลาดเปลี่ยนเสมอ
ถ้าบอกเพียง “หารูปแบบทำเงิน” AI อาจเข้าใจความบังเอิญในอดีตว่าเป็นกฎธรรมชาติ
10. ถ้าจะทำจริง ต้องให้ AI โจมตีสิ่งที่ตัวเองค้นพบด้วย
Backtest คือการใช้ข้อมูลอดีตประเมินกฎการเทรด
อันตรายคือเมื่อทดลองตัวแปรนับพันหรือนับล้าน จะมีบางชุดดูยอดเยี่ยมเพราะโชคเพียงอย่างเดียว นี่คือปัญหา backtest overfitting[12][13]
edge explorer ที่น่าเชื่อควร:
- สร้างสมมติฐาน
- หาผู้สมัครในช่วงพัฒนา
- คัดทิ้งด้วยข้อมูลที่ไม่เคยใช้ค้นพบ
- ทดสอบทำลายในตลาดขาขึ้น ขาลง ผันผวนสูง และผันผวนต่ำ
- หักค่าธรรมเนียม spread และ slippage
- บันทึกจำนวนไอเดียทั้งหมดที่ลอง
- ทำ walk-forward ตามลำดับเวลา
- paper trading ก่อนเงินจริง
- กำหนดเงื่อนไขหยุดเมื่อ edge หาย
บทบาทในอุดมคติไม่ใช่ผู้พยากรณ์
แต่คือ นักวิจัยที่เสนอ 1,000 สมมติฐาน รวมกับผู้รีวิวที่ฆ่าทิ้ง 998 สมมติฐานด้วยตัวเอง
11. บทสรุป: จาก “AI ที่ตอบคำถาม” ไปสู่ “AI ที่ค้นหาว่าอะไรคือกฎ”
สิ่งสำคัญของ ARC-AGI-3 ไม่ใช่แค่เลข 99.95%
แต่คือวงจร:
สังเกต → ลงมือ → ล้มเหลว → อนุมานกฎ → แก้สมมติฐาน → เดินหน้าไปสู่เป้าหมาย
Sol แสดงให้เห็นว่าโมเดลเก่ง ๆ อ่อนลงได้มากเพียงใดหากเก็บประสบการณ์ไม่ดี Astra แสดงความก้าวหน้าครั้งใหญ่ในการบีบอัดประสบการณ์เป็นกฎที่มีประโยชน์และใช้กฎนั้นด้วยการโต้ตอบไม่กี่ครั้ง
ดังนั้นงานที่เราโยนให้เอเจนต์ขั้นสูงก็เปลี่ยนได้
ไม่ใช่แค่:
“นี่คือกฎ ทำตาม”
แต่เป็น:
“นี่คือสภาพแวดล้อมและข้อมูล ค้นหากฎที่ดูสำคัญ ลองทำลายในเงื่อนไขอื่น แล้วเอากลับมาเฉพาะสิ่งที่ยังรอด”
ไม่มีอะไรรับประกันว่าสิ่งนี้จะทำเงินในตลาด ตลาดโหดกว่า ARC มาก
แต่ถ้าเลิกมอง AI เป็นหมอดู และมองเป็น เครื่องจักรสำหรับค้นพบและโจมตีสมมติฐาน ผลของ Astra ก็กลายเป็นข่าวที่ใช้งานได้จริงมากขึ้น
แหล่งข้อมูล
- Google DeepMind — IMO 2025 gold-medal-level result (2025-07-21) deepmind.google
- ARC Prize — “OpenAI's GPT-6 Astra on ARC-AGI-3” (2026-09-03) arcprize.org
- ARC Prize — “Announcing ARC-AGI-3” (2026-03-25) arcprize.org
- ARC Prize Verified Results — GPT-6 Astra (verified 2026-09-02) arcprize.org
- ARC Prize — ARC-AGI-1 & ARC-AGI-2 Guide arcprize.org
- ARC Prize — “ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems” (2025-05-20) arcprize.org
- ARC-AGI-3 Docs — Game Schema docs.arcprize.org
- ARC Prize — “Measuring Human Performance on ARC-AGI-3” (2026-04-14) arcprize.org
- ARC Prize Verified Results — GPT-5.6 arcprize.org
- OpenAI — “How two settings tripled our ARC-AGI-3 scores” (2026-07-29) openai.com
- ARC Prize 2026 — ARC-AGI-3 Competition; Grand Prize requires 100% arcprize.org
- Bailey, Borwein, López de Prado & Zhu — “The Probability of Backtest Overfitting papers.ssrn.com
- Bailey & López de Prado — “How ‘backtest overfitting’ in finance leads to false discoveries” (2021) academic.oup.com
