คนที่เคยวิจัยกลยุทธ์ซื้อขายระยะสั้นมากด้วยตัวเองจะรู้ว่า ส่วนที่หนักไม่ได้มีแค่ “การคำนวณ”
ถ้าสัญญาณ A ออกมาจะทำอย่างไร ถ้า B ออกมาพร้อมกันล่ะ ช่วงความผันผวนสูงควรเก็บไว้ไหม ถ้าสเปรดกว้างควรตัดทิ้งหรือไม่ ช่วงเวลานี้ตามแนวโน้ม แต่อีกช่วงไม่เข้าเลย?
ถ้าต้องลองทุกแขนงทีละข้อ เย็นธรรมดาก็กลายเป็นห้องทดลองส่วนตัวได้ง่าย ๆ ใช้วันละหลายชั่วโมงต่อเนื่องเป็นปีแล้วสุดท้ายเหลือกลยุทธ์ที่รอดจริงเพียงหนึ่งตัวก็ไม่ใช่เรื่องแปลก
จากนั้น AI ที่เก่งด้านการสำรวจก็เข้ามา
ในเวิร์กโฟลว์แบบหนึ่ง มันสามารถทดลองตัวแปรหลายพันแบบในระดับไม่กี่ชั่วโมง วิเคราะห์ต่อว่าทำไมผลตอบแทนจึงไม่เสถียร แล้วเอาสาเหตุของความล้มเหลวไปเลือกการทดลองรอบถัดไป
ปฏิกิริยาของคนจึงง่ายมาก:
“ถ้าให้คนทำทีละอัน จะใช้กี่วันกัน?”
แต่ถ้าสรุปว่า “AI ทดสอบได้ 4,000 กลยุทธ์ เท่ากับชนะแล้ว” งานการเงินจะยิ่งอันตราย เพราะยิ่งลองเยอะก็ยิ่งมีโอกาสเจอรูปแบบที่แค่บังเอิญพอดีกับอดีตมากขึ้น.[1][2]
สูตรที่น่าใช้กว่าคือ:
สมมติฐานจากคน × การสำรวจของ AI × การพยายามหักล้างโดย AI × การแก้ปัญหาทางสถิติจากการค้นหาจำนวนมาก
อย่ามีแค่ AI ที่หาผู้ชนะ ควรมี AI อีกตัวที่มีหน้าที่พยายามทำลายผู้ชนะนั้นด้วย
1. ทำไมงานทดลองด้วยมือหลายปีจึงดูเหมือนถูกบีบให้สั้นลงทันที
การวิจัยกลยุทธ์ด้วยมือคือวงจรของงานเล็ก ๆ:
- ตั้งสมมติฐาน
- เขียนเงื่อนไข
- ทดสอบย้อนหลัง
- อ่านผล
- ถามว่าทำไมไม่เสถียร
- แยกเงื่อนไข
- ลองใหม่
แต่ละขั้นไม่จำเป็นต้องยากมาก ปัญหาคือต้องทำซ้ำหลายร้อยหรือหลายพันครั้ง
คนยังเสียต้นทุนจากการสลับบริบท: เมื่อวานลองอะไรไปแล้ว ฟิลเตอร์นี้เคยลองหรือยัง ผลนี้เกิดก่อนหรือหลังเปลี่ยนสมมติฐานเรื่องสเปรด?
ตัวสำรวจแบบ AI สามารถทำให้วงจรเดินต่อได้
มันไม่ต้องหยุดที่ “กำไร” แต่ตรวจต่อได้ว่ากำไรพึ่งเพียงไม่กี่วันหรือไม่ หายเมื่อใส่ต้นทุนหรือไม่ อยู่แค่ช่วงเวลาเดียวหรือไม่ หรือพังเมื่อถอดส่วนประกอบหนึ่งชิ้น
นี่ไม่ใช่แค่การทดสอบย้อนหลังที่เร็วขึ้น
แต่คือการทำรอบวิจัยให้เร็วขึ้น
2. จุดแข็งของ Astra คล้าย “เดินในสภาพแวดล้อมที่ไม่รู้จักได้” มากกว่า “รู้คำตอบอยู่แล้ว”
ARC-AGI-3 ช่วยให้เห็นความสามารถนี้ชัด
เป็นเกณฑ์ทดสอบแบบโต้ตอบที่มีสภาพแวดล้อมตาราง 2 มิติแบบใหม่ ไม่มีคำสั่งภาษาธรรมชาติและไม่บอกเป้าหมายตรง ๆ ตัวแทนต้องสำรวจ อนุมานกฎ สร้างแบบจำลองของสภาพแวดล้อม หาเป้าหมาย วางแผน ลงมือ และแก้แผนเมื่อผิดพลาด.[3][4]
เดือนกรกฎาคม 2026 GPT-5.6 Sol ได้ 7.78% บนชุดกึ่งส่วนตัวของ ARC Prize และ OpenAI ยังแสดงบนชุดสาธารณะว่า เมื่อเก็บสถานะการให้เหตุผลและบีบบริบทไว้ คะแนนของ Sol ในการตั้งค่าอีกแบบเพิ่มจาก 13.3% เป็น 38.3%.[5]
เดือนกันยายน Astra ได้ 62.7% บนชุดกึ่งส่วนตัวเดียวกันด้วย Standard harness ของ ARC Prize และ 99.9% ด้วย Provider Adapter ที่รักษาสถานะการให้เหตุผลระหว่างการกระทำได้มากกว่า เพราะรูปแบบ harness มีผลต่อคะแนนมาก จึงไม่ควรอ่าน 99.9 เทียบ 7.78 เป็นอัตราส่วนตรงในเงื่อนไขเดียวกัน สิ่งสำคัญคือการกระโดดขึ้นของความสามารถด้านการสำรวจ การสร้างแบบจำลองสถานะ และการปรับตัวระยะยาว.[6][3]
ARC Prize ยังรายงานว่า ใน 96% ของด่านที่ Astra ผ่าน มันใช้จำนวนการกระทำน้อยกว่าค่ามัธยฐานของคนที่ผ่านด่านนั้น.[3]
นี่ต่างจากความเก่งแบบแก้สมการยาก ๆ ครั้งเดียว
มันใกล้กับ:
“แตะอันนี้แล้วเกิดอะไรขึ้น? ดี งั้นลองอันนั้น อ๋อ กฎเป็นแบบนี้เอง”
ที่น่าสนใจคือเกม 2 มิติที่ดูเหมือนเด็กก็ลองเล่นได้ กลับเป็นเรื่องยากสำหรับ AI มานาน จึงทำให้การเปลี่ยนแปลงด้านการสำรวจเห็นชัด
ARC Prize เองก็ไม่ได้บอกว่าการทำ ARC-AGI-3 เต็มหมายถึงพิสูจน์ AGI สภาพแวดล้อมปิดและกำหนดแน่นอนไม่เหมือนโลกจริง.[3]
3. ทำไมการสำรวจเกม 2 มิติจึงคล้ายงานวิจัยสเกลปิง
ตลาดไม่ใช่เกมที่มีกฎแน่นอน มีผู้เล่นหลายฝ่าย ข้อมูลซ่อนอยู่ การเปลี่ยนสภาวะตลาด ต้นทุน และข้อจำกัดการส่งคำสั่ง
แต่ลูปวิจัยคล้ายกันได้
สมมติว่าเพิ่มเงื่อนไขความไม่สมดุลของสมุดคำสั่งแล้วผลทดสอบย้อนหลังดีขึ้น
คำถามต่อไปต้องมา:
- ตัวความไม่สมดุลทำนายได้จริงหรือไม่
- ใช้ได้เฉพาะตอนผันผวนสูงหรือไม่
- ดูดีเพียงเพราะสเปรดต่ำหรือไม่
- ถ้าราคาเข้าแย่ลงหนึ่ง tick จะหายไหม
- มีผลแค่ช่วงเวลาเดียวหรือไม่
สังเกต เปลี่ยน วัด แล้วแก้สมมติฐาน
โครงสร้างจึงคล้าย ARC-AGI-3 ที่รับรู้ → ลงมือ → รับผลตอบกลับ → อัปเดตแบบจำลอง → เลือกการกระทำถัดไป.[3][4]
ดังนั้นคำสั่งที่ดีกว่า “หาพารามิเตอร์ที่กำไรมากที่สุด” คือ:
“แยกว่ากำไรเกิดจากอะไร หาเงื่อนไขที่ทำให้มันตาย แล้วเอาสาเหตุที่ตายไปสร้างการทดลองรอบถัดไป”
4. ประสบการณ์มนุษย์ไม่หายไป — “แถวนี้น่าจะมีอะไร” กลายเป็นแผนที่เริ่มต้น
ให้ AI เริ่มจากศูนย์ก็ได้
แต่ยิ่งพื้นที่ค้นหาใหญ่ ประสบการณ์มนุษย์ยิ่งช่วยตัดสินใจว่าควรใช้ทรัพยากรสำรวจตรงไหนก่อน
คนที่อ่านและทดลองมาหลายปีมักมีความรู้แบบย่อ เช่น:
- อ่อนเมื่อใช้เดี่ยว แต่เป็นฟิลเตอร์อาจดี
- น่าสนใจเฉพาะตลาดมีแนวโน้ม
- สวยใน backtest แต่แพ้ต้นทุน
- เหมาะกับการห้ามเข้า มากกว่าทำนายทิศทาง
- ดูแรง แต่กำไรอาจกองอยู่แค่ช่วงเดียว
นี่ไม่ใช่คำตอบตายตัว
แต่เป็นเบาะแสเริ่มต้นของพื้นที่ค้นหา
ในวิทยาศาสตร์ก็มีรูปแบบคล้ายกัน Co-Scientist ปี 2026 เริ่มจากเป้าหมายที่นักวิจัยตั้งและหลักฐานเดิม จากนั้นสร้าง วิจารณ์ จัดอันดับ และพัฒนาสมมติฐานซ้ำ ๆ พร้อมเพิ่มคอมพิวต์ระหว่างการทดสอบ.[7]
ในงานเทรด คนอาจบอกว่า “เริ่มขุดตรงนี้” แล้ว AI สำรวจแขนงหลายพันเส้นรอบ ๆ
ประสบการณ์เหมาะเป็นตัวจัดสรรงบสำรวจ ไม่ใช่ข้อสรุปที่ห้ามโต้แย้ง
5. ทำไมการผสมหลายเงื่อนไขจึงกลายเป็นนรกเมื่อทำด้วยมือ
สมมติมีส่วนประกอบ 20 ชิ้น
ถ้าแต่ละชิ้นมีแค่ “ใช้” หรือ “ไม่ใช้” ก็มีแล้ว:
2^20 = 1,048,576 รูปแบบ
ถ้าเป็น “ไม่ใช้ ใช้ตามปกติ ใช้กลับทิศ” สามตัวเลือก จะเป็น:
3^20 = 3,486,784,401 รูปแบบ
งานจริงไม่ได้ไล่ทุกแบบแบบสุ่มสี่สุ่มห้า ความรู้ช่วยตัดของไร้เหตุผลออก
แต่ของจริงยังมี threshold เวลา ความผันผวน สเปรด ระยะถือ ข่าว ความต่าง long/short และสมมติฐานการ fill
ดังนั้นคำถามเก่า ๆ อย่าง
“ถ้าเพิ่มอันนี้ด้วยล่ะ? ถ้าตัดกรณีนั้น? ใช้เฉพาะสภาวะนี้?”
คือการให้คนเดินในต้นไม้ค้นหาแบบมีเงื่อนไขขนาดมหาศาลด้วยตัวเอง
ใช้เวลาหลายปีก็ไม่แปลก
สเปรดชีตไม่ได้ผิด จักรวาลมันกว้างเกินไป
6. สิ่งที่ควรให้ AI ทำไม่ใช่ไล่ทุกอย่างแบบแรงถึก แต่คือเลือกการทดลองถัดไป
ตัวสำรวจที่ดีเปลี่ยนการทดสอบถัดไปตามผลล่าสุด
ถ้ากลยุทธ์คือ A+B+C+D ให้ถอดทีละชิ้น
- ถอด D แล้วแทบไม่เปลี่ยน → D อาจเป็นของประดับ
- B อ่อนเมื่ออยู่เดี่ยว แต่ A+B ลด drawdown มาก → B อาจเป็นฟิลเตอร์ ไม่ใช่แหล่งการทำนาย
- C อ่อนทั้งช่วง แต่แรงตอนผันผวนสูง → C อาจขึ้นกับสภาวะตลาด
การถอดส่วนประกอบเพื่อดูหน้าที่มักเรียกว่าการทดสอบแบบ ablation
ชื่อไม่สำคัญเท่าจุดประสงค์:
แยกกลยุทธ์ซับซ้อนออก แล้วเก็บเฉพาะส่วนที่ทำงานจริง
สำรวจ → ล้มเหลว → แยกสาเหตุ → เลือกการทดลองถัดไป
เมื่อวงจรนี้อัตโนมัติ AI จะใกล้ผู้ช่วยวิจัยมากกว่าเครื่องหาค่าพารามิเตอร์
7. อันตรายใหญ่สุดยังคือ overfitting — ลอง 4,000 อย่าง ก็ต้องมี “อัจฉริยะที่โชคดี” โผล่มา
นี่คือประเด็นสำคัญที่สุดในงานการเงิน
ถ้าทดสอบ 4,000 กลยุทธ์แล้วแสดงเพียงตัวที่สวยที่สุด ตัวชนะอาจเป็นแค่ตัวที่บังเอิญพอดีกับประวัติศาสตร์มากที่สุด
White อธิบายปัญหา data snooping ว่า การใช้ข้อมูลชุดเดิมซ้ำเพื่ออนุมานและเลือกโมเดลเปิดทางให้ผลลัพธ์ที่ดูดีเกิดจากความบังเอิญ ไม่ใช่ความเหนือกว่าจริง.[1]
เมื่อรวมหลายสัญญาณ ปัญหายิ่งหนัก
Novy-Marx แสดงว่ากลยุทธ์หลายสัญญาณมีอคติจาก overfitting รุนแรง และแม้สัญญาณสุ่มที่ไม่มีพลังทำนายจริงก็สร้าง backtest ที่ดูมีนัยสำคัญมากได้หลังการเลือกและผสม.[2]
ความสามารถในการสำรวจจึงเป็นดาบสองคม
AI ผิดได้เร็วขึ้นหลายพันครั้ง
แล้วก็เลือกความผิดที่สวยที่สุดมารับรางวัลได้
ยิ่งค้นหาใหญ่ การป้องกัน overfitting ยิ่งต้องอยู่ในเครื่องค้นหาตั้งแต่ต้น ไม่ใช่พิธีท้ายงาน
8. การป้องกันเริ่มจากบันทึกทุกการทดลองและกันข้อมูลสุดท้ายออกจากการเลือก
ถ้าสำรวจผู้สมัครหลายพันตัว ตัวที่แพ้ก็เป็นหลักฐาน
อย่างน้อยควรมี:
- บันทึกทุก trial ว่าเปลี่ยนอะไร ลองกี่แบบ และตัดทิ้งเพราะอะไร
- แยกข้อมูลค้นพบกับข้อมูลประเมินสุดท้าย อย่าแอบดูชุดสุดท้ายซ้ำระหว่างเลือกโมเดล
- ตรวจไปข้างหน้าตามเวลา สร้างจากอดีตกว่าแล้วทดสอบในข้อมูลที่ใหม่กว่าด้วย walk-forward
- ทำให้การส่งคำสั่งแย่ลงโดยตั้งใจ เพิ่มสเปรด ค่าธรรมเนียม slippage ความหน่วง และสมมติฐาน fill แบบเคร่ง
- ขยับพารามิเตอร์ กลยุทธ์ที่อยู่ได้แค่ค่ามหัศจรรย์จุดเดียวควรสงสัย
- แยกสภาวะตลาด ตรวจว่ากำไรพึ่งปีเดียว ช่วงเวลาเดียว ระดับความผันผวนเดียว ทิศเดียว หรือดีลไม่กี่ครั้งหรือไม่
- แก้ผลของการลองจำนวนมากทางสถิติ
DSR ช่วยแก้การตีความ Sharpe จากอคติการเลือกเพราะทดสอบหลายแบบและจากผลตอบแทนที่ไม่เป็นการแจกแจงปกติ.[8]
PBO ถูกเสนอสำหรับ backtest การลงทุนโดยเฉพาะ เพื่อประมาณโอกาสที่กระบวนการเลือกจะ overfit ด้วยการตรวจข้ามแบบสมมาตรเชิงจัดหมู่.[9]
Reality Check ของ White จัดการ data snooping เมื่อมีผู้สมัครจำนวนมาก ส่วน SPA ของ Hansen ถูกออกแบบให้มีพลังมากขึ้นและไวต่อผู้สมัครที่แย่หรือไม่เกี่ยวข้องน้อยลง.[1][10]
ไม่ต้องจำทุกตัวย่อ
จำหลักเดียว:
ถ้าชนะหลังลอง 4,000 ครั้ง ให้ตรวจเหมือนผู้ชนะการแข่งขันที่มี 4,000 ครั้ง
และเมื่อดูข้อมูลที่ควรถูกปิดผนึกแล้วแก้กลยุทธ์ ข้อมูลชุดนั้นก็ไม่ใช่ชุดสุดท้ายที่ไม่เคยใช้แล้ว
9. โครงสร้างที่แข็งอาจมี AI สองตัว: ตัวหนึ่งหา ตัวหนึ่งฆ่า
แบ่งหน้าที่ได้เลย
AI สำรวจ
- สร้างเงื่อนไขใหม่
- ผสมสมมติฐานมนุษย์ใหม่
- หาผลเฉพาะสภาวะตลาด
- เอาสาเหตุความล้มเหลวไปสร้างการทดลองใหม่
AI หักล้าง
- ทำต้นทุนให้แย่
- หน่วงการ fill
- ลบบางวัน
- ขยับ threshold
- เปลี่ยนช่วงเวลาและตลาด
- ใช้ DSR, PBO, Reality Check, SPA
- ตรวจว่ากำไรมาจากข้อมูลน้อยมากหรือไม่
ตัวสำรวจพูดว่า “เจอแล้ว”
ตัวหักล้างตอบว่า “จริงเหรอ?”
รอดแล้วก็ตีอีก
ในการวิจัยการเงิน นิสัยไม่น่าคบแบบนี้คือการควบคุมคุณภาพ
เป้าหมายควรเปลี่ยนจาก “กำไรอดีตสูงสุด” เป็น:
“โครงสร้างที่ยังอธิบายได้และยังอยู่รอด หลังจากทำลายสมมติฐาน พารามิเตอร์ ต้นทุน และตัวอย่างอย่างสมเหตุสมผล”
10. เวลาโมเดลใหม่ออก ให้ดูความสามารถที่เพิ่งข้ามกำแพง ไม่ใช่ดูแต่คะแนนรวม
บทเรียนนี้กว้างกว่าสเกลปิง
เวลา AI รุ่นใหม่ออก การเพิ่มไม่กี่เปอร์เซ็นต์บน benchmark รวมอาจสำคัญน้อยกว่างานแปลกหนึ่งงานที่เปลี่ยนจากแทบทำไม่ได้เป็นใช้งานจริงได้
คำถามที่น่าใช้คือ:
“งานอะไรที่รุ่นก่อนทำแล้วไม่คุ้ม แต่รุ่นนี้จู่ ๆ คุ้ม?”
สำหรับ Astra, ARC-AGI-3 เด่นเรื่องการสำรวจสภาพแวดล้อมใหม่ สร้างแบบจำลองโลกขนาดย่อม เก็บสถานะ และลงมืออย่างมีประสิทธิภาพ.[3]
จากนั้นเชื่อมกับคอขวดจริง:
- งานไหนคนเสียเวลามากกับการเลือกว่าจะลองอะไรต่อ
- งานไหนมีสมมติฐานที่ตรวจได้เป็นพัน ๆ ข้อ
- ความสำเร็จและล้มเหลววัดได้เป็นตัวเลขหรือไม่
- ยิ่งทำซ้ำยิ่งเกิดช่องว่างค่าแรงมากหรือไม่
- สำรวจดีขึ้นแล้วแปลงเป็นกำไร ลดต้นทุน หรือเร่ง R&D ได้หรือไม่
ยิ่งตอบ “ใช่” มาก โอกาสยิ่งน่าสนใจ
วงการวิทยาศาสตร์ก็ไปทางนี้แล้ว Co-Scientist ขยายวงจร สร้าง → วิจารณ์ → เปรียบเทียบ → พัฒนาสมมติฐาน.[7]
ดังนั้นการเปิดตัวโมเดลใหม่อาจมองเป็นการล่าขุมทรัพย์:
“ส่วนไหนของงานวิจัยมนุษย์ที่เคยน่าเบื่อจนแทบตาย เพิ่งกลายเป็นงานที่ขยายด้วยเครื่องได้?”
สรุปสั้นที่สุด:
มนุษย์วาดแผนที่แรก AI ขุดเลยขอบแผนที่ สถิติถามว่าสิ่งที่เป็นประกายนั้นเป็นทองจริงไหม
ยิ่ง AI แข็ง ยิ่งต้องมีคนคอยสงสัย
คนที่สงสัยนั้นจะเป็น AI อีกตัวก็ได้
แหล่งข้อมูล
- Halbert White — A Reality Check for Data Snooping, Econometrica 68(5), 2000 onlinelibrary.wiley.com
- Robert Novy-Marx — Backtesting Strategies Based on Multiple Signals, NBER Working Paper 21329, 2015 nber.org
- ARC Prize — OpenAI's GPT-6 Astra on ARC-AGI-3 (2026-09-03) arcprize.org
- ARC Prize — Announcing ARC-AGI-3 / ARC-AGI-3 documentation https://docs.arcprize.org/ arcprize.org
- OpenAI — How two settings tripled our ARC-AGI-3 scores (GPT-5.6 Sol) openai.com
- OpenAI — GPT-6 Astra: A new generation of intelligence openai.com
- Juraj Gottweis et al. — Accelerating scientific discovery with Co-Scientist, Nature, 2026 nature.com
- David H. Bailey & Marcos López de Prado — The Deflated Sharpe Ratio: Correcting for Selection Bias, Backtest Overfitting, and Non-Normality, 2014 doi.org
- David H. Bailey, Jonathan Borwein, Marcos López de Prado & Qiji Jim Zhu — The Probability of Backtest Overfitting, 2015 papers.ssrn.com
- Peter Reinhard Hansen — A Test for Superior Predictive Ability, Journal of Business & Economic Statistics 23(4), 2005 tandfonline.com
