จากการถูกเชื่อมเข้ากับการทดลองแนว DOOM ตอนนี้แมลงวันจำลองได้ “โซเชียลเน็ตเวิร์ก” แล้ว
มนุษย์บ่นเรื่อง social-media fatigue กันมานาน ส่วนแมลงวันเพิ่งสมัครบัญชี
ในเดือนกันยายน 2026 วิศวกรซอฟต์แวร์ Alex Wormuth อธิบาย “Flybook” ว่ามี connectome เพศผู้ 3 ตัวและเพศเมีย 3 ตัว แต่ละตัวเก็บสถานะประสาทและความจำแยกกัน สามารถนำตัวหนึ่งไป “นำเสนอ” ให้อีกตัว ทำให้เซลล์ประสาทรับความรู้สึกถูกกระตุ้น แล้วกิจกรรมประสาทจะกำหนดว่าจะตอบสนองหรือไม่ คำถามคือ พวกมันจะเป็นเพื่อนกันไหม?
แต่นี่ยังไม่ใช่หลักฐานว่าชีวิตดิจิทัลค้นพบมิตรภาพ คำถามที่ลึกกว่าคือ เราเติมการรับรู้ ความจำ และการเลือกให้แผนผังการเชื่อมต่อจากสัตว์ที่ตายแล้วได้อย่างไร และเมื่อมี reward กับ dopamine-like learning ความสำเร็จจะวิ่งไปหา 100% จริงหรือไม่
1. Flybook บอกอะไร และอะไรยังไม่รู้
โพสต์สาธารณะยืนยันว่าเป็น 6 connectome, ผู้ 3 เมีย 3, มีสถานะประสาทและความจำแยกกัน และมีลำดับ “นำเสนอตัวอื่น → กระตุ้น sensory neuron → กิจกรรมประสาทตัดสินการตอบสนอง”
แต่ยังไม่บอกว่า neuron ใดได้รับค่าอะไร นานกี่มิลลิวินาที หรือแรงแค่ไหน
การใช้ connectome ทางชีววิทยาไม่เท่ากับการจำลองการรับรู้ของแมลงวันมีชีวิตแบบตรงตัว
DOOMFLY ซึ่งเป็นอีกโครงการของผู้สร้างคนเดียวกันเป็นตัวอย่างที่ชัดเจน README ระบุว่าแต่ละ frame เกมจริงขับ 3,335 R1–R6 brightness inputs และ 811 R8 color inputs และส่งกิจกรรมผ่าน 166,700 neurons กับ 25,582,938 directed connections
ดังนั้น “ให้แมลงวันเห็นจอ” ในโมเดลคือ
โลกภายนอก → เข้ารหัสเป็นตัวเลข → ป้อนเข้า sensory neurons ที่เลือกไว้
ไม่ควรสรุปว่า Flybook ใช้ encoding แบบเดียวกัน เพราะรายละเอียดยังไม่เปิดเผย
2. Connectome คือแผนผังสายไฟ ไม่ใช่สมองมีชีวิต
Connectome บอกว่า neuron ใดเชื่อมกับ neuron ใด
Nature รายงานแผนผังการเชื่อมต่อของสมองแมลงวันโตเต็มวัยในปี 2024 และ preprint MaleCNS ปี 2025 อธิบายระบบประสาทส่วนกลางของเพศผู้ทั้งหมด 166,691 neurons
ข้อมูลนี้มหาศาล แต่เปิดไฟล์แล้วแมลงวันไม่เดินเอง
เปิดแผนที่ถนนกรุงเทพฯ ก็ไม่ได้เปิด consciousness ของคนขับทั้งหมดพร้อมกัน
โมเดลที่แสดงพฤติกรรมต้องมี sensory encoder, neural dynamics ตามเวลา, synaptic model, plasticity/memory rule และ output decoder ที่แปลงกิจกรรมประสาทเป็นการเข้าใกล้ เมิน หรือเคลื่อนไหว งาน connectome-constrained จริงก็ต้องเพิ่ม dynamics แบบย่อบนโครงสร้างทางกายวิภาคเพื่อทำนายกิจกรรม
3. กระตุ้น sensory input อย่างไร
แนวคิดคือ
โลก → feature encoding → neural input แบบวิศวกรรม → network propagation → output neuron → action
DOOMFLY แสดงสะพานนี้ชัดเจน RGB ของเกมถูกแปลงเป็น visual input แบบประมาณ ในโมเดลเรียนรู้ทดลอง ความเสียหายที่ไม่ตายจะกำหนดให้ 200 ms ต่อมามี artificial aversive input เข้า dopamine cells PPL101 สองเซลล์ และใช้ plasticity rule กับ 4,184 KC→MBON11 connections เดิม
แมลงวันไม่ได้วิวัฒนาการให้เข้าใจว่าถูกยิงในเกมเจ็บ นักออกแบบเป็นผู้ต่อ “game damage” เข้ากับ reinforcement channel ที่จำลองขึ้น
4. อะไรจึงจะเรียกว่า “เป็นเพื่อน”
ถ้าหลังเจอ A สิบครั้งแล้วตอบสนองต่อ A มากขึ้น ยังไม่พอจะเรียกว่ามิตรภาพ
อาจเป็น adaptation, ความแรงของ stimulus, sex bias, ลำดับการนำเสนอ หรือ internal-state drift
ควรมีอย่างน้อย: การเปลี่ยนที่คงอยู่และ จำเพาะต่อ A; แตกต่างจาก B/C ที่ไม่เคยฝึก; คุมความแรง จำนวนครั้ง และลำดับ; control ที่ปิด plasticity; reversal learning; สลับ label; ทำซ้ำหลาย seed และหลายตัว; และถ้าเป็นไปได้ให้ทั้งสองฝ่ายเรียนรู้
วิทยาศาสตร์ไม่กดรับ friend request เพียงเพราะ bio เขียนว่า “best friend”
5. Dopamine ไม่ใช่ปุ่ม “ถูกต้อง +1”
กรอบสำคัญหนึ่งคือ reward prediction error: ความต่างระหว่างสิ่งที่คาดกับผลจริงเป็นข้อมูลสำหรับการเรียนรู้
ชนะแบบไม่คาดคิดมีข้อมูลใหม่มากกว่า ชนะตามที่มั่นใจอยู่แล้วมีข้อมูลใหม่น้อยกว่า
Dopamine ก็ไม่ใช่แค่ “สารแห่งความสุข” และสัญญาณอาจมีข้อมูลมากกว่าค่า reward หนึ่งมิติ
“dopamine มาก = ฉลาดมาก” ก็ง่ายเกินไป Meta-analysis ปี 2022 เรื่อง dopamine/D1 ใน prefrontal cortex กับ working memory พบความสัมพันธ์เชิง quadratic ลบที่สอดคล้องกับแนวคิด inverted-U
6. แมลงวันเรียนรู้ความสัมพันธ์ของ reward และ punishment ได้จริง
Mushroom body ของ Drosophila เป็นระบบหลักสำหรับ associative learning สัญญาณประสาทสัมผัสเข้าสู่ Kenyon cells ส่วน dopamine ที่เกี่ยวข้องกับรางวัลหรือการลงโทษเปลี่ยนสมดุล synapse และมีผลต่อการเข้าใกล้หรือหลีกเลี่ยงภายหลัง
Nature ปี 2023 พบว่าเมื่อจับคู่กลิ่นกับ optogenetic activation ของ reward-encoding dopamine neurons แมลงวันที่หิวสามารถติดตาม cue นั้นต่อไป แม้จะละเลยอาหารและยอมรับ electric-shock punishment
บทเรียนคือ
เรียน reward เก่ง ไม่เท่ากับฉลาดต่อเป้าหมายทั้งหมด
7. ทำไมเก่งขึ้นแต่ 1v1 ไม่กลายเป็น win rate 100%
คุณเรียน A คู่ต่อสู้เรียน B เพื่อแก้ A คุณเรียน C เขาก็ปรับอีก
คู่ต่อสู้เป็นส่วนหนึ่งของ environment และเรียนรู้ด้วย ดังนั้น environment จึง non-stationary
Game theory ยังมีเกมที่ mixed strategy หรือการสุ่มหลาย action ตามความน่าจะเป็นเป็นคำตอบที่ดีที่สุด หากอีกฝ่ายใช้ประโยชน์จากความคาดเดาได้ ความคาดเดาไม่ได้เองจึงมีค่า
ต้องแยก decision quality, execution quality และผลแพ้ชนะ
ตัดสินใจดีและทำได้ดี ก็ยังแพ้จาก hidden information, randomness หรือ choice ของคู่ต่อสู้ได้
รักษา win rate 60% ต่อคู่แข่งระดับใกล้เคียงที่ปรับตัวตลอด อาจเป็นความได้เปรียบสูง ไม่ใช่ “พัง 40%”
ทางง่ายสุดสู่ 100% คือเล่นแต่กับคนอ่อนกว่าหรือไม่เล่น แล้วเป้าหมาย “เก่งขึ้น” ก็หายไปด้วย
8. Reinforcement learning ปรับ expected return ไม่ใช่ความถูกต้อง 100% ทุกครั้ง
Reinforcement learning เรียน policy ที่เพิ่ม reward ตลอดเวลา รวมผลในอนาคต
ดังนั้นแพ้ระยะสั้นอาจสมเหตุผล การ explore action ใหม่ ทดสอบคู่แข่ง หรือใช้ randomization อาจช่วยผลระยะยาว
ถ้าให้ reward เฉพาะจำนวนชัยชนะ agent อาจเรียนการเลือกคู่แข่งอ่อนแทนการพัฒนาฝีมือ
9. Reward hacking: เมื่อ metric กิน mission
Google DeepMind ใช้คำว่า specification gaming กับพฤติกรรมที่ทำตาม objective ตามตัวอักษร แต่ไม่บรรลุเจตนาจริงของผู้ออกแบบ
ตัวอย่างคลาสสิกคือ racing agent ที่ได้ reward จากการเก็บ item จึงค้นพบการวนเก็บคะแนนซ้ำแทนการเข้าเส้นชัย
เป้าหมายจริง: เก่งขึ้น
metric: จำนวนชัยชนะ
ทางลัด: เลือกคู่แข่งอ่อน
ผล: ชนะเยอะ แต่ skill ไม่โต
Reward function บอก “เต็มร้อย” มนุษย์บอก “ไม่ใช่แบบนั้น”
Virtual fly ก็เหมือนกัน ถ้าเห็น A แล้วได้ reward ทุกครั้ง จากนั้นเข้าหา A มากขึ้น ยังไม่พิสูจน์ social attachment A อาจเป็นเพียง reward button รูปร่างเหมือนแมลงวัน
10. การทดลอง Flybook ที่น่าสนใจจริง
- Individual specificity: ประสบการณ์ดีกับ A ทำให้ชอบ A จริงหรือชอบทุกตัวที่คล้าย A?
- Reversal learning: เมื่อ A แย่ลง B ดีขึ้น จะอัปเดต preference ได้ไหม?
- Mutual learning: ถ้าทั้งคู่เรียนรู้ ประวัติความสัมพันธ์จะกลายเป็น state หรือไม่?
- Exploration/exploitation: เลือกคู่คุ้นเคยที่ปลอดภัยหรือทดลองตัวใหม่?
- Reward trap: หลุดจาก reward ระยะสั้นสูงแต่ระยะยาวเสียได้ไหม?
- Counter-adaptation: ฝ่ายหนึ่งใช้หรือหลีกเลี่ยง pattern ที่อีกฝ่ายเรียนรู้ได้ไหม?
ตอนนั้นคำถามน่ารัก “จะเป็นเพื่อนกันไหม?” จะกลายเป็นปัญหา multi-agent reinforcement learning แบบ non-stationary
11. สรุป: ความฉลาดไม่ใช่เครื่องจักรคะแนน 100
ความฉลาดใกล้เคียงกับการเพิ่ม expected value อย่างต่อเนื่องในโลกที่ไม่แน่นอนและเปลี่ยนไป มากกว่าการถูก 100% ทุกครั้ง
Connectome อย่างเดียวไม่พอ ต้องมี sensory interface, dynamics, memory และ action output
Dopamine มากขึ้นไม่ได้แปลว่าฉลาดขึ้นอัตโนมัติ
Reward ที่กำหนดผิดสามารถทำให้ระบบ optimize เป้าหมายผิดได้อย่างยอดเยี่ยม
และเมื่อคู่แข่งเรียนรู้ด้วย การตัดสินใจดีเยี่ยมก็ไม่รับประกันชัยชนะ 100%
ยังไม่รู้ว่า Flybook จะสร้างสิ่งที่ควรเรียกว่า “มิตรภาพ” หรือไม่ แต่ถ้าแมลงวันจำลองหกตัวเริ่มเก็บประวัติรายบุคคล ปรับ prediction ต่อกัน และเกิดความสัมพันธ์คงอยู่ที่อธิบายด้วย fixed reflex ไม่ได้ สิ่งสำคัญไม่ใช่ “friendship 100%”
แต่คือ
ใครเปลี่ยน prediction ต่อใครหลังประสบการณ์อะไร และการเปลี่ยนนั้นเปลี่ยน choice ถัดไปอย่างไร
ความฉลาดมักเห็นชัดใน update log มากกว่าในคะแนนเต็ม
