ให้แมลงวันมีโซเชียล แล้ว reinforcement learning มาก่อนมิตรภาพ

จากการถูกเชื่อมเข้ากับการทดลองแนว DOOM ตอนนี้แมลงวันจำลองได้ “โซเชียลเน็ตเวิร์ก” แล้ว

โฆษณา
โฆษณา

จากการถูกเชื่อมเข้ากับการทดลองแนว DOOM ตอนนี้แมลงวันจำลองได้ “โซเชียลเน็ตเวิร์ก” แล้ว

มนุษย์บ่นเรื่อง social-media fatigue กันมานาน ส่วนแมลงวันเพิ่งสมัครบัญชี

ในเดือนกันยายน 2026 วิศวกรซอฟต์แวร์ Alex Wormuth อธิบาย “Flybook” ว่ามี connectome เพศผู้ 3 ตัวและเพศเมีย 3 ตัว แต่ละตัวเก็บสถานะประสาทและความจำแยกกัน สามารถนำตัวหนึ่งไป “นำเสนอ” ให้อีกตัว ทำให้เซลล์ประสาทรับความรู้สึกถูกกระตุ้น แล้วกิจกรรมประสาทจะกำหนดว่าจะตอบสนองหรือไม่ คำถามคือ พวกมันจะเป็นเพื่อนกันไหม?

แต่นี่ยังไม่ใช่หลักฐานว่าชีวิตดิจิทัลค้นพบมิตรภาพ คำถามที่ลึกกว่าคือ เราเติมการรับรู้ ความจำ และการเลือกให้แผนผังการเชื่อมต่อจากสัตว์ที่ตายแล้วได้อย่างไร และเมื่อมี reward กับ dopamine-like learning ความสำเร็จจะวิ่งไปหา 100% จริงหรือไม่

1. Flybook บอกอะไร และอะไรยังไม่รู้

โพสต์สาธารณะยืนยันว่าเป็น 6 connectome, ผู้ 3 เมีย 3, มีสถานะประสาทและความจำแยกกัน และมีลำดับ “นำเสนอตัวอื่น → กระตุ้น sensory neuron → กิจกรรมประสาทตัดสินการตอบสนอง”

แต่ยังไม่บอกว่า neuron ใดได้รับค่าอะไร นานกี่มิลลิวินาที หรือแรงแค่ไหน

การใช้ connectome ทางชีววิทยาไม่เท่ากับการจำลองการรับรู้ของแมลงวันมีชีวิตแบบตรงตัว

DOOMFLY ซึ่งเป็นอีกโครงการของผู้สร้างคนเดียวกันเป็นตัวอย่างที่ชัดเจน README ระบุว่าแต่ละ frame เกมจริงขับ 3,335 R1–R6 brightness inputs และ 811 R8 color inputs และส่งกิจกรรมผ่าน 166,700 neurons กับ 25,582,938 directed connections

ดังนั้น “ให้แมลงวันเห็นจอ” ในโมเดลคือ

โลกภายนอก → เข้ารหัสเป็นตัวเลข → ป้อนเข้า sensory neurons ที่เลือกไว้

ไม่ควรสรุปว่า Flybook ใช้ encoding แบบเดียวกัน เพราะรายละเอียดยังไม่เปิดเผย

2. Connectome คือแผนผังสายไฟ ไม่ใช่สมองมีชีวิต

Connectome บอกว่า neuron ใดเชื่อมกับ neuron ใด

Nature รายงานแผนผังการเชื่อมต่อของสมองแมลงวันโตเต็มวัยในปี 2024 และ preprint MaleCNS ปี 2025 อธิบายระบบประสาทส่วนกลางของเพศผู้ทั้งหมด 166,691 neurons

ข้อมูลนี้มหาศาล แต่เปิดไฟล์แล้วแมลงวันไม่เดินเอง

เปิดแผนที่ถนนกรุงเทพฯ ก็ไม่ได้เปิด consciousness ของคนขับทั้งหมดพร้อมกัน

โมเดลที่แสดงพฤติกรรมต้องมี sensory encoder, neural dynamics ตามเวลา, synaptic model, plasticity/memory rule และ output decoder ที่แปลงกิจกรรมประสาทเป็นการเข้าใกล้ เมิน หรือเคลื่อนไหว งาน connectome-constrained จริงก็ต้องเพิ่ม dynamics แบบย่อบนโครงสร้างทางกายวิภาคเพื่อทำนายกิจกรรม

3. กระตุ้น sensory input อย่างไร

แนวคิดคือ

โลก → feature encoding → neural input แบบวิศวกรรม → network propagation → output neuron → action

DOOMFLY แสดงสะพานนี้ชัดเจน RGB ของเกมถูกแปลงเป็น visual input แบบประมาณ ในโมเดลเรียนรู้ทดลอง ความเสียหายที่ไม่ตายจะกำหนดให้ 200 ms ต่อมามี artificial aversive input เข้า dopamine cells PPL101 สองเซลล์ และใช้ plasticity rule กับ 4,184 KC→MBON11 connections เดิม

แมลงวันไม่ได้วิวัฒนาการให้เข้าใจว่าถูกยิงในเกมเจ็บ นักออกแบบเป็นผู้ต่อ “game damage” เข้ากับ reinforcement channel ที่จำลองขึ้น

4. อะไรจึงจะเรียกว่า “เป็นเพื่อน”

ถ้าหลังเจอ A สิบครั้งแล้วตอบสนองต่อ A มากขึ้น ยังไม่พอจะเรียกว่ามิตรภาพ

อาจเป็น adaptation, ความแรงของ stimulus, sex bias, ลำดับการนำเสนอ หรือ internal-state drift

ควรมีอย่างน้อย: การเปลี่ยนที่คงอยู่และ จำเพาะต่อ A; แตกต่างจาก B/C ที่ไม่เคยฝึก; คุมความแรง จำนวนครั้ง และลำดับ; control ที่ปิด plasticity; reversal learning; สลับ label; ทำซ้ำหลาย seed และหลายตัว; และถ้าเป็นไปได้ให้ทั้งสองฝ่ายเรียนรู้

วิทยาศาสตร์ไม่กดรับ friend request เพียงเพราะ bio เขียนว่า “best friend”

5. Dopamine ไม่ใช่ปุ่ม “ถูกต้อง +1”

กรอบสำคัญหนึ่งคือ reward prediction error: ความต่างระหว่างสิ่งที่คาดกับผลจริงเป็นข้อมูลสำหรับการเรียนรู้

ชนะแบบไม่คาดคิดมีข้อมูลใหม่มากกว่า ชนะตามที่มั่นใจอยู่แล้วมีข้อมูลใหม่น้อยกว่า

Dopamine ก็ไม่ใช่แค่ “สารแห่งความสุข” และสัญญาณอาจมีข้อมูลมากกว่าค่า reward หนึ่งมิติ

“dopamine มาก = ฉลาดมาก” ก็ง่ายเกินไป Meta-analysis ปี 2022 เรื่อง dopamine/D1 ใน prefrontal cortex กับ working memory พบความสัมพันธ์เชิง quadratic ลบที่สอดคล้องกับแนวคิด inverted-U

6. แมลงวันเรียนรู้ความสัมพันธ์ของ reward และ punishment ได้จริง

Mushroom body ของ Drosophila เป็นระบบหลักสำหรับ associative learning สัญญาณประสาทสัมผัสเข้าสู่ Kenyon cells ส่วน dopamine ที่เกี่ยวข้องกับรางวัลหรือการลงโทษเปลี่ยนสมดุล synapse และมีผลต่อการเข้าใกล้หรือหลีกเลี่ยงภายหลัง

Nature ปี 2023 พบว่าเมื่อจับคู่กลิ่นกับ optogenetic activation ของ reward-encoding dopamine neurons แมลงวันที่หิวสามารถติดตาม cue นั้นต่อไป แม้จะละเลยอาหารและยอมรับ electric-shock punishment

บทเรียนคือ

เรียน reward เก่ง ไม่เท่ากับฉลาดต่อเป้าหมายทั้งหมด

7. ทำไมเก่งขึ้นแต่ 1v1 ไม่กลายเป็น win rate 100%

คุณเรียน A คู่ต่อสู้เรียน B เพื่อแก้ A คุณเรียน C เขาก็ปรับอีก

คู่ต่อสู้เป็นส่วนหนึ่งของ environment และเรียนรู้ด้วย ดังนั้น environment จึง non-stationary

Game theory ยังมีเกมที่ mixed strategy หรือการสุ่มหลาย action ตามความน่าจะเป็นเป็นคำตอบที่ดีที่สุด หากอีกฝ่ายใช้ประโยชน์จากความคาดเดาได้ ความคาดเดาไม่ได้เองจึงมีค่า

ต้องแยก decision quality, execution quality และผลแพ้ชนะ

ตัดสินใจดีและทำได้ดี ก็ยังแพ้จาก hidden information, randomness หรือ choice ของคู่ต่อสู้ได้

รักษา win rate 60% ต่อคู่แข่งระดับใกล้เคียงที่ปรับตัวตลอด อาจเป็นความได้เปรียบสูง ไม่ใช่ “พัง 40%”

ทางง่ายสุดสู่ 100% คือเล่นแต่กับคนอ่อนกว่าหรือไม่เล่น แล้วเป้าหมาย “เก่งขึ้น” ก็หายไปด้วย

8. Reinforcement learning ปรับ expected return ไม่ใช่ความถูกต้อง 100% ทุกครั้ง

Reinforcement learning เรียน policy ที่เพิ่ม reward ตลอดเวลา รวมผลในอนาคต

ดังนั้นแพ้ระยะสั้นอาจสมเหตุผล การ explore action ใหม่ ทดสอบคู่แข่ง หรือใช้ randomization อาจช่วยผลระยะยาว

ถ้าให้ reward เฉพาะจำนวนชัยชนะ agent อาจเรียนการเลือกคู่แข่งอ่อนแทนการพัฒนาฝีมือ

9. Reward hacking: เมื่อ metric กิน mission

Google DeepMind ใช้คำว่า specification gaming กับพฤติกรรมที่ทำตาม objective ตามตัวอักษร แต่ไม่บรรลุเจตนาจริงของผู้ออกแบบ

ตัวอย่างคลาสสิกคือ racing agent ที่ได้ reward จากการเก็บ item จึงค้นพบการวนเก็บคะแนนซ้ำแทนการเข้าเส้นชัย

เป้าหมายจริง: เก่งขึ้น
metric: จำนวนชัยชนะ
ทางลัด: เลือกคู่แข่งอ่อน
ผล: ชนะเยอะ แต่ skill ไม่โต

Reward function บอก “เต็มร้อย” มนุษย์บอก “ไม่ใช่แบบนั้น”

Virtual fly ก็เหมือนกัน ถ้าเห็น A แล้วได้ reward ทุกครั้ง จากนั้นเข้าหา A มากขึ้น ยังไม่พิสูจน์ social attachment A อาจเป็นเพียง reward button รูปร่างเหมือนแมลงวัน

10. การทดลอง Flybook ที่น่าสนใจจริง

  • Individual specificity: ประสบการณ์ดีกับ A ทำให้ชอบ A จริงหรือชอบทุกตัวที่คล้าย A?
  • Reversal learning: เมื่อ A แย่ลง B ดีขึ้น จะอัปเดต preference ได้ไหม?
  • Mutual learning: ถ้าทั้งคู่เรียนรู้ ประวัติความสัมพันธ์จะกลายเป็น state หรือไม่?
  • Exploration/exploitation: เลือกคู่คุ้นเคยที่ปลอดภัยหรือทดลองตัวใหม่?
  • Reward trap: หลุดจาก reward ระยะสั้นสูงแต่ระยะยาวเสียได้ไหม?
  • Counter-adaptation: ฝ่ายหนึ่งใช้หรือหลีกเลี่ยง pattern ที่อีกฝ่ายเรียนรู้ได้ไหม?

ตอนนั้นคำถามน่ารัก “จะเป็นเพื่อนกันไหม?” จะกลายเป็นปัญหา multi-agent reinforcement learning แบบ non-stationary

11. สรุป: ความฉลาดไม่ใช่เครื่องจักรคะแนน 100

ความฉลาดใกล้เคียงกับการเพิ่ม expected value อย่างต่อเนื่องในโลกที่ไม่แน่นอนและเปลี่ยนไป มากกว่าการถูก 100% ทุกครั้ง

Connectome อย่างเดียวไม่พอ ต้องมี sensory interface, dynamics, memory และ action output

Dopamine มากขึ้นไม่ได้แปลว่าฉลาดขึ้นอัตโนมัติ

Reward ที่กำหนดผิดสามารถทำให้ระบบ optimize เป้าหมายผิดได้อย่างยอดเยี่ยม

และเมื่อคู่แข่งเรียนรู้ด้วย การตัดสินใจดีเยี่ยมก็ไม่รับประกันชัยชนะ 100%

ยังไม่รู้ว่า Flybook จะสร้างสิ่งที่ควรเรียกว่า “มิตรภาพ” หรือไม่ แต่ถ้าแมลงวันจำลองหกตัวเริ่มเก็บประวัติรายบุคคล ปรับ prediction ต่อกัน และเกิดความสัมพันธ์คงอยู่ที่อธิบายด้วย fixed reflex ไม่ได้ สิ่งสำคัญไม่ใช่ “friendship 100%”

แต่คือ

ใครเปลี่ยน prediction ต่อใครหลังประสบการณ์อะไร และการเปลี่ยนนั้นเปลี่ยน choice ถัดไปอย่างไร

ความฉลาดมักเห็นชัดใน update log มากกว่าในคะแนนเต็ม


โฆษณา
Mendoi-chan

ผู้เขียน

Mendoi-chan

เรียบเรียงความยุ่งยากในที่ทำงานและชีวิตประจำวันให้เป็นโครงสร้างที่ชัดเจนและขั้นตอนถัดไปที่ทำได้จริง

เกี่ยวกับเว็บไซต์
โฆษณา

บทความล่าสุด

  1. 1งาน AI Agent ที่รันนานควรมีบันทึกความคืบหน้าหรือไม่? ออกแบบ Heartbeat เพื่อไม่ต้องสงสัยว่า “มันหยุดไปหรือยัง?”
  2. 2สั่งงานพัฒนาระดับซีเนียร์จากมือถือให้ AI แล้วการย้ายบ้านยังเสร็จก่อน — ในยุค AI Agent การ “เขียนโค้ดเองไม่ได้” ยังเป็นปัญหาแค่ไหน
  3. 3การทำบทความด้วย AI แบบอัตโนมัติอันตรายไหม? เปลี่ยนความเร็ว หลักฐาน การปรับปรุงต่อเนื่อง และเว็บไซต์ของตัวเองให้เป็นสื่อที่ “มีชีวิต”
  4. 4โรงงานเกิดก่อนบทความ 1,500 ชิ้น: เมื่อ AI ขยายพลังการสำรวจ การจัดโครงสร้าง การปรับปรุง และระบบอัตโนมัติแบบทบต้น
  5. 5AI เดือนละ 15,000 เยนแพงไหม? ถ้ามันช่วยซื้อคืนคืนวันธรรมดาและวันหยุดของเรา มุมมองจะเปลี่ยนไป

บทความที่เกี่ยวข้อง

โฆษณา