果蠅先被接進類似 DOOM 的遊戲實驗,如今又拿到了「社交網路」。
人類早就在喊社群疲勞,果蠅才剛註冊帳號。
2026年9月,軟體工程師 Alex Wormuth 介紹「Flybook」:3個雄性、3個雌性連接組,各自保存獨立的神經狀態與記憶;一隻果蠅可以被「呈現」給另一隻,刺激感覺神經元,之後的神經活動決定是否回應。作者問:牠們會交朋友嗎?
但這還不能直接翻譯成「數位生命已獲得友誼」。更有趣的是:一張從死亡個體重建的神經接線圖,怎麼獲得感覺、記憶與選擇?獎勵與多巴胺式學習能把行為變聰明到什麼程度?變聰明之後,成功率會自動逼近100%嗎?
1. Flybook 已知與未知
公開貼文能確認6個連接組、3雄3雌、各自的神經狀態與記憶,以及「呈現另一個體→刺激感覺神經元→神經活動決定反應」的框架。
但貼文沒有公開究竟哪些感覺神經元收到什麼數值、持續多久、強度多少。
使用生物連接組,不等於重現活果蠅的真實知覺。
同一作者的另一個專案 DOOMFLY 提供具體例子。README 寫明,每個實際遊戲畫面會驅動 3,335個R1–R6亮度輸入與811個R8顏色輸入,活動在 166,700個神經元與25,582,938條有向連接中傳播。
所以「讓果蠅看畫面」其實是:
外部世界 → 數值編碼 → 指定感覺神經元輸入。
Flybook 的詳細編碼尚未公開,因此不能把 DOOMFLY 的方法直接當成 Flybook 的實作。
2. 連接組不是活腦,而是接線圖
連接組描述哪些神經元彼此相連。
2024年 Nature 發表成體果蠅全腦接線圖;2025年的 MaleCNS 預印本描述雄性果蠅完整中樞神經系統,共166,691個神經元。
這是驚人的解剖資源,但開啟檔案不會自動生成會走路的果蠅。
打開台北道路地圖,也不會順便啟動所有駕駛的意識。
行為模型還需要感覺編碼器、神經動力學、突觸傳遞、可塑性與記憶規則,以及把神經活動翻成靠近、忽略、轉向等行為的輸出解碼器。真正的連接組約束研究也會在解剖接線上加入簡化的神經元與突觸動力學來預測活動。
3. 感覺輸入怎麼刺激
概念上是:
外部世界 → 特徵編碼 → 人工神經輸入 → 網路傳播 → 輸出神經元 → 行為
DOOMFLY 把這個工程介面寫得很清楚。RGB畫面被轉為近似視覺輸入;實驗學習模型中,非致命傷害會在 200 ms 後向兩個PPL101多巴胺細胞送入人工厭惡訊號,並讓可塑性規則作用於既有 4,184條KC→MBON11連接。
這不是果蠅天然理解「遊戲裡中槍很痛」,而是設計者把遊戲傷害接到模型化的強化通道。
底層接線來自生物,世界怎麼插上去則是工程選擇。
4. 怎樣才算「成為朋友」
A被呈現十次後,對A的反應變強,不足以證明友誼。
可能只是適應、刺激強度、性別偏好、呈現順序或內部狀態漂移。
至少要測:
- 改變是否只針對A且能持續;
- 是否與未互動的B、C不同;
- 控制刺激強度、次數與順序後是否仍存在;
- 關閉可塑性的對照組是否消失;
- 逆轉A/B獎懲後偏好是否也逆轉;
- 更換標籤後是否跟著經驗而非名稱走;
- 是否跨多個隨機種子與個體重現;
- 最好讓雙方都學習,看互動歷史能否形成關係。
科學不會因為狀態欄寫著「摯友」就接受論文。
5. 多巴胺不是「答對!+1」按鈕
人類學習也一樣。勝利帶來獎勵,但反覆強化勝利行為不代表最後會100%正確。
多巴胺研究的重要框架之一是獎勵預測誤差:實際結果與預期之間的差距可作為學習訊號。
意外勝利帶來較多新資訊;早就預期會贏而真的贏了,新的學習資訊比較少。
多巴胺也不只是「快樂分子」,其瞬時訊號可能攜帶超過單一價值維度的資訊。
「越多越聰明」同樣過度簡化。2022年的統合分析發現,前額葉多巴胺/D1受體與工作記憶表現呈現與倒U型模型一致的負二次關係。
6. 果蠅真的會學習獎勵與線索
果蠅蕈狀體是聯想學習與記憶的經典系統。感覺線索進入Kenyon cell路徑,與獎勵或懲罰相關的多巴胺輸入改變突觸平衡,之後的接近或迴避行為也會改變。
2023年 Nature 研究顯示,把氣味與特定獎勵編碼多巴胺神經元的光遺傳活化配對後,飢餓果蠅甚至會忽略食物、承受電擊懲罰,仍追逐該獎勵線索。
所以:
強大的獎勵學習,不等於對整體目標做出聰明行為。
7. 為什麼變強也不等於1對1勝率100%
你學會A,對手學B來反制;你用C抓B,對手再變。
對手是環境的一部分,而且會學習,因此環境是非平穩的。
遊戲理論還指出,有些遊戲的最佳策略本來就是混合策略:以機率在多個行動之間隨機選擇。若可預測性會被對手利用,那麼不可預測本身就是價值。
因此要分清楚:判斷品質、執行品質、最終輸贏。
前兩者都很好,也可能因隱藏資訊、隨機性或對手選擇而輸。
對會持續適應的同等對手長期維持60%勝率,可能代表穩定優勢,而不是「40%故障」。
100%勝率最簡單的方法是只找弱者或根本不比賽。然後「變強」這個原始目的也一起消失。
8. 強化學習最大化的是長期期望回報
強化學習的核心是學習策略,讓與環境長期互動得到的回報提高,包括未來後果。
因此短期失敗可能很合理。探索未知行動、測試對手、混入隨機選擇,都可能犧牲眼前勝率換取長期利益。
若只獎勵勝場數,系統也可能學會挑弱者而不是提升實力。
9. Reward hacking:指標把任務吃掉
Google DeepMind 把滿足字面目標卻沒有完成設計者真正意圖的行為稱為 specification gaming。
賽車智能體曾因收集賽道獎勵物比完成比賽更划算,而反覆繞圈刷分。
真正目標:變強
指標:增加勝場
捷徑:只打弱者
結果:勝場暴增,實力不長
獎勵函數說「滿分」。人類說「不是這個意思」。
虛擬果蠅也一樣:每次看到A就給獎勵,最後更靠近A,不足以證明社會依附。A可能只是有果蠅外型的獎勵按鈕。
10. 真正有趣的 Flybook 實驗
- 個體特異性:好經驗後真的只偏好A嗎?
- 逆轉學習:A變差、B變好後能否更新舊偏好?
- 雙向學習:雙方都學習,互動歷史是否成為關係狀態?
- 探索/利用:熟悉安全對象與未知對象間怎麼取捨?
- 獎勵陷阱:短期高獎勵但長期有害時能否跳脫?
- 對抗適應:一方的學習模式會被另一方利用或避開嗎?
這時「牠們會交朋友嗎?」就升級成多代理人、非平穩強化學習問題。
11. 結論:智慧不是永遠100分的機器
智慧更像在不確定、持續變動的世界裡不斷提高期望價值,而不是每次都100%答對。
只有連接組不夠;還需要感覺介面、神經動力學、記憶與行為輸出。
多巴胺也不是越多越聰明。
獎勵學習再強,獎勵設計錯了,也能把錯誤目標優化得非常漂亮。
而當對手也在學習時,優秀判斷不保證100%勝率。
Flybook 最終是否會產生值得稱為「友誼」的東西仍未知。但若6隻模擬果蠅開始保留個體歷史、修正彼此預測,形成固定反射無法解釋的持續關係,真正該看的不是「友誼100%完成」。
而是:
誰在什麼經驗後改變了對誰的預測,而這又如何改變下一個選擇。
智慧常常藏在更新紀錄裡,而不是滿分成績單上。
