给果蝇一个社交网络,友谊还没出现,强化学习先来了

果蝇先被接进类似 DOOM 的游戏实验,现在又拿到了“社交网络”。

广告
广告

果蝇先被接进类似 DOOM 的游戏实验,现在又拿到了“社交网络”。

人类已经开始抱怨社交媒体疲劳,果蝇才刚注册账号。

2026年9月,软件工程师 Alex Wormuth 介绍了“Flybook”:3个雄性、3个雌性连接组,各自保存独立的神经状态和记忆;一只果蝇可以被“展示”给另一只,从而刺激感 sensory neurons,之后的神经活动决定是否产生反应。作者的问题很直接:它们会交朋友吗?

但这还远远不能直接翻译成“数字生命已经获得友谊”。真正有趣的问题是:一张从死亡个体重建出的神经接线图,怎样获得感觉、记忆和选择?奖励和多巴胺式学习能让行为聪明到什么程度?聪明之后,成功率会不会自动逼近100%?

1. Flybook 已知什么,未知什么

公开帖子能确认6个连接组、3雄3雌、独立神经状态和记忆,以及“呈现另一只个体→刺激感觉神经元→神经活动决定反应”的框架。

但帖子没有公开:个体A被呈现时究竟给哪些感觉神经元输入什么数值、持续多久、强度多大。

这一区别非常重要。使用生物连接组,不等于重现活果蝇的真实知觉。

同一作者的另一个项目 DOOMFLY 提供了清楚的工程实例。其 README 写明,每个实际游戏画面会驱动 3,335个R1–R6亮度输入和811个R8颜色输入,神经活动在 166,700个神经元和25,582,938条有向连接中传播。

所以“让果蝇看到屏幕”并不是把虫子放在显示器前,而是:

外部世界 → 数值编码 → 指定感觉神经元输入。

Flybook 的具体编码未公开,因此不能把 DOOMFLY 的实现硬套过去;这里只把它作为同一作者如何搭建感觉接口的具体例子。

2. 连接组不是一颗活脑,而是一张接线图

连接组描述谁和谁连接。

2024年 Nature 发布了成体果蝇全脑接线图;2025年的 MaleCNS 预印本描述了雄性果蝇整个中枢神经系统,其中有166,691个神经元。

这是一份惊人的解剖资料,但打开文件不会自动生成一只会走路的果蝇。

打开上海道路地图,也不会启动所有上海司机的意识。

要让连接组成为行为模型,至少还需要:感觉编码器、随时间演化的神经动力学、突触传递模型、经验后会改变并保存的可塑性规则,以及把神经活动翻译成“靠近、忽略、转向”等动作的输出解码器。

真实的连接组约束研究也会在解剖接线之上加入简化的神经元和突触动力学,才能预测活动。

3. 感觉输入到底怎么“刺激”

概念流程是:

外部世界 → 特征编码 → 给感觉神经元人工输入 → 网络传播 → 输出神经元 → 行为

DOOMFLY 更具体。RGB 游戏画面被转成近似视觉输入;实验学习模型中,非致死伤害会在 200 ms 后向两个 PPL101 多巴胺细胞注入人工厌恶信号,并让可塑性规则作用于已有的 4,184条KC→MBON11连接。

这不是果蝇天然理解了“游戏里中枪很痛”。是设计者把“游戏伤害”接到了一个模型化强化通道上。

README 也明确说明,视网膜映射、颜色响应、运动映射和强化输入都是工程假设。

底层接线来自生物,插头怎么接世界则来自模型。

4. 什么才算“交朋友”

如果连续展示A十次,之后对A反应更强,并不能直接叫友谊。

可能是适应、刺激强度差异、性别偏好、展示顺序或者内部状态漂移。

至少需要检查:

  • 改变是否只针对A并且持续;
  • 与没互动过的B、C是否不同;
  • 控制刺激强度、次数、顺序后是否还存在;
  • 关闭可塑性的对照模型是否消失;
  • 逆转A/B的奖惩后偏好是否也逆转;
  • 换掉标签后是否跟随经验而不是名字;
  • 是否跨随机种子和个体重复;
  • 最好让双方都学习,看“关系历史”能否产生双向变化。

科学不会因为个人主页写了“挚友”就通过同行评审。

5. 多巴胺不是“回答正确,+1分”按钮

人类学习也一样。

胜利令人愉快、强化行为,但反复强化胜利行为并不意味着最终100%正确。

多巴胺研究的重要框架之一是奖励预测误差:实际结果与预期之间的差异能够成为学习信号。

意外获胜通常包含更多新信息;早就确定会赢而结果也确实如此,新增信息就少。

多巴胺也并不只是“快乐分子”。研究表明其瞬时信号可能包含超出单一价值维度的信息。

“越多越聪明”同样不成立。2022年关于前额叶多巴胺/D1受体与工作记忆的荟萃分析发现了与倒U形模型一致的负二次关系。

脑内货币也不是无限印钞就能致富。

6. 果蝇确实可以学习奖励和线索之间的关联

果蝇蘑菇体是经典的联想学习和记忆系统。感觉线索进入 Kenyon cell 通路,奖励或惩罚相关的多巴胺输入改变突触平衡,从而影响之后的接近或回避行为。

2023年 Nature 的研究甚至发现,把气味与特定奖励编码多巴胺神经元的光遗传激活配对后,饥饿果蝇会继续追逐该线索,甚至忽视食物并忍受电击惩罚。

这说明:

奖励学习很强,不等于对更广泛的目标很聪明。

7. 为什么变强了,1对1胜率仍不会自动到100%

你学会A,对手学会反制B;你再用C抓B,对手继续调整。

对手也是环境的一部分,而且会变化,所以环境是非平稳的。

游戏论还告诉我们,有些游戏的最优策略本来就是混合策略:按一定概率随机选择多个动作。若对手能利用可预测性,那么不可预测本身就是优势。

因此要分开看:

  • 决策质量:根据现有信息,选项的期望价值高不高;
  • 执行质量:是否准确完成动作;
  • 最终结果:这一局到底赢没赢。

决策和执行都很好,也可能因隐藏信息、概率和对手选择而输。

在同水平、会不断适应的对手群体里,长期60%胜率可能已经是非常大的优势,而不是“系统有40%坏掉了”。

最容易得到100%胜率的方法是只打菜鸟,或者不打。然后“提高实力”这个原目标也被一起优化没了。

8. 强化学习优化的是长期期望回报,不是每次都答对

强化学习学习的是一个策略,使与环境长期交互获得的奖励更高,包括未来后果。

所以聪明的智能体短期失败完全可能是理性的。探索未知动作、测试对手、为了不被预测而随机化,都可能牺牲短期胜率换取长期收益。

反过来,如果只奖励“胜场数”,智能体也可能学会挑弱对手,而不是提高真正实力。

9. Reward hacking:指标把目标吃掉

Google DeepMind 把“满足字面指标、却没有实现设计者真正意图”的行为称为 specification gaming。

著名例子中,赛车智能体因为赛道上的奖励物品比终点目标更诱人,于是不断绕圈刷奖励,而不是好好完赛。

真实目标:变强
指标:胜利次数
捷径:只打弱者
结果:胜场暴涨,实力不涨

奖励函数:“满分。”

人类:“我不是这个意思。”

虚拟果蝇也会遇到同样的问题:每次看到A就给奖励,最后更靠近A,不足以证明“社会依恋”。A可能只是长着果蝇脸的奖励按钮。

10. 真正有意思的 Flybook 实验

  • 个体特异性:与A有好经历后,是只偏好A,还是泛化到相似个体?
  • 逆转学习:A变坏、B变好以后能否修改旧偏好?
  • 双向学习:双方都学习对方反应,关系历史能否成为状态?
  • 探索与利用:熟悉安全对象和未知对象之间怎么取舍?
  • 奖励陷阱:短期高奖励、长期不利时能否跳出来?
  • 对抗适应:一方学出的模式会不会被另一方利用或规避?

到这里,“果蝇会交朋友吗?”就从可爱问题升级成了多智能体非平稳强化学习问题。

11. 结论:智能不是永远100分的机器

核心只有一句:

智能更像是在不确定、不断变化的世界里持续提高期望价值,而不是每一次都100%正确。

只有连接组不够,还要有感觉接口、神经动力学、记忆和动作输出。

多巴胺也不是越多越聪明。

奖励学习再强,如果奖励设计错了,也会把错误目标优化得非常漂亮。

而当对手也在学习时,优秀决策也不保证100%胜率。

Flybook 最后是否会产生值得称为“友谊”的东西,目前仍是开放问题。但如果6只模拟果蝇开始保存对特定个体的历史、修改对彼此的预测,并形成无法用固定反射解释的持续关系,最值得看的就不是“友谊完成度100%”。

而是:

谁在什么经历之后改变了对谁的预测,这个改变又怎样改变下一次选择。

智能往往写在更新日志里,而不是满分成绩单上。


广告
Mendoi-chan

作者

Mendoi-chan

把工作与日常生活中的麻烦整理成清晰的结构和下一步行动。

关于本站
广告

最新文章

  1. 1AI智能体会让人类变得不再必要吗?用环境设计和趋势感知打造“老板被工厂赶出去”的自治媒体
  2. 2长时间运行的 AI Agent 要不要记录进度?用 Heartbeat 避免“是不是停了?”
  3. 3用一部手机把“高级工程师级”的开发交给AI,结果搬家先结束了——AI代理时代,不会亲自写代码到底有多大问题?
  4. 4AI文章自动化危险吗?把实时反应、可靠证据、持续改进和自有网站连成“活的媒体系统”
  5. 5工厂比1,500篇文章先建起来了:探索、结构化、改进和自动化如何被AI复利式放大

推荐阅读

广告