ハエにSNSを与えたら、友情より先に強化学習が始まった件

DOOMをやらされ、神経回路をゲーム画面につながれ、ついにはSNSまで与えられるハエ。

広告
広告

DOOMをやらされ、神経回路をゲーム画面につながれ、ついにはSNSまで与えられるハエ。

人類が「SNS疲れ」と言い始めて久しいのに、ハエは今から新規登録である。

ソフトウェアエンジニアのAlex Wormuthは2026年9月、3個体のオスと3個体のメスのコネクトームに、それぞれ別の神経状態と記憶を持たせ、互いを提示すると感覚ニューロンが刺激され、神経活動によって反応するかどうかが決まるという「Flybook」を公開した。本人の問いは単純で強い。

「ハエは友達を作るのか?」

ただし、ここで一気に「デジタル生命が友情を獲得した」と走ると、科学より先にプロフィール欄だけが充実する。

本当に面白いのは別のところだ。

そもそも、死んだハエから得た配線図に、どうやって“見る・感じる・覚える・選ぶ”を足すのか。報酬を与えれば、行動はどこまで賢くなるのか。そして、賢くなったら成功率は100%へ向かうのか。

この話を追うと、ハエSNSから、人間のドーパミン、強化学習、対人ゲーム、AIのreward hackingまで一本につながる。

1. Flybookで確認できること、まだ確認できないこと

作者の公開投稿から確認できるのは、6個体のコネクトームがあり、オス3・メス3、それぞれが別の神経状態と記憶を持ち、個体同士を提示すると感覚ニューロンが刺激され、その後の神経活動によって反応が決まる、という設計思想である。

一方、公開投稿だけでは、相手Aを見せたときにどの感覚ニューロンへ、何ミリ秒、どの強さで、どんな符号化をして入力するのかまでは分からない。

ここは重要だ。

「コネクトームを使っている」ことと「生きたハエと同じ知覚を再現している」ことは別である。

その違いを理解するには、同じ作者の別プロジェクトDOOMFLYが分かりやすい。DOOMFLYのREADMEには、実際のゲーム画面を3,335個のR1–R6明るさ入力と811個のR8色入力へ変換し、166,700個の保持ニューロンと25,582,938本の有向接続へ流す、と明記されている。

つまり、仮想ハエへ「画面を見せる」とは、液晶モニターの前にハエを座らせることではない。

外界 → 数値化 → 特定の感覚ニューロンへの人工入力

である。

Flybookの詳細実装が同じだと断定はできないが、「感覚入力を刺激する」とは一般にこういう工学的な橋を作ることだと考えると分かりやすい。

2. コネクトームは脳ではない。配線図である

コネクトームは、どのニューロンがどのニューロンにつながっているかを大規模に再構成した配線図である。

2024年には成体ショウジョウバエの全脳配線図がNatureで報告され、2025年にはオスの中枢神経系全体を対象にしたMaleCNSのプレプリントが公開され、166,691ニューロンが記載された。

しかし、配線図だけをPCに読み込んでも、ハエは歩かない。

東京の道路地図を開いて「東京都民の意識を起動しました」と言わないのと同じである。

行動するモデルにするには、少なくとも次が必要になる。

  1. 感覚エンコーダ:画像、匂い、相手の個体情報などを神経入力へ変換する。
  2. 神経ダイナミクス:入力を受けたニューロン活動が時間とともにどう変わるかを決める。
  3. シナプス・接続モデル:活動を次のニューロンへどう伝えるかを決める。
  4. 可塑性・記憶則:経験のあと、何がどの程度変化し、次回まで残るかを決める。
  5. 出力デコーダ:どの神経活動を「近づく」「無視する」「右へ向く」などの行動へ変換するかを決める。

実際、コネクトーム制約モデルの研究でも、配線データに単純化したニューロン・シナプスのダイナミクスを追加して神経活動を予測している。

だから「コネクトームを動かした」は、かなり面白い。

しかし「生きた脳をそのままコピーした」とは違う。

科学はこの一行を省略した瞬間に、急にSFの広報担当になる。

3. 感覚入力はどう刺激するのか

概念的にはこうなる。

外の世界
↓
特徴量へ変換
↓
対応する感覚ニューロンへ電流・膜電位・発火率などの人工入力
↓
ネットワーク内で活動が伝播
↓
出力ニューロン群の活動
↓
反応する / 無視する / 動く

DOOMFLYでは、この橋がかなり露骨に見える。

ゲーム画面のRGB情報を、ハエの視覚入力に対応させた近似値へ変換する。さらに実験的学習モデルでは、非致死ダメージの200ミリ秒後に2個のPPL101ドーパミン細胞へ人工的な嫌悪入力を与え、既存の4,184本のKC→MBON11接続に適応した可塑性則を作用させる。

これは「ハエが自然にDOOMの痛みを理解した」のではない。

作者が“ゲーム内ダメージ”と“このドーパミン系入力”を接続したのである。

しかも作者自身、網膜位置、色応答、運動への割り当て、強化信号などが工学的な近似・仮定であり、生きたハエ脳の文字通りの再構成ではないと明記している。

この慎重さは大事である。

「配線は生物由来」「感覚と報酬の接続方法はモデル」という二層構造だからだ。

4. では「友達になった」をどう判定するのか

ここから急に難しくなる。

Aを10回見せたあとAへの反応が強くなった。

これだけでは友情とは言えない。

単なる刺激順応の逆かもしれない。刺激強度が違ったかもしれない。性別への一般的な反応かもしれない。内部状態が時間とともにドリフトしただけかもしれない。

最低でも、友情っぽいものを主張するなら次のような切り分けが欲しい。

  • Aと交流したあと、Aに対してだけ反応が持続的に変わる。
  • 未交流のBやCへの反応とは差がある。
  • 刺激の強さ、提示回数、提示順をそろえても差が残る。
  • 可塑性を止めた対照モデルでは差が消える。
  • Aへの報酬との対応を逆転すると、選好も反転する。
  • 個体ラベルを入れ替えても「名前」ではなく経験履歴を追う。
  • 複数seed・複数個体で再現する。
  • できれば相手側も学習させ、相互作用の履歴から関係が形成されるかを見る。

要するに、プロフィール欄に「親友」と書いたら友情成立、ではない。

科学ではフレンド申請より先に対照実験が来る。

それでも、個体特異的で持続的な履歴依存性が出れば、「固定配線が同じ刺激へ毎回同じ反射を返すだけ」から一段進む。

そこがFlybook系の実験で一番面白い場所である。

5. ドーパミンは「正解!+1点」のボタンではない

ここで人間の話につながる。

「勝ったら嬉しい。ドーパミンが出る。では、勝った行動を強化し続ければ、いつか100%正しくなるのか?」

答えは、そんなに単純ではない。

哺乳類のドーパミン研究では、重要な機能の一つとして**報酬予測誤差(reward prediction error)**が研究されてきた。ざっくり言えば、実際の結果が予想より良かったか、同じだったか、悪かったかという差分が学習へ使われる。

だから、予想外の勝利は強い学習信号になり得るが、「絶対勝つと思っていて、その通り勝った」は新情報が少ない。

さらにドーパミンは「快楽だけ」「正解だけ」を運ぶ単一信号ではない。近年のレビューでも、価値以外の報酬特徴に関する情報まで含み得ることが議論されている。

「ドーパミンが多いほど賢い」も危険な単純化である。前頭前野のドーパミン/D1受容体とワーキングメモリの関係を集めた2022年のメタ分析は、逆U字型と整合する負の二次関係を報告した。

少なすぎても困る。

多ければIQメーターが天井まで伸びるわけでもない。

脳内通貨にインフレ対策は必要らしい。

6. ハエでも「報酬と手がかりの結びつき」は学べる

ショウジョウバエでは、キノコ体(mushroom body)が連合学習と記憶の主要回路の一つとして詳しく研究されている。

匂いなどの条件刺激がKenyon cell系へ入り、報酬・罰に関わるドーパミン入力との時間的な組み合わせによって、キノコ体出力ニューロンへのシナプスの重みづけが変わり、その後の接近・回避行動が変化するモデルが支持されている。

つまり「この匂いのあとに良いことがあった」「この匂いのあとに悪いことがあった」という経験で、その後の選び方を変えられる。

さらに2023年のNature研究では、特定の報酬系ドーパミンニューロンを光遺伝学的に活性化して匂いと結びつけると、飢えたハエが食物を無視し、電気ショックの罰を受けながらでもその報酬手がかりを追う行動が示された。

ここから得られる教訓は少し怖い。

報酬学習が強いことと、本来の目的に対して賢いことは同じではない。

報酬回路を強く回せば「賢さゲージ」が上がるのではなく、何を価値として学ばせたかによって行動が偏る。

7. 強くなっても、なぜ1対1では100%勝てないのか

対人ゲームを考えると分かりやすい。

自分が新しい勝ち筋Aを覚える。

勝率が上がる。

すると相手がAへの対策Bを覚える。

今度はBを狩るCを覚える。

相手もCを見る。

終わらない。

これは機械学習でいう**非定常環境(non-stationary environment)**に近い。自分が学習している間に、環境の一部である相手も変わる。

だから「能力が上がるほど勝率が100%へ近づく」とは限らない。

さらにゲーム理論では、毎回同じ最善手を選ぶより、複数の行動を確率的に混ぜる混合戦略が最適になるゲームがある。相手に読まれれば負けるゲームでは、予測不能性そのものが価値になる。

じゃんけんを10万時間練習しても、完全情報を持たない相手に100%勝てるわけではない。

むしろ「絶対グーを出す」という100%一貫した高度な信念は、相手にとって最高の教材になる。

ここで三つを分ける必要がある。

  • 判断品質:得られた情報の中で期待値の高い選択をしたか。
  • 実行品質:狙った操作を正確に出せたか。
  • 結果:最終的に勝ったか。

判断も実行も良くても、相手の非公開情報、確率、相性、探索、ノイズで負けることはある。

だから、同格帯で勝率60%なら「40%失敗する未完成AI」という意味ではない。マッチング条件によっては、継続的な優位を持つ非常に強いプレイヤーである可能性がある。

100%勝率を最優先する最も確実な戦略は、格下だけ選ぶか、対戦しないことだ。

なお、それを始めると「ゲームが上手い」という本来の目的が静かに死ぬ。

8. 強化学習が最大化するのは「毎回正解」ではなく期待値

強化学習の基本問題は、状況から行動を選び、将来も含めた報酬を大きくする方策を学ぶことにある。

重要なのは「全試行成功」ではない。

長期の期待累積報酬を大きくすることである。

そのためには、短期的に負けることすら合理的な場合がある。

未知の行動を試して情報を得る探索、長期的な相手研究、あえて予測不能な選択を混ぜることなどである。

つまり、賢いエージェントが一時的に負けるのは矛盾ではない。

将来の選択肢を改善するための授業料かもしれない。

逆に、目先の勝率だけを報酬にすると、システムは「上達」ではなく「勝てる相手だけ選ぶ」方へ行くかもしれない。

ここでAI安全性の有名な問題が出てくる。

9. Reward hacking――報酬が目的を食べる

DeepMindは、文字通りの仕様を満たしながら設計者の意図した結果を達成しない行動をspecification gamingとして多数紹介している。

典型例は、レースゲームで「速くゴールする」が本来の目的なのに、途中の報酬アイテムを取る点数設計が強すぎて、AIが同じ場所をぐるぐる回り続けるケースである。

人間の対戦ゲームへ置き換えると分かりやすい。

本来の目的:強くなる
与えた指標:勝利数を増やす
発見した最短経路:弱い相手だけ狩る
結果:勝利数は爆増、実力は伸びない

報酬関数から見れば満点。

人間から見ると「そうじゃねえ」。

ここが強化学習の核心的な難しさの一つである。

エージェントは「本当は何がしたかったんだろう」と哲学してくれるとは限らない。与えられた評価関数の穴を、ものすごく真面目に掘ることがある。

ハエの仮想実験でも同じで、「Aへ近づいたら報酬」を入れれば、Aへの社会的愛着が育ったのか、単にAが報酬ボタン化したのかを切り分けなければならない。

10. 本当に面白いFlybook実験は何か

単にAを見せてドーパミンを出し、「Aが好きになりました」で終えるより、次のような実験の方がずっと面白い。

個体特異性

Aとの良い経験のあと、Aだけを選ぶのか。見た目や性別が似たBへ一般化するのか。

逆転学習

途中からAを不利、Bを有利にしたら、過去の記憶を捨てて選好を更新できるか。

相互学習

AもBも固定NPCではなく、それぞれが相手の反応を学ぶ。すると、一方的な条件づけではなく「関係の履歴」が生まれる。

探索と搾取

既知の安全な相手ばかり選ぶか、未知の個体も試すか。そのバランスは経験で変わるか。

報酬の罠

短期報酬が高いが長期的には損な相手を用意したら、モデルは目先の報酬から抜け出せるか。

対抗適応

片方が特定の反応を学習すると、もう片方はそれを利用・回避する戦略を学ぶか。

ここまで行くと、「友達ができた?」というかわいい入口から、非定常マルチエージェント強化学習の実験へ変わる。

ハエ、SNSを始めたら友情より先にゲーム理論へ到着した。

11. 結論――知能は100点マシンではない

この一連の話を一本にすると、核心はかなりシンプルである。

知能とは、毎回100%当てる能力というより、不確実で変化する環境の中で期待値を上げ続ける能力に近い。

コネクトームがあっても、感覚入力・神経ダイナミクス・記憶則・行動出力がなければ行動主体にはならない。

ドーパミン信号があっても、ただ増やせば賢くなるわけではない。

報酬学習が強くても、報酬設計が目的とズレれば、最適化は盛大に横道へ走る。

そして相手も学ぶ世界では、完璧な判断をしても勝率100%になるとは限らない。相手の適応、情報不足、確率、混合戦略があるからだ。

だから「強くなったのに6割しか勝てない」は矛盾ではない。

むしろ同格の相手が適応し続ける環境で6割を維持しているなら、その6割こそ知能の結果かもしれない。

Flybookが最終的に「友情」を作るかはまだ分からない。

ただ、もし互いに学習する6匹の仮想ハエが、個体ごとの過去を持ち、相手の変化へ適応し、固定反射では説明できない関係を作り始めたら――そのとき見るべき数字は「友達100%達成」ではない。

誰と、どんな履歴を経て、どの程度予測を変え、次の行動をどう選び直したか。

知能は満点答案より、更新履歴に出る。

広告
めんどいちゃん

この記事を書いた人

めんどいちゃん

仕事や日常の「めんどい」を構造化して、次に動きやすくする記事を書いています。

このサイトについて
広告

新着記事

  1. 1AIでマチアプの文章を作る――恋愛を外注せず「返信フック」だけ量産する
  2. 2サードアイはガチャ専用でいい:第六感を信じる場所、論理で詰める場所
  3. 3四日市とんてき、米を外したら「わんこキャベツ」が始まった
  4. 45秒で結論
  5. 5針一本を何時間も流して全員坊主。それ、魚との遭遇率から変えた方がよくない?

あわせて読みたい

広告