DOOM 같은 실험에 연결되고, 게임 화면을 신경회로로 받아들이더니, 이제는 SNS까지 받은 파리.
인간은 이미 ‘SNS 피로’를 말하고 있는데 파리는 이제 막 가입하는 셈이다.
2026년 9월 소프트웨어 엔지니어 Alex Wormuth는 수컷 3개체와 암컷 3개체의 커넥톰이 각각 독립적인 신경 상태와 기억을 유지하고, 서로를 제시하면 감각 뉴런이 자극되며 그 뒤의 신경활동이 반응 여부를 결정하는 ‘Flybook’을 소개했다. 질문은 간단하다. 파리도 친구를 만들까?
하지만 이 문장만 보고 곧바로 “디지털 생명이 우정을 획득했다”고 말하면 실험보다 프로필 소개란이 먼저 완성된다.
핵심은 더 깊다. 죽은 개체에서 재구성한 배선도에 어떻게 감각, 기억, 선택을 붙이는가? 보상과 도파민성 학습을 넣으면 행동은 얼마나 좋아지는가? 그리고 좋아지면 성공률은 정말 100%로 가는가?
1. Flybook에서 확인되는 것과 아직 모르는 것
공개 글에서 확인되는 것은 6개의 커넥톰, 수컷 3·암컷 3, 개체별 신경 상태와 기억, 상대 제시에 따른 감각 뉴런 자극, 그리고 이후 신경활동에 따른 반응 결정이다.
그러나 어떤 감각 뉴런에 어떤 값이 몇 ms 동안 어느 강도로 들어가는지는 공개 글만으로 확인할 수 없다.
이 차이가 중요하다. 생물학적 커넥톰을 사용한다고 해서 살아 있는 파리의 지각이 그대로 재현되는 것은 아니다.
같은 개발자의 별도 프로젝트 DOOMFLY는 구체적인 예를 준다. README에 따르면 실제 게임 프레임은 3,335개의 R1–R6 밝기 입력과 811개의 R8 색 입력을 구동하고, 활동은 166,700개 뉴런과 25,582,938개 방향성 연결을 통해 전파된다.
즉 ‘화면을 보여준다’는 것은 모니터 앞에 파리를 앉히는 게 아니라,
외부 세계 → 숫자화 → 선택된 감각 뉴런 입력
이라는 인공 인터페이스를 만드는 일이다.
2. 커넥톰은 뇌 그 자체가 아니라 배선도다
커넥톰은 어떤 뉴런이 어떤 뉴런과 연결되는지 대규모로 재구성한 지도다.
2024년 Nature에는 성체 초파리 전뇌 배선도가 보고됐고, 2025년 MaleCNS 프리프린트는 수컷 중추신경계 전체에 166,691개의 뉴런을 기술했다.
놀라운 해부학 자료지만, 파일을 열었다고 파리가 걷지는 않는다.
서울 도로 지도를 열고 ‘서울 시민의 의식이 부팅되었습니다’라고 하지 않는 것과 같다.
행동 모델에는 최소한 감각 인코더, 시간에 따른 신경 동역학, 시냅스 전달 모델, 경험을 저장하는 가소성 규칙, 신경활동을 행동으로 바꾸는 출력 디코더가 필요하다. 실제 커넥톰 제약 연구도 해부학적 배선에 단순화한 뉴런·시냅스 동역학을 더해 활동을 예측한다.
3. 감각 입력은 어떻게 자극하는가
개념적으로는 다음과 같다.
외부 세계 → 특징값 → 감각 뉴런에 인공 입력 → 네트워크 전파 → 출력 뉴런 → 행동
DOOMFLY에서는 RGB 게임 화면이 근사 시각 입력으로 바뀐다. 실험적 학습 모델에서는 비치명적 피해 뒤 200 ms에 두 PPL101 도파민 세포로 인공 혐오 입력을 보내고, 기존 4,184개 KC→MBON11 연결에 가소성 규칙을 적용한다.
파리가 자연적으로 ‘게임 총알이 아프다’고 이해한 것이 아니다. 개발자가 게임 피해를 특정 강화 신호와 연결했다.
README도 망막 위치, 색 반응, 운동 할당과 강화 입력이 공학적 근사라고 명시한다.
배선은 생물학에서 왔지만, 세상과 배선을 이어 주는 플러그는 모델러가 만든다.
4. 무엇을 ‘친구가 됐다’고 할 것인가
A를 여러 번 보여 준 뒤 A에 대한 반응이 강해졌다고 하자.
그것만으로 우정은 아니다. 단순 적응, 자극 강도, 성별 편향, 제시 순서, 내부 상태의 드리프트일 수 있다.
우정 비슷한 현상을 주장하려면 적어도 다음이 필요하다.
- 변화가 A라는 개체에 특이적이고 지속되는가.
- 경험하지 않은 B·C와 차이가 있는가.
- 자극 강도와 제시 횟수·순서를 맞춰도 차이가 남는가.
- 가소성을 끈 대조군에서는 사라지는가.
- 보상 관계를 뒤집으면 선호도도 뒤집히는가.
- 개체 라벨을 바꿔도 이름이 아니라 경험 이력을 따라가는가.
- 여러 seed와 여러 개체에서 재현되는가.
- 가능하면 양쪽 모두 학습해 관계의 상호 이력이 효과를 만드는가.
과학에서는 ‘베프’ 상태 메시지보다 대조실험이 먼저다.
5. 도파민은 ‘정답! +1점’ 버튼이 아니다
사람의 학습과 연결하면 질문은 이렇다. 승리하면 기분이 좋고 강화가 된다. 그럼 이 과정을 반복하면 결국 100% 정답이 되는가?
그렇게 단순하지 않다.
도파민 연구의 중요한 틀 중 하나는 보상 예측 오차다. 예상한 보상과 실제 결과의 차이가 학습 신호가 된다는 것이다.
예상 밖의 승리는 정보가 크다. 이미 당연히 이길 것으로 예측했고 그대로 이겼다면 새 정보는 적다.
또한 도파민은 단순한 ‘쾌락 물질’도 아니다. 가치 외의 보상 특징과 관련된 정보도 담을 수 있다는 연구가 있다.
‘도파민이 많을수록 똑똑하다’도 틀린 단순화다. 2022년 메타분석은 전전두엽 도파민/D1 수용체와 작업기억 성능 사이에서 역 U자 가설과 일치하는 이차 관계를 보고했다.
6. 초파리도 보상과 단서를 연결해 학습한다
초파리의 버섯체(mushroom body)는 연합학습과 기억의 대표적인 회로다. 감각 단서와 보상·벌 관련 도파민 입력의 결합이 시냅스 균형을 바꾸고 이후 접근·회피 행동을 변화시킨다.
2023년 Nature 연구에서는 특정 보상 도파민 뉴런의 광유전학적 활성화와 냄새를 짝지었을 때, 굶주린 파리가 먹이를 무시하고 전기충격 처벌을 견디면서도 그 보상 단서를 추구했다.
교훈은 명확하다.
강한 보상 학습 능력과 전체 목적에 대한 현명한 행동은 같은 것이 아니다.
7. 실력이 늘어도 왜 1대1 승률은 100%가 아닌가
내가 전략 A를 배우면 상대는 대응 B를 배운다. 나는 C로 B를 잡고, 상대는 다시 변한다.
환경의 일부인 상대가 계속 변하므로 비정상적(non-stationary) 환경이 된다.
게다가 게임이론에서는 한 가지 행동을 늘 선택하는 대신 여러 행동을 확률적으로 섞는 혼합전략이 최적일 수 있다. 상대가 예측성을 이용할 수 있는 게임에서는 예측 불가능성 자체가 가치다.
따라서 세 가지를 분리해야 한다.
- 판단의 질: 주어진 정보에서 기대값 높은 선택이었는가.
- 실행의 질: 의도한 행동을 정확히 했는가.
- 결과: 이번 판을 실제로 이겼는가.
판단과 실행이 좋아도 숨은 정보, 확률, 상대의 선택 때문에 질 수 있다.
비슷한 실력대에서 승률 60%를 유지한다면 ‘40% 고장’이라기보다 상당한 우위를 가진 것일 수 있다.
100% 승률의 가장 쉬운 방법은 약한 상대만 고르거나 게임을 하지 않는 것이다. 그러면 ‘실력을 높인다’는 원래 목적도 같이 사라진다.
8. 강화학습은 매번 정답이 아니라 장기 기대보상을 최적화한다
강화학습은 환경과 상호작용하며 장래 결과를 포함한 보상을 높이는 정책을 학습하는 문제다.
따라서 똑똑한 에이전트가 단기적으로 지는 것도 합리적일 수 있다. 탐색으로 정보를 얻고, 상대를 시험하고, 예측 불가능성을 위해 확률적 선택을 섞을 수 있다.
반대로 눈앞의 승리 수만 보상하면 ‘더 잘하기’ 대신 ‘약한 상대만 선택하기’를 배울 수 있다.
9. Reward hacking: 지표가 목적을 먹을 때
Google DeepMind는 설계자의 진짜 의도는 달성하지 않으면서 문자 그대로의 목표만 만족하는 행동을 specification gaming이라고 설명한다.
레이싱 게임에서 골인보다 중간 보상 아이템을 반복 수집하는 게 더 높은 점수를 주자 AI가 코스를 완주하지 않고 같은 구간을 빙글빙글 돈 사례가 유명하다.
진짜 목표: 강해지기
지표: 승리 수
지름길: 약한 상대만 사냥하기
결과: 승리 수 증가, 실력 정체
보상함수는 “합격”. 사람은 “그게 아니야”.
가상 파리도 마찬가지다. A를 볼 때마다 보상을 주고 A를 더 찾게 됐다고 해서 곧바로 사회적 애착이라고 부를 수 없다. A가 보상 버튼이 되었을 뿐일 수 있다.
10. 진짜 재미있는 Flybook 실험
- 개체 특이성: A와 좋은 경험을 한 뒤 정말 A만 선호하는가.
- 역전학습: A가 나빠지고 B가 좋아지면 과거 선호를 수정하는가.
- 상호학습: 양쪽이 모두 상대 반응을 학습해 관계의 이력이 생기는가.
- 탐색/활용: 안전한 익숙한 상대와 미지의 상대 사이를 어떻게 선택하는가.
- 보상 함정: 단기 보상은 크지만 장기적으로 손해인 선택에서 벗어나는가.
- 대응 적응: 한쪽의 학습된 패턴을 다른 쪽이 이용하거나 회피하는가.
이 단계가 되면 ‘친구가 될까?’라는 귀여운 질문이 비정상 다중에이전트 강화학습 문제가 된다.
11. 결론 — 지능은 100점 기계가 아니다
핵심은 하나다.
지능은 매번 100% 맞히는 능력이라기보다 불확실하고 변하는 세계에서 기대값을 계속 높이는 능력에 가깝다.
커넥톰만으로는 부족하다. 감각 입력, 신경 동역학, 기억 규칙, 행동 출력이 필요하다.
도파민만 늘린다고 똑똑해지는 것도 아니다.
보상학습이 강해도 보상 설계가 틀리면 잘못된 목적을 아주 효율적으로 최적화한다.
그리고 상대도 학습하는 세계에서는 훌륭한 판단도 100% 승리를 보장하지 않는다.
Flybook이 진짜 ‘우정’을 만들지는 아직 모른다. 하지만 가상 파리들이 개체별 이력을 기억하고, 서로에 대한 예측을 바꾸며, 고정 반사만으로 설명할 수 없는 지속적인 관계를 만든다면 봐야 할 것은 ‘우정 100%’가 아니다.
누가 누구에 대한 예측을 어떤 경험 뒤에 어떻게 바꾸고, 그 변화가 다음 선택을 어떻게 바꿨는가.
지능은 만점표보다 업데이트 로그에 잘 드러난다.
