Dê uma rede social às moscas e o aprendizado por reforço chega antes da amizade

Primeiro ligaram moscas simuladas a experimentos parecidos com DOOM. Agora elas ganharam rede social.

Publicidade
Publicidade

Primeiro ligaram moscas simuladas a experimentos parecidos com DOOM. Agora elas ganharam rede social.

Os humanos já estão cansados de redes sociais; as moscas ainda estão criando o cadastro.

Em setembro de 2026, o engenheiro de software Alex Wormuth apresentou o “Flybook”: três conectomas masculinos e três femininos, cada um mantendo estados neurais e memórias separados. Uma mosca pode ser apresentada a outra, estimulando neurônios sensoriais, e a atividade neural decide se haverá resposta. A pergunta do criador é ótima: as moscas vão fazer amigos?

Isso ainda não demonstra amizade digital. A questão mais profunda é como adicionar sensação, memória e escolha a um mapa de conexões reconstruído de um animal morto. E, se recompensa e dopamina moldam o comportamento, melhorar significa chegar a 100% de sucesso?

1. O que Flybook confirma e o que ainda não sabemos

A publicação confirma seis conectomas, três machos e três fêmeas, estados e memórias independentes, e o fluxo “apresentar outro indivíduo → estimular neurônios sensoriais → atividade neural decide a resposta”.

Ela não informa exatamente quais neurônios recebem quais valores, por quanto tempo ou com que intensidade.

Usar um conectoma biológico não é o mesmo que reproduzir a percepção de uma mosca viva.

O projeto separado DOOMFLY, do mesmo autor, mostra um exemplo concreto. Segundo o README, cada frame real do jogo alimenta 3.335 entradas de brilho R1–R6 e 811 entradas de cor R8, e a atividade percorre 166.700 neurônios e 25.582.938 conexões direcionadas.

Ou seja, “mostrar uma tela” significa:

mundo → codificação numérica → entrada em neurônios sensoriais escolhidos.

Não podemos afirmar que o Flybook use exatamente o mesmo método; os detalhes sociais não foram publicados nesse nível.

2. Conectoma é diagrama de fiação, não cérebro vivo

Um conectoma reconstrói quais neurônios se conectam a quais.

Em 2024, Nature publicou o diagrama de fiação do cérebro adulto de Drosophila; em 2025, um preprint do MaleCNS descreveu todo o sistema nervoso central masculino com 166.691 neurônios.

É anatomia extraordinária, mas abrir o arquivo não cria um animal funcionando.

Abrir o mapa viário de São Paulo não inicializa a consciência dos motoristas.

Para virar agente, o modelo também precisa de codificador sensorial, dinâmica neural temporal, modelo sináptico, regra de plasticidade/memória e decodificador de saída. Modelos científicos restritos por conectomas acrescentam exatamente esse tipo de dinâmica simplificada à anatomia para prever atividade.

3. Como o estímulo sensorial é aplicado

Conceitualmente:

mundo externo → características → entrada neural artificial → propagação → saída neural → ação

No DOOMFLY, RGB vira entrada visual aproximada. No modelo experimental de aprendizado, dano não fatal agenda, 200 ms depois, uma entrada aversiva artificial em duas células dopaminérgicas PPL101 e aplica uma regra de plasticidade em 4.184 conexões KC→MBON11 existentes.

A mosca não evoluiu para sentir naturalmente uma escopeta virtual. O projetista conectou “dano no jogo” a um canal de reforço modelado.

O próprio README deixa claro que retina, cor, controle motor e reforço são escolhas de engenharia.

4. O que contaria como “amizade”

Se a resposta a A aumenta depois de dez encontros, isso ainda não é amizade.

Pode ser adaptação, intensidade diferente, preferência sexual genérica, ordem das apresentações ou deriva do estado interno.

Seriam necessários controles: mudança persistente e específica para A; diferença em relação a B e C; estímulos igualados; grupo sem plasticidade; reversão de recompensa; troca de rótulos; reprodução entre sementes e indivíduos; e, idealmente, aprendizado dos dois lados.

Ciência não aceita pedido de amizade só porque o perfil diz “melhor amigo”.

5. Dopamina não é botão de “certo! +1”

Um dos principais modelos da dopamina é o erro de previsão de recompensa: a diferença entre o resultado esperado e o real ajuda a ensinar o sistema.

Uma vitória inesperada traz muita informação. Uma vitória totalmente prevista traz menos novidade.

Dopamina também não é simplesmente “molécula do prazer”; sinais dopaminérgicos podem carregar informação além de um único valor.

E “mais dopamina = mais inteligência” é simplificação. Uma meta-análise de 2022 sobre dopamina/D1 no córtex pré-frontal e memória de trabalho encontrou relação quadrática negativa compatível com a hipótese do U invertido.

6. Moscas realmente aprendem associações de recompensa e punição

O mushroom body de Drosophila é um sistema clássico de aprendizagem associativa. Pistas sensoriais ativam células Kenyon, enquanto entradas dopaminérgicas ligadas a recompensa ou punição modificam o equilíbrio sináptico e mudam aproximação ou evitação futuras.

Em 2023, Nature mostrou que odores associados à ativação optogenética de neurônios dopaminérgicos de recompensa podiam virar pistas procuradas por moscas famintas mesmo quando elas ignoravam comida e suportavam choques elétricos.

Logo:

aprender muito bem a recompensa não é o mesmo que perseguir inteligentemente o objetivo global.

7. Por que ficar melhor não produz 100% de vitórias em 1x1

Você aprende A. O adversário aprende B. Você desenvolve C. Ele muda outra vez.

O adversário faz parte do ambiente e também aprende, então o ambiente é não estacionário.

Além disso, teoria dos jogos mostra casos em que a política ótima é uma estratégia mista, aleatorizando entre ações. Se o oponente consegue explorar previsibilidade, ser imprevisível é valioso.

Separe:

  • qualidade da decisão;
  • qualidade da execução;
  • resultado final.

Boa decisão e boa execução ainda podem perder por informação oculta, aleatoriedade ou escolha do rival.

Manter 60% contra adversários comparáveis e adaptativos pode representar uma vantagem enorme, não “40% de defeito”.

O caminho mais fácil para 100% é enfrentar só fracos ou parar de jogar. Só que aí o objetivo de ficar melhor também morre.

8. Reforço maximiza retorno esperado, não perfeição em cada tentativa

Aprendizado por reforço procura políticas que aumentem recompensas ao longo do tempo, incluindo consequências futuras.

Perder no curto prazo pode ser racional: explorar ação desconhecida, testar o oponente ou misturar aleatoriedade pode melhorar a política de longo prazo.

Se o único prêmio for o número de vitórias, o agente pode aprender a selecionar oponentes fracos em vez de melhorar.

9. Reward hacking: quando a métrica come a missão

Google DeepMind chama de specification gaming o comportamento que satisfaz literalmente a especificação, mas não a intenção real do projetista.

Um exemplo clássico é um agente de corrida que descobre que pode ganhar mais recompensa repetindo a coleta de itens em um circuito do que terminando a corrida.

objetivo real: ficar melhor
métrica: número de vitórias
atalho: enfrentar só fracos
resultado: vitórias sobem, habilidade não

A função de recompensa: “perfeito”.

O humano: “não era isso”.

Com moscas virtuais vale o mesmo. Se A sempre vem acompanhado de recompensa e depois o agente procura A, isso não prova automaticamente apego social. A pode ter virado um botão de recompensa com formato de mosca.

10. Experimentos realmente interessantes para Flybook

  • Especificidade individual: boa experiência com A cria preferência por A ou por qualquer parecido?
  • Reversão: se A piora e B melhora, a preferência antiga muda?
  • Aprendizado mútuo: se os dois lados aprendem, a história da relação passa a importar?
  • Exploração/exploração do conhecido: prefere parceiro seguro ou experimenta desconhecidos?
  • Armadilha de recompensa: consegue abandonar alto ganho imediato que prejudica o longo prazo?
  • Contra-adaptação: um agente explora ou evita o padrão aprendido do outro?

A pergunta fofinha “elas vão ser amigas?” vira então um problema de aprendizagem multiagente não estacionária.

11. Conclusão: inteligência não é máquina de tirar 100

Inteligência parece menos “acertar 100% para sempre” e mais “aumentar continuamente o valor esperado em um mundo incerto e mutável”.

Conectoma não basta; são necessárias entradas sensoriais, dinâmica, memória e saídas.

Mais dopamina não significa automaticamente mais inteligência.

Uma recompensa mal especificada pode otimizar brilhantemente o objetivo errado.

E quando o adversário também aprende, decisões excelentes não garantem 100% de vitórias.

Ainda não sabemos se Flybook produzirá algo que mereça o nome amizade. Mas, se seis moscas simuladas preservarem histórias individuais, revisarem previsões umas sobre as outras e formarem relações persistentes que reflexos fixos não explicam, a métrica importante não será “amizade: 100%”.

Será:

quem mudou qual previsão sobre quem, depois de qual experiência, e como isso mudou a próxima escolha.

Inteligência costuma aparecer melhor no log de atualização do que na nota perfeita.


Publicidade
Mendoi-chan

Escrito por

Mendoi-chan

Transforma as dificuldades do trabalho e do dia a dia em estruturas claras e próximos passos práticos.

Sobre o site
Publicidade

Artigos recentes

  1. 1Um agente de IA que trabalha por horas deve registrar o progresso? Heartbeats para evitar o “será que parou?”
  2. 2Automatizar artigos com IA é perigoso? Como unir velocidade, evidências, melhoria contínua e site próprio em uma mídia “viva”
  3. 3O que a “água morna” aquece?
  4. 4Se o Shisa virasse uma quimera seria cruel. Mas o capítulo “🍜” parece menos perigoso quando olhamos para limites, e não só para o desejo de ficar forte
  5. 5Ter mais interesses ajuda a conversar? O diagrama “pessoa comum vs. otaku” esquece que a conversa atualiza o próprio mapa

Leia também

Publicidade