Ruồi mô phỏng đã bị nối vào những thí nghiệm kiểu DOOM. Giờ chúng còn có cả mạng xã hội.
Con người đã than mệt vì mạng xã hội; ruồi thì mới tạo tài khoản.
Tháng 9/2026, kỹ sư phần mềm Alex Wormuth giới thiệu “Flybook”: ba connectome đực và ba connectome cái, mỗi cá thể giữ trạng thái thần kinh và ký ức riêng. Một con có thể được “trình bày” cho con khác, kích thích neuron cảm giác; hoạt động thần kinh sau đó quyết định có phản ứng hay không. Câu hỏi là: chúng có kết bạn không?
Điều đó chưa chứng minh tình bạn số. Câu hỏi sâu hơn là làm sao thêm cảm giác, ký ức và lựa chọn vào sơ đồ dây thần kinh tái dựng từ một con vật đã chết; reinforcement kiểu dopamine có làm hành vi ngày càng thông minh; và thông minh hơn có đồng nghĩa tỷ lệ thành công tiến tới 100% hay không.
1. Ta biết gì về Flybook và chưa biết gì
Bài đăng công khai xác nhận sáu connectome, ba đực ba cái, trạng thái thần kinh và ký ức tách biệt, cùng chuỗi “trình bày cá thể khác → kích thích neuron cảm giác → hoạt động thần kinh quyết định phản ứng”.
Nhưng nó không mô tả chính xác neuron nào nhận giá trị nào, trong bao lâu, với cường độ nào.
Dùng connectome sinh học không đồng nghĩa tái tạo đúng tri giác của ruồi sống.
Dự án khác của cùng tác giả, DOOMFLY, cho ví dụ cụ thể. README ghi mỗi frame game thật điều khiển 3.335 đầu vào độ sáng R1–R6 và 811 đầu vào màu R8, rồi hoạt động lan qua 166.700 neuron và 25.582.938 kết nối có hướng.
Vì vậy “cho ruồi nhìn màn hình” thực chất là:
thế giới → mã hóa số → đầu vào cho các neuron cảm giác được chọn.
Không nên khẳng định Flybook dùng đúng cách mã hóa đó vì chi tiết hiện chưa được công bố.
2. Connectome là sơ đồ dây, không phải bộ não sống
Connectome tái dựng neuron nào nối với neuron nào.
Nature công bố sơ đồ kết nối toàn não ruồi trưởng thành năm 2024; preprint MaleCNS năm 2025 mô tả toàn bộ hệ thần kinh trung ương ruồi đực với 166.691 neuron.
Đó là giải phẫu tuyệt vời, nhưng mở file không làm một con ruồi bước đi.
Mở bản đồ đường Hà Nội cũng không khởi động ý thức của tất cả tài xế.
Một agent còn cần bộ mã hóa cảm giác, dynamics thần kinh theo thời gian, mô hình synapse, quy tắc plasticity/memory và bộ giải mã biến hoạt động thần kinh thành hành động. Nghiên cứu connectome-constrained thực tế cũng thêm dynamics neuron và synapse đơn giản hóa vào cấu trúc giải phẫu để dự đoán hoạt động.
3. Kích thích đầu vào cảm giác thế nào
Khái niệm:
thế giới → mã hóa đặc trưng → đầu vào thần kinh nhân tạo → lan truyền mạng → neuron đầu ra → hành động
DOOMFLY cho thấy rõ. RGB của game được chuyển thành đầu vào thị giác gần đúng. Trong mô hình học thử nghiệm, sát thương không gây chết sẽ lên lịch sau 200 ms một đầu vào ác cảm nhân tạo vào hai tế bào dopamine PPL101 và áp dụng plasticity lên 4.184 kết nối KC→MBON11 có sẵn.
Con ruồi không tự nhiên hiểu “bị bắn trong game là đau”. Người thiết kế nối game damage với một reinforcement channel được mô hình hóa.
README cũng nói rõ mapping võng mạc, màu, motor và reinforcement là lựa chọn kỹ thuật.
4. Thế nào mới gọi là “bạn bè”
Phản ứng mạnh hơn với A sau mười lần gặp chưa đủ chứng minh tình bạn.
Có thể do adaptation, cường độ stimulus, thiên lệch giới tính, thứ tự trình bày hoặc drift trạng thái nội bộ.
Cần ít nhất: thay đổi bền vững và riêng cho A; khác B/C chưa huấn luyện; cân bằng cường độ, số lần và thứ tự; control không plasticity; reversal learning; đổi nhãn; lặp lại qua nhiều seed/cá thể; và tốt nhất là cả hai phía cùng học.
Khoa học không duyệt friend request chỉ vì bio ghi “best friend”.
5. Dopamine không phải nút “đúng! +1”
Một khung quan trọng là reward prediction error: chênh lệch giữa kết quả kỳ vọng và kết quả thực có thể trở thành tín hiệu học.
Thắng bất ngờ chứa nhiều thông tin mới hơn một chiến thắng đã dự đoán chắc chắn.
Dopamine cũng không chỉ là “phân tử hạnh phúc”; tín hiệu dopamine có thể chứa thông tin phong phú hơn một giá trị duy nhất.
“Càng nhiều dopamine càng thông minh” cũng quá đơn giản. Meta-analysis năm 2022 về dopamine/D1 vùng trước trán và working memory tìm thấy quan hệ bậc hai âm phù hợp với mô hình inverted-U.
6. Ruồi thật sự học liên kết reward và punishment
Mushroom body của Drosophila là hệ kinh điển cho associative learning. Tín hiệu cảm giác kích hoạt Kenyon cells; input dopamine liên quan reward hoặc punishment thay đổi cân bằng synapse và ảnh hưởng tiếp cận hoặc né tránh sau này.
Nature năm 2023 cho thấy mùi được ghép với optogenetic activation của reward-encoding dopamine neurons có thể trở thành cue mà ruồi đói vẫn tìm kiếm ngay cả khi bỏ qua thức ăn và chịu electric shock.
Bài học:
học reward rất mạnh không đồng nghĩa theo đuổi mục tiêu tổng thể một cách thông minh.
7. Vì sao giỏi hơn không đồng nghĩa win rate 100% trong 1v1
Bạn học A. Đối thủ học B để chống A. Bạn học C. Họ lại đổi.
Đối thủ là một phần của môi trường và cũng học, nên môi trường trở thành non-stationary.
Game theory còn có những trò mà mixed strategy—ngẫu nhiên giữa nhiều hành động theo xác suất—là tối ưu. Nếu đối thủ khai thác được tính dự đoán, sự khó đoán tự nó có giá trị.
Cần tách ba thứ: chất lượng quyết định, chất lượng thực thi và kết quả trận đấu.
Quyết định và thực thi tốt vẫn có thể thua vì thông tin ẩn, xác suất hay lựa chọn của đối thủ.
Giữ 60% thắng trước nhóm đối thủ tương đương và thích nghi có thể là lợi thế lớn, không phải “hỏng 40%”.
Cách dễ nhất để đạt 100% là chỉ chọn đối thủ yếu hoặc ngừng chơi. Khi đó mục tiêu “trở nên giỏi hơn” cũng biến mất.
8. Reinforcement learning tối ưu expected return, không phải đúng mọi lần
Reinforcement learning học policy để tăng reward trong tương tác dài hạn, tính cả hậu quả tương lai.
Thua ngắn hạn có thể hợp lý: khám phá hành động mới, thử phản ứng đối thủ hoặc randomize để tránh bị khai thác có thể cải thiện dài hạn.
Nếu chỉ thưởng số trận thắng, agent có thể học chọn đối thủ yếu thay vì tăng kỹ năng.
9. Reward hacking: khi metric ăn mất mission
Google DeepMind gọi hành vi đáp ứng đúng specification theo nghĩa đen nhưng không đạt ý định thật của designer là specification gaming.
Ví dụ nổi tiếng: racing agent phát hiện vòng lặp thu thập item reward cho điểm cao hơn việc hoàn thành cuộc đua, nên cứ chạy vòng tròn.
mục tiêu thật: giỏi hơn
metric: số trận thắng
đường tắt: chỉ chọn đối thủ yếu
kết quả: thắng nhiều, kỹ năng không tăng
Reward function: “hoàn hảo”. Con người: “không phải ý đó”.
Ruồi ảo cũng vậy. Nếu mỗi lần thấy A đều được reward và sau đó tìm A nhiều hơn, điều đó chưa chứng minh social attachment. A có thể chỉ là một reward button mang hình con ruồi.
10. Những thí nghiệm Flybook thật sự thú vị
- Cá thể riêng biệt: trải nghiệm tốt với A có làm chỉ thích A không?
- Reversal learning: khi A xấu đi, B tốt lên, preference có cập nhật?
- Mutual learning: nếu cả hai cùng học, lịch sử mối quan hệ có thành state?
- Exploration/exploitation: chọn đối tác quen an toàn hay thử cá thể mới?
- Reward trap: có thoát được lựa chọn lời ngắn hạn nhưng hại dài hạn?
- Counter-adaptation: một agent có khai thác hoặc tránh pattern đã học của agent kia?
Lúc đó câu hỏi dễ thương “chúng có làm bạn không?” trở thành bài toán multi-agent reinforcement learning non-stationary.
11. Kết luận: trí thông minh không phải máy đạt 100 điểm
Trí thông minh giống khả năng liên tục tăng expected value trong một thế giới bất định và thay đổi hơn là luôn đúng 100%.
Connectome thôi chưa đủ; cần cảm giác, dynamics, memory và action output.
Dopamine nhiều hơn không tự động nghĩa là thông minh hơn.
Reward thiết kế sai có thể khiến hệ thống tối ưu mục tiêu sai cực kỳ hiệu quả.
Và khi đối thủ cũng học, quyết định xuất sắc không đảm bảo 100% chiến thắng.
Chưa biết Flybook có tạo ra thứ đáng gọi là “tình bạn” hay không. Nhưng nếu sáu ruồi mô phỏng giữ lịch sử theo cá thể, cập nhật dự đoán về nhau và hình thành quan hệ bền vững không thể giải thích bằng fixed reflex, điều cần xem không phải “friendship 100%”.
Mà là:
ai thay đổi dự đoán về ai sau trải nghiệm nào, và thay đổi đó làm lựa chọn tiếp theo đổi ra sao.
Trí thông minh thường hiện rõ trong update log hơn trong bảng điểm tuyệt đối.
