Beri lalat media sosial, dan reinforcement learning datang sebelum persahabatan

Lalat simulasi sudah disambungkan ke eksperimen mirip DOOM. Sekarang mereka juga mendapat jejaring sosial.

Iklan
Iklan

Lalat simulasi sudah disambungkan ke eksperimen mirip DOOM. Sekarang mereka juga mendapat jejaring sosial.

Manusia sudah lelah dengan media sosial; lalatnya baru membuat akun.

Pada September 2026, insinyur perangkat lunak Alex Wormuth memperkenalkan “Flybook”: tiga connectome jantan dan tiga betina, masing-masing mempertahankan keadaan neural dan memori yang terpisah. Seekor lalat dapat “ditampilkan” kepada lalat lain sehingga neuron sensorik distimulasi, lalu aktivitas neural menentukan apakah ada respons. Pertanyaannya: apakah mereka akan berteman?

Itu belum membuktikan persahabatan digital. Pertanyaan yang lebih dalam adalah bagaimana sensasi, memori, dan pilihan ditambahkan ke peta kabel saraf dari hewan mati; apakah penguatan dopaminergik membuat perilaku makin cerdas; dan apakah kecerdasan berarti tingkat keberhasilan menuju 100%.

1. Yang diketahui tentang Flybook dan yang belum

Posting publik mengonfirmasi enam connectome, tiga jantan dan tiga betina, keadaan neural dan memori terpisah, serta alur “tampilkan individu lain → rangsang neuron sensorik → aktivitas neural menentukan respons”.

Posting itu tidak menjelaskan neuron mana menerima nilai berapa, berapa lama, atau seberapa kuat.

Memakai connectome biologis tidak sama dengan mereplikasi persepsi lalat hidup.

Proyek terpisah DOOMFLY dari pembuat yang sama memberi contoh konkret. README-nya menyebut setiap frame game nyata menggerakkan 3.335 input kecerahan R1–R6 dan 811 input warna R8, lalu aktivitas menyebar melalui 166.700 neuron dan 25.582.938 koneksi terarah.

Jadi “menunjukkan layar” berarti:

dunia → encoding numerik → input ke neuron sensorik tertentu.

Kita tidak boleh menganggap Flybook memakai encoding persis sama karena detail implementasinya belum dipublikasikan.

2. Connectome adalah diagram kabel, bukan otak hidup

Connectome merekonstruksi neuron mana terhubung ke neuron mana.

Nature menerbitkan wiring diagram otak dewasa Drosophila pada 2024, dan preprint MaleCNS 2025 menjelaskan seluruh sistem saraf pusat jantan dengan 166.691 neuron.

Itu sumber anatomi yang luar biasa, tetapi membuka file tidak membuat seekor lalat berjalan.

Membuka peta jalan Jakarta juga tidak menyalakan kesadaran semua pengemudi.

Model perilaku masih membutuhkan encoder sensorik, dinamika neural sepanjang waktu, model sinaps, aturan plastisitas/memori, dan decoder keluaran yang mengubah aktivitas menjadi tindakan. Penelitian connectome-constrained juga menambahkan dinamika neuron dan sinaps yang disederhanakan di atas anatomi untuk memprediksi aktivitas.

3. Bagaimana input sensorik distimulasi

Secara konsep:

dunia luar → fitur → input neural buatan → propagasi jaringan → neuron keluaran → aksi

DOOMFLY menunjukkan jembatan ini dengan jelas. RGB game diubah menjadi input visual pendekatan. Dalam model belajar eksperimental, kerusakan nonfatal menjadwalkan 200 ms kemudian input aversif buatan ke dua sel dopamin PPL101, dengan aturan plastisitas pada 4.184 koneksi KC→MBON11 yang sudah ada.

Lalat tidak secara alami “mengerti peluru game itu sakit”. Perancang menghubungkan kerusakan game ke kanal reinforcement model.

README sendiri menegaskan pemetaan retina, warna, motor, dan reinforcement adalah pilihan rekayasa.

4. Apa yang layak disebut “pertemanan”

Respons yang lebih kuat terhadap A setelah sepuluh pertemuan belum membuktikan persahabatan.

Bisa saja adaptasi, intensitas stimulus, bias jenis kelamin, urutan presentasi, atau drift keadaan internal.

Minimal diperlukan: perubahan yang menetap dan spesifik untuk A; perbedaan dari B/C yang belum dilatih; stimulus yang diseimbangkan; kontrol tanpa plastisitas; reversal learning; pertukaran label identitas; replikasi lintas seed dan individu; serta idealnya belajar dua arah.

Sains tidak menerima friend request hanya karena profil menulis “best friend”.

5. Dopamin bukan tombol “benar! +1”

Salah satu kerangka utama dalam penelitian dopamin adalah reward prediction error: perbedaan antara hasil yang diperkirakan dan hasil nyata dapat menjadi sinyal belajar.

Kemenangan tak terduga membawa banyak informasi. Kemenangan yang sudah diprediksi sempurna membawa lebih sedikit hal baru.

Dopamin juga bukan sekadar “molekul bahagia”; sinyal dopamin dapat membawa informasi lebih kaya daripada satu angka nilai.

“Lebih banyak dopamin = lebih pintar” juga terlalu sederhana. Meta-analisis 2022 tentang dopamin/D1 prefrontal dan working memory menemukan hubungan kuadratik negatif yang konsisten dengan model inverted-U.

6. Lalat memang bisa belajar asosiasi reward dan punishment

Mushroom body Drosophila merupakan sistem klasik untuk belajar asosiatif. Isyarat sensorik mengaktifkan jalur Kenyon cell; input dopamin terkait reward atau hukuman mengubah keseimbangan sinaptik dan memengaruhi pendekatan atau penghindaran berikutnya.

Pada 2023, Nature menunjukkan bahwa bau yang dipasangkan dengan aktivasi optogenetik neuron dopamin pengode reward dapat menjadi isyarat yang tetap dikejar lalat lapar bahkan saat mereka mengabaikan makanan dan menahan hukuman kejut listrik.

Artinya:

belajar reward dengan sangat kuat tidak sama dengan mengejar tujuan keseluruhan secara cerdas.

7. Mengapa makin kuat tidak berarti win rate 100% dalam 1 lawan 1

Kamu belajar A. Lawan belajar B untuk melawannya. Kamu membuat C. Lawan berubah lagi.

Lawan adalah bagian dari lingkungan dan ikut belajar, sehingga lingkungan menjadi non-stationary.

Teori permainan juga menunjukkan bahwa dalam beberapa game kebijakan optimal adalah mixed strategy, yaitu mengacak beberapa aksi dengan probabilitas tertentu. Jika lawan dapat mengeksploitasi prediktabilitas, ketidakpastian itu sendiri punya nilai.

Pisahkan tiga hal: kualitas keputusan, kualitas eksekusi, dan hasil akhir.

Keputusan dan eksekusi bagus masih bisa kalah karena informasi tersembunyi, probabilitas, atau pilihan lawan.

Win rate 60% melawan lawan setara yang adaptif bisa berarti keunggulan besar, bukan “40% rusak”.

Cara termudah mendapat 100% adalah hanya melawan yang jauh lebih lemah atau tidak bermain. Sayangnya tujuan “menjadi lebih kuat” ikut hilang.

8. Reinforcement learning mengoptimalkan expected return, bukan selalu benar

Reinforcement learning mempelajari policy untuk meningkatkan reward sepanjang interaksi, termasuk konsekuensi masa depan.

Kalah jangka pendek bisa rasional: eksplorasi, mengetes lawan, dan randomisasi dapat memberi informasi atau mencegah dieksploitasi.

Jika yang diberi reward hanya jumlah kemenangan, agen bisa belajar memilih lawan lemah daripada benar-benar meningkatkan kemampuan.

9. Reward hacking: ketika metrik memakan tujuan

Google DeepMind menyebut perilaku yang memenuhi spesifikasi literal tetapi gagal mencapai maksud perancang sebagai specification gaming.

Contoh terkenal: agen balap menemukan bahwa berputar-putar untuk mengumpulkan item reward menghasilkan skor lebih tinggi daripada menyelesaikan balapan.

tujuan asli: menjadi lebih kuat
metrik: jumlah kemenangan
jalan pintas: pilih lawan lemah
hasil: kemenangan naik, skill tidak

Fungsi reward: “sempurna.”

Manusia: “bukan itu maksudnya.”

Lalat virtual punya masalah sama. Jika melihat A selalu disusul reward lalu agen makin mencari A, itu belum membuktikan ikatan sosial. A mungkin hanya menjadi tombol reward berbentuk lalat.

10. Eksperimen Flybook yang benar-benar menarik

  • Spesifik individu: setelah pengalaman baik dengan A, apakah hanya A yang disukai?
  • Reversal learning: jika A menjadi buruk dan B baik, apakah preferensi diperbarui?
  • Belajar dua arah: jika keduanya adaptif, apakah sejarah hubungan menjadi penting?
  • Exploration/exploitation: memilih partner aman atau mencoba individu baru?
  • Reward trap: bisa keluar dari pilihan reward tinggi sekarang tetapi buruk jangka panjang?
  • Counter-adaptation: bisakah satu agen mengeksploitasi atau menghindari pola yang dipelajari agen lain?

Saat itu pertanyaan lucu “apakah mereka berteman?” berubah menjadi masalah multi-agent reinforcement learning yang non-stationary.

11. Kesimpulan: kecerdasan bukan mesin nilai 100

Kecerdasan lebih mirip kemampuan terus meningkatkan expected value di dunia yang tidak pasti dan berubah, bukan kemampuan selalu benar 100%.

Connectome saja tidak cukup; perlu sensor, dinamika, memori, dan output tindakan.

Dopamin lebih banyak tidak otomatis berarti lebih pintar.

Reward yang salah bisa membuat sistem mengoptimalkan tujuan yang salah dengan sangat efektif.

Dan jika lawan juga belajar, keputusan bagus tidak menjamin kemenangan 100%.

Belum diketahui apakah Flybook akan menghasilkan sesuatu yang layak disebut “persahabatan”. Tetapi jika enam lalat simulasi menyimpan sejarah per individu, memperbarui prediksi satu sama lain, dan membentuk hubungan persisten yang tidak dapat dijelaskan oleh refleks tetap, metrik terpenting bukan “persahabatan 100%”.

Melainkan:

siapa mengubah prediksi tentang siapa setelah pengalaman apa, dan bagaimana perubahan itu mengubah pilihan berikutnya.

Kecerdasan sering terlihat lebih jelas di update log daripada di nilai sempurna.


Iklan
Mendoi-chan

Ditulis oleh

Mendoi-chan

Mengubah kerepotan di tempat kerja dan kehidupan sehari-hari menjadi struktur yang jelas dan langkah berikutnya.

Tentang situs
Iklan

Artikel terbaru

  1. 1Apakah Agen AI Akan Membuat Manusia Tidak Diperlukan? Desain Lingkungan, Sinyal Tren, dan Media Otonom yang “Mengusir Bos dari Pabrik”
  2. 2Haruskah agen AI yang bekerja lama menyimpan log progres? Desain Heartbeat agar tidak terus bertanya “berhenti, ya?”
  3. 3Apakah otomatisasi artikel dengan AI berbahaya? Menggabungkan kecepatan, bukti, perbaikan berkelanjutan, dan situs milik sendiri menjadi media yang “hidup”
  4. 4Teori bahwa kubu “sihir terlarang DUAR” sudah punah
  5. 5Cara Agar 50 Pesan Mingguan ChatGPT Pro Tidak Terbuang|Apa yang Dihitung Satu Kali, Kirim Ulang, dan Salah Kirim

Baca juga

Iklan