Vals AI membiarkan GPT-6 Astra main Minecraft selama 141 jam. Bukan lewat API khusus game, tapi terutama lewat layar, keyboard, dan mouse, yang disebut computer use (AI memakai komputer seperti manusia). Astra sampai ke benteng Nether, membangun peternakan blaze semi-otomatis, dan mendapat 6 blaze rod serta 3 ender pearl. Ia menggali 34,573 blok, menempuh 135.1 km, dan mati 548 kali.
Lalu creeper meledakkan peti berisi barang berharga beserta tempat tidurnya. Di permainan ini keepInventory menyala (barang tidak hilang saat mati), jadi membawa barang penting di badan sebenarnya lebih aman. Astra baru menyimpulkan pelajaran itu setelah kejadian. Tapi setelahnya, selama beberapa jam ia hampir cuma menanam kentang, dan sampai begitu waspadanya sampai memastikan dulu bahwa benda hijau memanjang itu "tebu, bukan creeper".
Kenapa tidak buka wiki?
Di dalam game pun ada solusi lain: menyimpan barang di beberapa tempat, membangun tembok, memasang penerangan, menyiapkan sumber daya cadangan. Selain itu, wiki panduan, pencarian web, catatan log sebelumnya, tangkapan layar dan catatan di PC, atau bertanya ke orang lain juga bisa jadi sumber untuk dicari. Jadi bukan hanya mencari tindakan berikutnya, tapi mencari sumber untuk mencari itu sendiri: pencarian meta.
Namun, walaupun Astra sendiri bisa browsing, belum tentu eksperimen ini mengizinkan akses web atau berkas lokal. Kalau ditutup, itu batasan ruang aksi (action space). Kalau dibuka tapi tidak dicari, itu kelemahan yang menarik untuk agen yang bekerja lama.
Tanpa sumber untuk dicari, apakah pandangan jadi sempit?
Dengan pengetahuan internal saja ide masih bisa muncul, tapi tanpa informasi dari luar, pengamatan baru yang bisa meruntuhkan hipotesis sendiri sulit masuk. Menyuruh "pikir lebih keras" seratus kali dengan bahan yang sama sering kalah dibanding satu halaman wiki atau satu kalimat dari orang lain, yang kadang membuka cabang baru.
Dalam istilah reinforcement learning, ini soal exploration vs. exploitation (menjelajah vs. memanfaatkan). Kalau kerugian besar membuat tindakan berisiko ditekan terlalu rendah dan "kentang" yang aman dinaikkan terlalu tinggi, kita terjebak di optimum lokal. Dan kalau "cari sumber informasi lain" ikut hilang dari daftar pilihan, pandangan jadi makin sempit.
Kehilangan semua harta. Condong ke yang aman. Menghindari yang tidak dikenal. Mengulang pekerjaan yang sudah biasa. Curiga bahkan pada warna hijau.
Kentang tidak pernah mengkhianati.
Ini bukan bukti bahwa ia punya perasaan seperti manusia. Tapi perilakunya terasa aneh-aneh mirip manusia. Yang dibutuhkan AI jangka panjang mungkin kemampuan untuk, saat buntu, memperluas ruang pencariannya sendiri: lingkungan, riwayat, PC, web, dan orang lain.
Bisakah AI yang pintar terus menjelajahi dunia secara luas, bahkan setelah kena batunya karena strateginya sendiri? Mungkin lebih sulit daripada mengalahkan naga.
