Vals AI 讓 GPT-6 Astra 玩了141小時的《Minecraft(當個創世神)》。沒有用專屬的遊戲介面,而是主要靠螢幕、鍵盤和滑鼠操作,也就是所謂的 computer use(讓 AI 像人一樣操作電腦)。Astra 一路打到地獄要塞,蓋出半自動的烈焰使者刷怪塔,拿到6根烈焰棒和3顆終界珍珠。它挖了34,573個方塊,走了135.1公里,死了548次。
結果,苦力怕把裝著貴重物品的箱子和床一起炸了。這一局開著 keepInventory(死亡不掉落物品),所以重要的東西帶在身上反而更安全。Astra 是出事之後才想通這個道理的。可接下來好幾個小時,它幾乎只種馬鈴薯,還謹慎到連一個綠色的細長物體都要確認一句「這是甘蔗,不是苦力怕」。
為什麼不去查攻略 Wiki?
就算只在遊戲裡,也還有別的辦法:把物品分開存放、蓋防護牆、加照明、備好應急資源。除此之外,攻略 Wiki、網路搜尋、過去的紀錄、電腦裡的螢幕截圖和筆記,還有直接問人,都可以是探索的來源。也就是說,不只是找「下一步做什麼」,更是去找「該去哪裡找」,這是一種元搜尋。
不過,即使 Astra 本身具備上網能力,也不代表這次實驗允許它存取網路或本機檔案。如果被關掉了,那是行動空間(action space)的限制;如果開著它卻沒去查,那對長期運作的代理(agent)來說就是個很有意思的弱點。
沒有可探索的來源,視野會變窄嗎?
只靠內部知識也能想出辦法,但沒有外部資訊,能打破自己假設的新觀察就很難進來。拿同樣的材料對它喊一百遍「再好好想想」,還不如一頁 Wiki 或別人的一句話,往往就能長出新的分支。
用強化學習的話來說,這就是探索與利用(exploration vs. exploitation)。如果大虧一次之後把危險行為壓得太低、把安全的「馬鈴薯」抬得太高,就會陷進局部最佳解。要是連「去找別的資訊來源」也從候選項裡掉了,視野就更窄了。
失去全部家當。往安全的一邊靠。躲開未知。重複熟悉的工作。連綠色都要懷疑。
馬鈴薯不會背叛你。
這並不能證明它和人類有同樣的情感。但它的行為,怎麼看都透著一股人味。長期工作的 AI 需要的,也許是在卡住的時候,把探索空間本身擴大:環境、歷史紀錄、電腦、網路,還有其他人。
聰明的 AI,在被自己的策略狠狠坑過之後,還能繼續廣泛地探索世界嗎? 大概比打終界龍還難。
