Vals AI 让 GPT-6 Astra 玩了141小时《我的世界》(Minecraft)。没有用专门的游戏接口,而是主要靠屏幕、键盘和鼠标操作,也就是所谓的 computer use(让 AI 像人一样操作电脑)。Astra 一路打到了下界要塞,建起半自动的烈焰人刷怪塔,拿到6根烈焰棒和3颗末影珍珠。它挖了34,573个方块,走了135.1公里,死了548次。
结果,苦力怕把装着贵重物品的箱子和床一起炸了。这一局开着 keepInventory(死亡不掉落物品),所以重要的东西带在身上反而更安全。Astra 是出事之后才想明白这个道理的。可接下来的好几个小时,它几乎只种土豆,还警惕到连一个绿色的细长物体都要确认一句"这是甘蔗,不是苦力怕"。
为什么不去查攻略 Wiki?
就算只在游戏里,也还有别的办法:把物品分开存放、造防护墙、加照明、备好应急资源。除此之外,攻略 Wiki、网页搜索、过去的日志、电脑里的截图和笔记,还有直接问人,都可以是探索的来源。也就是说,不只是找"下一步做什么",更是去找"该去哪儿找",这是一种元搜索。
不过,即使 Astra 本身具备上网能力,也不代表这次实验允许它访问网络或本地文件。如果被关掉了,那是行动空间(action space)的限制;如果开着它却没去查,那对长期运行的智能体来说就是个很有意思的弱点。
没有可探索的来源,视野会变窄吗?
只靠内部知识也能想出办法,但没有外部信息,能打破自己假设的新观察就很难进来。拿同样的材料对它喊一百遍"再好好想想",还不如一页 Wiki 或别人的一句话,往往就能长出新的分支。
用强化学习的话说,这就是探索与利用(exploration vs. exploitation)。如果大亏一次之后把危险行为压得太低、把安全的"土豆"抬得太高,就会陷进局部最优。要是连"去找别的信息来源"也从候选项里掉了,视野就更窄了。
失去全部家当。往安全的一边靠。躲开未知。重复熟悉的活儿。连绿色都要怀疑。
土豆不会背叛你。
这并不能证明它和人有同样的情感。但它的行为,怎么看都透着一股人味儿。长期工作的 AI 需要的,也许是在卡住的时候,把探索空间本身扩大:环境、历史记录、电脑、网络,还有其他人。
聪明的 AI,在被自己的策略狠狠坑过之后,还能继续广泛地探索世界吗? 大概比打末影龙还难。
