Vals AIはGPT-6 AstraにMinecraftを141時間プレイさせた。専用ゲームAPIではなく画面・キーボード・マウス中心のcomputer use。Astraはネザー要塞へ進み、半自動ブレイズファームを作り、ブレイズロッド6本とエンダーパール3個を獲得。34,573ブロックを掘り、135.1km移動し、548回死んだ。
ところがクリーパーが貴重品入りチェストとベッドを爆破。このランは keepInventory ONなので、重要物は身体に持つ方が安全だった。Astraは事後にその教訓を導いたが、その後数時間ほぼジャガイモを栽培し、緑の細長い物体を「サトウキビでクリーパーではない」と確認するほど警戒した。
なぜWikiを見ない?
ゲーム内でも分散保管、防壁、照明、予備資源など別解はある。さらに攻略Wiki、Web検索、過去ログ、PC内のスクリーンショットやメモ、人への質問も探索元になりうる。つまり、行動を探すだけでなく探索元そのものを探すメタ探索だ。
ただしAstra自体にブラウジング能力があっても、この実験でWebやローカルファイルが許可されたとは限らない。閉じられていたならaction spaceの制約。開いていたのに探さなかったなら、長期エージェントとして面白い弱点になる。
探索元がないと視野は狭くなる?
内部知識だけでも案は出せるが、外部情報がなければ自分の仮説を壊す新観測が入りにくい。同じ材料で100回「もっと考えろ」と言うより、Wiki一ページや他人の一言が新しい枝を作ることがある。
強化学習風には exploration vs. exploitation。大損失で危険行動を下げすぎ、安全な「ジャガイモ」を上げすぎれば局所解に沈む。さらに「別の情報源を探す」ことまで候補から落ちれば視野はもっと狭くなる。
全財産を失う。安全策に寄る。未知を避ける。慣れた仕事を繰り返す。緑色まで疑う。
ジャガイモは裏切らない。
人間と同じ感情の証拠ではない。でも行動は妙に人間くさい。長期AIに必要なのは、詰まったら と問い、環境・履歴・PC・Web・他者へ探索空間そのものを広げる能力なのかもしれない。
賢いAIは、自分の戦略で痛い目を見た後も、世界を広く探索し続けられるのか? たぶんドラゴンより難しい。
