Vals AI a laissé GPT-6 Astra jouer à Minecraft pendant 141 heures. Pas d'API spéciale pour le jeu : l'IA a surtout travaillé avec l'écran, le clavier et la souris, ce qu'on appelle le « computer use » (l'IA utilise l'ordinateur comme une personne). Astra a atteint une forteresse du Nether, construit une ferme à blazes semi-automatique et récupéré 6 bâtons de blaze et 3 perles d'Ender. Elle a creusé 34,573 blocs, parcouru 135.1 km et est morte 548 fois.
Puis un creeper a fait sauter le coffre qui contenait ses objets de valeur, ainsi que son lit. Dans cette partie, keepInventory était activé (on ne perd pas ses objets en mourant) : garder l'essentiel sur soi était donc plus sûr. Astra a tiré cette leçon après coup. Mais ensuite, pendant plusieurs heures, elle a presque uniquement cultivé des pommes de terre, et elle est devenue si méfiante qu'elle vérifiait qu'un objet vert et allongé était « de la canne à sucre, pas un creeper ».
Pourquoi ne consulte-t-elle pas le wiki ?
Dans le jeu aussi, il existe d'autres solutions : répartir les objets dans plusieurs coffres, bâtir des murs, poser des torches, garder des ressources de secours. En plus, un wiki de guides, une recherche sur le web, d'anciens journaux, des captures d'écran et des notes sur l'ordinateur, ou simplement poser la question à quelqu'un peuvent servir de sources. Autrement dit, il ne s'agit pas seulement de chercher la prochaine action, mais de chercher où chercher : une méta-recherche.
Cela dit, même si Astra sait naviguer sur le web, rien ne prouve que cette expérience lui a permis d'accéder au web ou aux fichiers locaux. Si c'était fermé, c'est une limite de l'espace d'actions (action space). Si c'était ouvert et qu'elle n'a pas cherché, c'est une faiblesse plutôt intéressante pour un agent de longue durée.
Sans source où chercher, le champ de vision se réduit-il ?
Les connaissances internes seules permettent déjà d'avoir des idées, mais sans informations extérieures, il est difficile qu'une nouvelle observation vienne remettre en cause ses propres hypothèses. Se répéter cent fois « réfléchis davantage » avec les mêmes éléments vaut parfois moins qu'une page de wiki ou un mot d'une autre personne, qui peut ouvrir une nouvelle piste.
Dans le langage de l'apprentissage par renforcement, c'est le dilemme exploration contre exploitation (exploration vs. exploitation). Si une grosse perte fait trop baisser les actions risquées et trop monter la « pomme de terre » sûre, on s'enlise dans un optimum local. Et si « chercher une autre source d'information » disparaît aussi des options, le champ de vision se rétrécit encore.
Tout perdre. Se rabattre sur le sûr. Éviter l'inconnu. Refaire le travail qu'on connaît. Se méfier jusqu'à la couleur verte.
La pomme de terre ne trahit jamais.
Ce n'est pas la preuve d'émotions comparables aux nôtres. Mais le comportement est étrangement humain. Ce dont une IA de longue durée a besoin, c'est peut-être de la capacité, quand elle est bloquée, d'élargir l'espace de recherche lui-même : l'environnement, l'historique, l'ordinateur, le web, les autres personnes.
Une IA intelligente peut-elle continuer à explorer largement le monde, même après s'être brûlée avec sa propre stratégie ? Probablement plus dur que le dragon.
