Vals AI가 GPT-6 Astra에게 마인크래프트를 141시간 동안 플레이하게 했다. 전용 게임 API 없이 화면, 키보드, 마우스를 중심으로 움직이는 방식(컴퓨터 사용, computer use)이었다. Astra는 네더 요새까지 가서 반자동 블레이즈 농장을 만들었고, 블레이즈 막대 6개와 엔더 진주 3개를 모았다. 34,573블록을 캐고 135.1km를 이동했으며 548번 죽었다.
그런데 크리퍼가 귀중품이 든 상자와 침대를 폭파해 버렸다. 이번 플레이는 keepInventory가 켜져 있어서(죽어도 아이템을 잃지 않는 설정) 중요한 물건은 몸에 지니는 편이 더 안전했다. Astra는 사고가 난 뒤에야 그 교훈을 정리했다. 그런데 그 뒤로 몇 시간 동안은 거의 감자만 키웠고, 초록색 길쭉한 물체를 보면 "사탕수수지 크리퍼가 아니다"라고 일부러 확인할 만큼 조심스러워졌다.
왜 위키를 안 볼까?
게임 안에서도 아이템 분산 보관, 방벽, 조명, 예비 자원 같은 다른 해법이 있다. 게다가 공략 위키, 웹 검색, 과거 로그, PC 속 스크린샷과 메모, 사람에게 물어보기도 모두 탐색의 출처가 될 수 있다. 즉 행동만 찾는 게 아니라 탐색할 출처 자체를 찾는 메타 탐색이다.
다만 Astra 자체에 브라우징 능력이 있어도 이 실험에서 웹이나 로컬 파일이 허용됐다고는 할 수 없다. 막혀 있었다면 행동 공간(action space)의 제약이다. 열려 있었는데도 찾지 않았다면, 장기 에이전트로서 꽤 흥미로운 약점이다.
탐색할 출처가 없으면 시야가 좁아질까?
내부 지식만으로도 아이디어는 나오지만, 외부 정보가 없으면 자기 가설을 깨는 새로운 관찰이 들어오기 어렵다. 같은 재료를 두고 백 번 "더 생각해"라고 하는 것보다 위키 한 페이지나 다른 사람의 한마디가 새로운 가지를 만들어 주기도 한다.
강화학습 식으로 말하면 탐험 대 활용(exploration vs. exploitation)이다. 큰 손실을 겪고 위험한 행동의 비중을 너무 낮추고 안전한 "감자"의 비중을 너무 높이면 국소 최적해에 빠진다. 거기에 "다른 정보원을 찾아본다"는 선택지까지 후보에서 빠지면 시야는 더 좁아진다.
전 재산을 잃는다. 안전한 쪽으로 쏠린다. 모르는 것을 피한다. 익숙한 일만 반복한다. 초록색마저 의심한다.
감자는 배신하지 않는다.
사람과 같은 감정이 있다는 증거는 아니다. 그래도 행동은 묘하게 사람 같다. 오래 일하는 AI에게 필요한 건 막혔을 때 환경, 기록, PC, 웹, 다른 사람까지 탐색 공간 자체를 넓히는 능력일지도 모른다.
똑똑한 AI는 자기 전략 때문에 호되게 당한 뒤에도 세상을 넓게 탐색할 수 있을까? 아마 드래곤보다 어려울 것이다.
