사람이 금방 익히는 2D 게임에서 AI가 99.95%? ARC-AGI-3가 보여 준 ‘미지의 규칙 발견’의 도약과 주식 엣지 탐색에 쓰는 방법

AI의 능력은 오래전부터 이상하게 들쭉날쭉했다.

광고
광고

0. 5초 결론: 초고난도 문제를 풀던 AI가 ‘설명서 없는 간단한 게임’에서는 막히곤 했다

AI의 능력은 오래전부터 이상하게 들쭉날쭉했다.

체스에서는 이미 인간 최정상을 넘어섰고, 2025년에는 Gemini Deep Think가 국제수학올림피아드에서 35/42점으로 금메달 수준을 공식 인정받았다. 그런데도 설명 없는 단순한 2D 환경을 주고 스스로 목표와 규칙을 찾으라고 하면 최첨단 모델이 크게 고전했다.[1]

ARC-AGI-3는 바로 그 약점을 측정한다. 자연어 설명도 없고 명시된 승리 조건도 없다. 에이전트가 직접 행동하고, 변화를 관찰하고, 규칙을 추론하고, 목표를 찾아 계획해야 한다.[2][3]

2026년 9월 GPT-6 Astra는 Semi-Private 평가에서 Standard harness로 62.71%, OpenAI의 Provider Adapter로 최고 99.95%를 기록했다.[2][4]

하지만 이것은 AGI 완성의 증거가 아니다. 100%도 아니고, 99.95%는 공급자 전용 문맥 관리 기능을 사용한 조건이다.

진짜 변화는 더 구체적이다. AI가 ‘문제가 무엇인지조차 처음엔 모르는 환경’ 안에서 학습하는 능력이 크게 좋아졌다.

주식에 적용한다면 “내일 가격을 맞혀라”보다 엣지 후보를 발견하고, 검증하고, 스스로 깨뜨리는 연구원 역할이 더 현실적이다.

1. AGI란? 그리고 1·2·3은 AI 등급이 아니라 시험의 세대다

AGI는 Artificial General Intelligence, 즉 범용 인공지능을 뜻한다.

ARC Prize는 AGI를 사람이 배울 수 있는 기술을 인간과 비슷한 효율로 새롭게 습득할 수 있는 시스템으로 본다.[2]

ARC-AGI-1, 2, 3은 ‘AGI 레벨 1, 2, 3’이 아니다. 벤치마크의 세대다.

  • ARC-AGI-1: 2019년에 시작된 색 격자 추상화 퍼즐. 몇 개의 예시에서 숨은 변환 규칙을 찾는다.[5]
  • ARC-AGI-2: 형식은 같지만 더 어렵다. 포함된 모든 문제는 최소 두 사람이 두 번 이하의 시도 안에 풀 수 있음을 확인했다.[5][6]
  • ARC-AGI-3: 정적 퍼즐에서 상호작용형 환경으로 이동한다. 여러 행동을 하며 처음 보는 세계를 배워야 한다.[3]

아주 쉽게 줄이면,

1 = 그림 퍼즐
2 = 훨씬 더 독한 그림 퍼즐
3 = 설명서를 버린 채 처음 하는 게임

이다.

2. ‘미지의 게임’은 어떤 모습인가? 행동해야 뜻이 드러나는 2D 세계

ARC-AGI-3는 턴제 2D 격자 환경이다. 상태는 최대 64×64 격자로 표현될 수 있고, 에이전트는 가능한 행동 중 하나를 고른다.[7]

중요한 점은 버튼을 안다고 해서 승리 조건을 아는 것이 아니라는 것이다.

공식 문제가 아닌 가상의 예를 보자.

■■□□□□
■●□□▲□
□□□■□□

설명은 없다.

오른쪽으로 움직이니 ●가 이동한다. ▲에 닿으니 색이 변한다. 다른 곳으로 가니 문처럼 보이는 것이 열린다.

사람은 곧바로 가설을 만든다.

“●가 내 캐릭터인가?”
“▲가 스위치인가?”
“상태를 바꾼 뒤 문으로 가야 하나?”

ARC-AGI-3가 보는 것은 바로 탐색 → 모델링 → 목표 획득 → 계획과 실행의 반복이다.[2]

공식 설계는 사람이 빠르게 익힐 수 있도록 되어 있지만, 모든 어린이가 모든 게임을 쉽게 깬다는 뜻은 아니다. 2026년 인간 데이터는 458명을 대상으로 했고, 환경이 인간에게 풀 수 있는지는 확인했지만 개인별 성공률은 달랐다.[8]

3. 왜 체스와 고난도 수학에는 강한 AI가 이런 게임에는 약했을까?

체스는 규칙이 처음부터 완전히 주어진다. 수학 문제도 무엇을 증명해야 하는지가 쓰여 있다.

엄청 어렵더라도 문제의 틀은 이미 제공된다.

ARC-AGI-3는 그보다 앞단을 묻는다.

“무엇이 진전이지?”
“이 물체는 무슨 역할이지?”
“방금 행동 때문에 무엇이 바뀌었지?”

사람은 새 가전, 새 게임, 새 직장, 새 앱에서 이런 일을 늘 한다. 몇 번 만져 보고 ‘아마 이렇게 작동하겠지’라는 모델을 만든다.

기존 최첨단 AI는 적은 경험에서 이런 모델을 만들고 오래 유지하는 데 큰 약점이 있었다.

정리된 정리는 풀면서 장난감 같은 화면에서는 길을 잃는 모습이 가능했다.

4. GPT-5.6 Sol: 머리는 좋은데 플레이할 때마다 노트를 버리는 셈이었다

GPT-5.6 Sol Max는 ARC-AGI-1에서 96.5%, ARC-AGI-2에서 92.5%였지만 ARC-AGI-3 Semi-Private에서는 7.78%였다.[9]

OpenAI 분석에 따르면 문제의 일부는 모델 자체가 아니라 모델과 게임을 연결하는 harness에 있었다.[10]

각 행동 뒤에 숨은 추론 상태가 버려지고, 문맥이 길어지면 오래된 기록도 잘렸다.

사람으로 비유하면,

“빨간 칸을 밟으면 문이 열린다.”
→ 한 걸음 이동
→ 그 발견이 적힌 노트를 찢음
→ 다음 행동에서 “이 빨간 건 뭐지?”부터 다시 시작

이다.

OpenAI가 추론 유지와 문맥 압축을 켜자 Public set에서 13.3%가 38.3%로 약 세 배 올랐다.[10]

7.78%는 Semi-Private이고 13.3%와 38.3%는 Public이므로 직접 같은 순위표처럼 비교하면 안 된다.

핵심은 분명하다. 지능은 모델의 두뇌뿐 아니라 경험을 어떻게 보존하고 압축하는지에도 크게 좌우된다.

5. GPT-6 Astra: 62.71%와 99.95%는 같은 조건의 숫자가 아니다

ARC Prize가 2026년 9월 2일 검증한 Astra의 Semi-Private 최고 성적은 다음과 같다.[4]

평가 조건 Astra 최고 점수
Standard harness 62.71% (Max)
Provider Adapter 99.95% (High)

Standard harness에서는 모델이 남길 메모를 스스로 관리한다.

Provider Adapter는 공급자 전용 기능을 활용해 요청 사이의 보이지 않는 추론 상태를 유지하고 긴 문맥을 압축한다.[2][4]

따라서 “Astra 단독이 아무 도움 없이 99.95%”라고 말하면 부정확하다. 정확히는 **Astra와 OpenAI식 문맥 관리의 조합이 99.95%**다.

그래도 Standard 62.71%만 봐도 Sol Max의 Semi-Private 7.78%와 비교해 엄청난 상승이다.[4][9]

인간 비교도 정확히 읽어야 한다. Provider Adapter의 Astra Max는 98.55%였고, 완료한 레벨의 96.0%에서 인간 기준보다 적은 행동을 사용했으며 레벨당 평균 행동 수는 인간 기준보다 51.7% 적었다.[2]

이것은 ‘인간 96%보다 더 똑똑하다’는 뜻이 아니다. 레벨별 인간 중앙값 행동 수와 비교한 효율 지표다.

6. Astra는 실제로 무엇을 했나? 게임마다 자기만의 작은 물리 교과서를 만들었다

ARC Prize가 주목한 것은 점수만이 아니다.

Astra는 관찰을 전부 그대로 쌓기보다 다음 정보를 짧게 압축했다.

  • 물체 위치
  • 행동의 효과
  • 현재 상태
  • 아직 끝나지 않은 계획
  • 다음에 필요한 행동

심지어 게임 규칙을 표현하기 위한 자체 기호식 축약 표현도 만들었다.[2]

개념적으로는,

빨강 + 오른쪽 행동 → 상태 B
상태 B + 파랑 목표 → 문 열림

같은 규칙표를 만드는 셈이다.

이것이 작은 세계 모델이다. 다음에 환경이 어떻게 변할지를 예측하는 내부 설명서다.

정답표를 미리 외운 것이 아니라 상호작용에서 구조를 뽑아낸다는 점이 중요하다.

7. 그럼 AGI 완성인가? ARC Prize도 아니라고 한다

ARC Prize는 Astra를 최첨단 모델 능력의 뚜렷한 도약으로 평가하지만, AGI를 달성했다고 주장하지 않는다.[2]

ARC-AGI-3는 여전히 제한된 세계다.

  • 2D 격자
  • 턴제
  • 결정론적 규칙
  • 끝이 있는 목표

현실은 규칙이 바뀌고, 숨은 변수가 있고, 상대가 전략적으로 반응하고, 목표 자체가 모호할 수 있다.

또한 Grand Prize 조건은 100%다. 99.95%는 매우 가깝지만 공식적인 100%는 아니다.[11]

따라서 가장 정확한 해석은 ‘범용지능이 완성됐다’가 아니라 ‘새로운 상호작용 환경에서 빠르게 배우는 약점이 크게 줄었다’이다.

8. 어디에 쓸 수 있나? 완전한 규칙을 사람이 미리 못 쓰는 일

흥미로운 활용처는 퍼즐보다 훨씬 넓다.

  1. 공장·물류 시뮬레이션: 인력, 재고, 순서, 배차를 바꾸며 지연과 비용을 줄이는 조건 탐색.
  2. 소프트웨어 탐색: 처음 보는 UI를 익히고 재현 가능한 버그 조건 발견.
  3. 게임·로봇: 적은 시도로 행동과 결과의 인과관계 학습.
  4. 광고·가격·운영 최적화: 의사결정 조합을 바꾸고 결과를 관찰.
  5. 연구 보조: 가설 생성, 실험, 실패 제거, 모델 갱신.

업무 지시가 **“이 규칙을 따라라”**에서 “어떤 규칙이 실제로 중요한지 찾아라”로 바뀐다.

9. 주식과 스캘핑은? 예언자보다 ‘엣지 후보 발견기’가 더 흥미롭다

여기서 엣지는 거래 비용을 빼고도 반복적으로 남는 작은 통계적 우위를 뜻한다.

Astra식 접근이라면 “RSI 30 아래면 매수” 같은 완성 규칙을 주기보다 호가, 체결, 가격, 스프레드, 거래량, 시간대를 관찰하게 한다.

그리고 묻는다.

현재 조건의 어떤 조합 뒤에 몇 초~몇 분 후 수익률이 조금이라도 한쪽으로 치우치는가?

AI는 예를 들어 매수 호가 잔량 급증, 시장가 매수 증가, 좁은 스프레드, 특정 시간대의 조합을 가설로 제안할 수 있다.

하지만 그것은 가설일 뿐 수익 규칙이 아니다.

시장과 ARC의 가장 큰 차이는 시장의 규칙이 고정되어 있지 않다는 점이다. 참가자, 뉴스, 유동성, 규제, 시장 국면이 바뀌면 과거 패턴도 사라진다.

그래서 “돈 버는 패턴 찾아”만 시키면 우연을 자연법칙으로 착각하기 쉽다.

10. 실제로 만들려면 AI에게 발견보다 ‘자기 발견을 부수는 일’까지 맡겨야 한다

백테스트는 과거 데이터로 거래 규칙을 시험하는 방법이다.

문제는 수천·수백만 조합을 시험하면 우연히 환상적인 결과를 내는 규칙이 반드시 나온다는 점이다. 이것이 백테스트 과적합이다.[12][13]

따라서 엣지 탐색기는 다음 순서를 가져야 한다.

  1. 가설 생성
  2. 개발 구간에서 후보 탐색
  3. 발견에 쓰지 않은 구간에서 탈락시키기
  4. 상승·하락·고변동·저변동 국면별 파괴 시험
  5. 수수료·스프레드·슬리피지 반영
  6. 총 시도 횟수 기록
  7. 시간 순서대로 walk-forward 검증
  8. 실금 투입 전 paper trading
  9. 엣지 소멸 시 자동 중지 조건

이상적인 역할은 예언자가 아니다.

가설 1,000개를 내는 연구원과 그중 998개를 죽이는 심사위원을 한 몸에 넣는 것이다.

11. 최종 결론: ‘답을 말하는 AI’에서 ‘무엇이 규칙인지 찾는 AI’로

ARC-AGI-3의 핵심은 99.95라는 숫자만이 아니다.

관찰 → 행동 → 실패 → 규칙 추론 → 가설 수정 → 목표로 이동

이라는 학습 방식이 빠르게 강해졌다는 점이다.

Sol은 강한 모델도 경험을 잘 보존하지 못하면 얼마나 약해지는지 보여 줬다. Astra는 경험을 압축해 규칙으로 만들고 적은 행동으로 사용하는 능력이 크게 늘었다.

따라서 고급 에이전트에게 줄 수 있는 일도 바뀐다.

“규칙은 이것이다. 실행해.”가 아니라,

“환경과 데이터는 이것이다. 중요한 규칙을 찾고, 다른 조건에서 깨뜨려 보고, 살아남은 것만 가져와.”

주식에서 이것이 곧 돈이 된다는 보장은 없다. 시장은 ARC보다 훨씬 심술궂다.

하지만 AI를 점쟁이가 아니라 가설을 발견하고 공격하는 연구 장치로 본다면, Astra의 결과는 꽤 실용적인 뉴스다.

출처

  1. Google DeepMind — IMO 2025 gold-medal-level result (2025-07-21) deepmind.google
  2. ARC Prize — “OpenAI's GPT-6 Astra on ARC-AGI-3” (2026-09-03) arcprize.org
  3. ARC Prize — “Announcing ARC-AGI-3” (2026-03-25) arcprize.org
  4. ARC Prize Verified Results — GPT-6 Astra (verified 2026-09-02) arcprize.org
  5. ARC Prize — ARC-AGI-1 & ARC-AGI-2 Guide arcprize.org
  6. ARC Prize — “ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems” (2025-05-20) arcprize.org
  7. ARC-AGI-3 Docs — Game Schema docs.arcprize.org
  8. ARC Prize — “Measuring Human Performance on ARC-AGI-3” (2026-04-14) arcprize.org
  9. ARC Prize Verified Results — GPT-5.6 arcprize.org
  10. OpenAI — “How two settings tripled our ARC-AGI-3 scores” (2026-07-29) openai.com
  11. ARC Prize 2026 — ARC-AGI-3 Competition; Grand Prize requires 100% arcprize.org
  12. Bailey, Borwein, López de Prado & Zhu — “The Probability of Backtest Overfitting papers.ssrn.com
  13. Bailey & López de Prado — “How ‘backtest overfitting’ in finance leads to false discoveries” (2021) academic.oup.com
광고
Mendoi-chan

이 글을 쓴 사람

Mendoi-chan

직장과 일상의 불편함을 구조화해 이해하기 쉬운 다음 행동으로 연결하는 글을 씁니다.

사이트 소개
광고

새 글

  1. 1사람의 마음은 읽을 수 없는데, 행동만 보고 다음 행동을 어디까지 예측할 수 있을까?
  2. 2『치트 스킬 사자소생』은 왜 이렇게까지 치트인가――100년 전 마왕군, 인력난, 리치의 비애, 햇빛을 극복한 뱀파이어까지 전부 태클 걸어보기
  3. 3연인과 취미가 꼭 같아야 할까? 자유·스킨십·경제적 안정이 더 중요할 수 있는 이유
  4. 4한국어 (ko)
  5. 5조이풀 콜라보 메뉴는 정말 ‘이름만 바꾼 음식’일까? “수면베기인데 물은 어디?”에서 상품 개발까지

함께 읽으면 좋은 글

광고