초단기 매매 전략을 손으로 연구해 본 사람이라면 가장 힘든 것이 단순한 계산이 아니라는 것을 안다.
이 신호가 나왔을 때는 어떻게 할까. 다른 신호가 동시에 나오면? 변동성이 높을 때만 남길까. 스프레드가 넓으면 버릴까. 이 시간대에는 추세 추종, 저 시간대에는 진입 금지?
하나씩 확인하다 보면 평일 저녁이 그대로 개인 연구소가 된다. 매일 몇 시간씩 몇 년을 쌓아도 겨우 하나의 전략이 남을 수 있다.
그런데 탐색형 AI가 등장했다.
한 탐색 흐름에서는 수천 가지 변형을 몇 시간 단위로 시험하고, 수익이 왜 불안정한지 쪼개 본 뒤 그 실패를 다음 후보 선택에 이용할 수 있다.
사람 입장에서는 한마디가 나온다.
“이걸 사람한테 시키면 며칠 걸리는데?”
하지만 “AI가 4,000개를 시험할 수 있으니 끝났다”라고 생각하면 금융에서는 바로 사고가 난다. 많이 시험할수록 과적합도 더 잘 만들어지기 때문이다.[1][2]
핵심 조합은 이쪽이다.
사람의 가설 × AI의 탐색 × AI의 반증 × 대량 탐색을 보정하는 통계.
승자를 찾는 AI만 두지 말고, 그 승자를 부수는 AI도 같이 둬야 한다.
1. 왜 몇 년짜리 수작업이 갑자기 압축되는가
수작업 전략 연구는 작은 반복의 연속이다.
- 가설을 만든다.
- 조건을 구현한다.
- 백테스트한다.
- 결과를 본다.
- 왜 불안정한지 묻는다.
- 조건을 나눈다.
- 다시 시험한다.
각 단계가 천재만 할 수 있는 일은 아니다. 문제는 수백 번, 수천 번 반복한다는 점이다.
사람에게는 전환 비용도 있다. 어제 무엇을 시험했는지, 이 필터를 이미 썼는지, 비용 가정을 바꾸기 전 결과였는지 다시 확인해야 한다.
탐색 AI의 가치는 이 반복을 끊지 않는 데 있다.
“수익이 났다”에서 멈추지 않고 특정 며칠에만 몰렸는지, 비용을 넣으면 사라지는지, 한 세션에만 의존하는지, 부품 하나를 빼면 무너지는지 계속 파고들 수 있다.
이것은 단순한 백테스트 가속이 아니다.
연구 반복 자체의 가속이다.
2. Astra의 강점은 ‘정답을 안다’보다 ‘모르는 환경을 걸어 다닌다’에 가깝다
이 차이를 보기 좋은 것이 ARC-AGI-3이다.
ARC-AGI-3는 설명서와 명시된 목표가 없는 새로운 2D 격자 환경을 조작하면서 규칙을 알아내는 상호작용형 벤치마크다. 탐색하고, 환경 모델을 만들고, 목표를 찾아내고, 계획을 세우고, 실패하면 수정해야 한다.[3][4]
2026년 7월 GPT-5.6 Sol은 ARC Prize의 준비공개 세트에서 7.78%를 기록했다. OpenAI는 별도의 공개 세트 실험에서 추론 상태 보존과 문맥 압축을 사용했을 때 13.3%에서 38.3%로 올라가는 것도 보여 주었다.[5]
9월 Astra는 ARC Prize의 표준 하네스로 같은 준비공개 세트에서 62.7%, 더 많은 추론 상태를 행동 사이에 유지하는 Provider Adapter에서는 99.9%를 기록했다. 하네스 차이가 점수에 크게 영향을 주므로 99.9 대 7.78을 단순 배수로 비교하면 안 된다. 중요한 것은 탐색, 상태 모델링, 장기 적응 능력이 크게 뛰었다는 점이다.[6][3]
ARC Prize는 Astra가 완료한 레벨의 96%에서 인간 완료자 중앙값보다 적은 행동 수를 사용했다고도 보고했다.[3]
이것은 어려운 수식을 한 번에 푸는 능력과 조금 다르다.
“이걸 건드리면 뭐가 되지? 그럼 저건? 아, 규칙이 이거구나.”
라는 능력이다.
겉보기에는 어린이도 만져 볼 만한 2D 게임이 오랫동안 AI에는 어려웠다는 점이 오히려 재미있다.
다만 ARC Prize도 ARC-AGI-3 포화를 AGI 달성의 증명이라고 주장하지 않는다. 닫혀 있고 결정론적인 게임 환경과 현실 세계는 다르다.[3]
3. 왜 2D 게임 탐색이 스캘핑 연구와 비슷해 보이는가
시장은 게임이 아니다. 가격은 고정 규칙 하나로 움직이지 않는다.
그래도 연구 절차는 닮을 수 있다.
예를 들어 호가 불균형 조건을 추가했더니 백테스트가 좋아졌다고 하자.
그러면 다음 질문이 나온다.
- 호가 불균형 자체가 예측력이 있는가.
- 고변동성에서만 작동하는가.
- 낮은 스프레드 때문에 좋아 보이는 것뿐인가.
- 체결을 한 틱 불리하게 하면 사라지는가.
- 특정 시간대에만 존재하는가.
관찰하고, 조건을 바꾸고, 결과를 보고, 가설을 수정한다.
ARC-AGI-3의 인지 → 행동 → 반응 → 모델 수정 → 다음 행동과 구조가 비슷하다.[3][4]
그래서 좋은 지시는 “가장 돈을 많이 버는 파라미터를 찾아라”보다
“이 수익이 왜 생기는지 분해하고, 무엇이 이 수익을 죽이는지 찾고, 죽은 이유를 다음 실험으로 바꿔라”
에 가깝다.
4. 사람의 경험은 사라지지 않는다 — ‘여기가 수상하다’가 탐색 지도다
AI에게 처음부터 전부 맡기면 될 것 같지만, 탐색 공간이 커질수록 사람의 경험은 예산을 어디에 먼저 쓸지 정하는 지도다.
오랫동안 책을 읽고 신호를 직접 시험한 사람은 대략 이런 압축 지식을 갖게 된다.
- 단독으로는 약하지만 필터로는 쓸 만하다.
- 추세 국면에서만 의미가 있다.
- 백테스트는 예쁘지만 비용에 약하다.
- 방향 예측보다 진입 금지에 더 유용하다.
- 강해 보이지만 특정 기간에 몰릴 가능성이 높다.
이것은 정답표가 아니다.
탐색 공간에 대한 사전 힌트다.
과학 분야의 2026년 Co-Scientist도 연구자가 제시한 목표와 기존 근거에서 출발해 가설을 만들고, 비판하고, 순위를 매기고, 다시 발전시키는 반복 구조를 사용한다.[7]
금융에서도 사람은 “여기부터 파 보자”고 말하고, AI는 주변 수천 갈래를 파면 된다.
사람의 경험은 결론이 아니라 첫 탐색 예산을 배분하는 힌트로 쓰는 편이 강하다.
5. 복수 조건 조합이 사람에게 지옥이 되는 수학적 이유
재료가 20개 있다고 하자.
각 재료를 사용할지 말지만 결정해도
2^20 = 1,048,576가지다.
사용 안 함, 정방향 사용, 역방향 사용의 세 가지로 늘리면
3^20 = 3,486,784,401가지다.
실제로는 의미 없는 조합을 지식으로 쳐낸다.
그런데 실전 연구에는 임계값, 시간대, 변동성, 스프레드, 보유 시간, 뉴스 제외, 매수·매도 비대칭, 체결 조건이 추가된다.
예전의
“이것도 같이 보면? 여기서는 제외하면? 이 국면에서만 쓰면?”
이라는 수작업은 거대한 조건부 탐색 트리를 사람이 걷는 일이었다.
몇 년 걸리는 것이 이상하지 않다.
스프레드시트는 죄가 없다. 우주가 너무 넓었다.
6. AI에게 맡길 것은 무식한 전수조사보다 ‘다음 실험 선택’이다
좋은 탐색 AI는 직전 결과에 따라 다음 실험을 바꾼다.
전략이 A+B+C+D라면 하나씩 빼 본다.
- D를 빼도 거의 같다 → D는 장식일 수 있다.
- B는 혼자 약하지만 A+B에서 낙폭을 줄인다 → B는 예측 신호가 아니라 필터일 수 있다.
- C는 전체 기간에서는 약하지만 고변동성에서 강하다 → C는 시장 상태 의존 부품일 수 있다.
이처럼 부품을 빼서 기여도를 확인하는 검사를 보통 ablation test라고 부른다.
용어보다 중요한 것은 목적이다.
복잡한 전략을 분해해 실제로 필요한 부품만 남기는 것.
탐색 → 실패 → 실패 원인 분류 → 다음 탐색.
이 흐름이 자동화되면 AI는 파라미터 최적화기를 넘어 연구 보조자가 된다.
7. 가장 큰 위험은 과적합 — 4,000개를 시험하면 ‘운 좋은 천재’가 생긴다
금융에서는 여기가 핵심이다.
4,000개 전략을 시험한 뒤 제일 예쁜 결과 하나만 고르면, 그 승자는 과거 데이터에 우연히 가장 잘 맞은 것일 수 있다.
White는 같은 데이터를 추론과 모델 선택에 반복 사용하면 좋은 결과가 진짜 우월성보다 우연에서 나올 수 있는 데이터 스누핑 문제를 정리했다.[1]
복수 신호를 합칠수록 문제는 더 커진다.
Novy-Marx는 여러 신호를 선택·결합한 전략에서 과적합 편향이 심해질 수 있고, 실제 예측력이 없는 무작위 신호 조합도 매우 유의해 보이는 백테스트를 만들 수 있음을 보였다.[2]
즉 탐색력이 강하면 더 빨리 틀릴 수도 있다.
그리고 그중 가장 아름답게 틀린 하나를 챔피언으로 뽑을 수도 있다.
탐색량이 커질수록 과적합 방지는 마지막 확인이 아니라 탐색 설계의 일부가 되어야 한다.
8. 과적합 방지는 모든 시도를 기록하고 ‘마지막 데이터’를 선택 과정에서 봉인하는 것부터 시작한다
수천 후보를 봤다면 탈락한 후보도 증거다.
최소한 다음은 자동화할 가치가 있다.
- 모든 trial 기록. 무엇을 얼마나 바꿨고 왜 버렸는지 남긴다.
- 탐색용 데이터와 최종 평가용 데이터 분리. 최종 데이터는 모델을 고르는 동안 보지 않는다.
- 시간 순서 검증. 과거에서 만들고 더 미래에서 확인하는 walk-forward 검증을 사용한다.
- 비용을 일부러 악화. 스프레드, 수수료, 슬리피지, 지연, 체결 가정을 불리하게 만든다.
- 파라미터를 흔든다. 한 점에서만 살아 있는 전략을 경계한다.
- 시장 상태를 나눈다. 특정 연도, 시간대, 변동성, 방향, 소수 거래에 수익이 몰리는지 본다.
- 대량 시행 자체를 통계적으로 보정한다.
DSR은 많은 후보를 시험한 선택 편향과 비정규 수익 분포 때문에 Sharpe 비율이 과장되는 문제를 보정한다.[8]
PBO는 투자 백테스트에서 선택 과정이 과적합됐을 가능성을 조합 대칭 교차검증으로 추정하는 틀이다.[9]
White의 Reality Check는 여러 후보를 본 데이터 스누핑을 다루고, Hansen의 SPA 검정은 성능이 나쁘거나 무관한 후보의 영향을 덜 받도록 개선됐다.[1][10]
외울 것은 약어가 아니라 원칙이다.
4,000번 시험해서 우승했으면, 4,000번짜리 대회 우승자로 평가하라.
그리고 봉인 데이터를 본 뒤 전략을 수정하면 그 데이터는 더 이상 봉인 데이터가 아니다.
9. 강한 구성은 ‘찾는 AI’와 ‘죽이는 AI’를 따로 두는 것이다
역할을 나누면 편하다.
탐색 AI
- 새 조건 생성
- 사람의 가설 재조합
- 시장 상태별 효과 탐색
- 실패 원인으로 다음 실험 생성
반증 AI
- 비용 악화
- 체결 지연
- 일부 날짜 제거
- 임계값 변경
- 다른 기간과 시장으로 이동
- DSR, PBO, Reality Check, SPA 같은 보정 적용
- 수익이 극소수 거래에 집중됐는지 검사
탐색 AI가 “찾았습니다”라고 하면 반증 AI가 “진짜?”라고 묻는다.
살아남으면 한 번 더 때린다.
금융 연구에서는 이 성격 나쁨이 품질이다.
목표는 과거 최고수익보다
“가정과 비용과 파라미터를 조금 망가뜨려도 이유를 설명하면서 남는 구조”
가 되어야 한다.
10. 새 모델이 나올 때는 종합점수보다 ‘전 세대가 못 넘던 벽을 갑자기 넘은 능력’을 본다
이 관점은 스캘핑보다 넓다.
새 AI가 나왔을 때 일반 벤치마크가 몇 퍼센트 올랐는지만 보면 사업 기회를 놓칠 수 있다.
더 중요한 질문은:
“이전 세대에서는 경제성이 없던 일이 이번에는 갑자기 가능한가?”
이다.
Astra에서 ARC-AGI-3가 보여 준 변화는 낯선 환경 탐색, 압축된 세계 모델 구축, 상태 유지, 효율적인 행동이었다.[3]
그러면 현실의 병목과 연결한다.
- 사람이 다음 실험을 고르느라 시간을 잃는 일은?
- 시험 가능한 가설이 수천 개 있는 일은?
- 성공과 실패를 숫자로 판정할 수 있는가?
- 반복할수록 인건비 차이가 커지는가?
- 더 좋은 탐색이 돈, 비용 절감, 연구 속도로 연결되는가?
이 조건이 겹치는 곳이 흥미롭다.
과학의 Co-Scientist도 가설 생성 → 비판 → 비교 → 발전을 반복하는 방향으로 움직인다.[7]
따라서 새 모델 출시는 단순 스펙 발표가 아니라,
“사람이 예전에 죽도록 귀찮아하던 연구 루프 중 무엇이 갑자기 기계 규모로 바뀌었나?”
를 찾는 행사로 볼 수 있다.
요약하면:
사람은 첫 지도를 그린다. AI는 지도 밖까지 판다. 통계는 반짝이는 것이 정말 금인지 확인한다.
AI가 더 강해질수록 누군가는 계속 의심해야 한다.
그 의심하는 역할도 AI에게 맡길 수 있다.
- Halbert White — A Reality Check for Data Snooping, Econometrica 68(5), 2000 onlinelibrary.wiley.com
- Robert Novy-Marx — Backtesting Strategies Based on Multiple Signals, NBER Working Paper 21329, 2015 nber.org
- ARC Prize — OpenAI's GPT-6 Astra on ARC-AGI-3 (2026-09-03) arcprize.org
- ARC Prize — Announcing ARC-AGI-3 / ARC-AGI-3 documentation https://docs.arcprize.org/ arcprize.org
- OpenAI — How two settings tripled our ARC-AGI-3 scores (GPT-5.6 Sol) openai.com
- OpenAI — GPT-6 Astra: A new generation of intelligence openai.com
- Juraj Gottweis et al. — Accelerating scientific discovery with Co-Scientist, Nature, 2026 nature.com
- David H. Bailey & Marcos López de Prado — The Deflated Sharpe Ratio: Correcting for Selection Bias, Backtest Overfitting, and Non-Normality, 2014 doi.org
- David H. Bailey, Jonathan Borwein, Marcos López de Prado & Qiji Jim Zhu — The Probability of Backtest Overfitting, 2015 papers.ssrn.com
- Peter Reinhard Hansen — A Test for Superior Predictive Ability, Journal of Business & Economic Statistics 23(4), 2005 tandfonline.com
