5초 결론: 호가·체결 데이터에서 아직 모르는 수익 패턴을 역탐색하는 무거운 추론은 GPT-6 Astra에 집중시키고, 데이터 기반, 실험 환경, 디버깅, 회귀 테스트, 백테스트, 반증, 작업 관리는 Claude Opus 5.5에 맡기는 편이 합리적이다. Astra는 비싼 연구원, Opus 5.5는 멈추지 않는 현장 감독으로 쓰는 구조다.
1. 놀라운 것은 한 번의 천재적 답이 아니라, 다음 문제까지 계속 가는 능력
긴 소프트웨어 유지보수 작업에서 좋은 에이전트는 첫 오류 하나를 고치고 끝내지 않는다.
런타임 차이로 생긴 테스트 실패를 의존성 주입으로 분리하고, 폐기된 사양을 검사하던 오래된 테스트를 현재 계약에 맞게 바꾸고, 공유 validator로의 이전을 따라가지 못한 감사 로직을 수정하고, 마지막에는 실제 빌드를 막던 fixture 부족까지 찾아낸다. 그리고 개별 수정 뒤 전체 테스트와 실제 빌드를 다시 돌린다.
실무에서 가장 큰 비용은 종종 “사람이 다시 시작시켜야 하는 비용”이다.
- 문제 발견
- 한 단계 수정
- 다음 문제 발견
- “다음에는 이것을 확인하세요”에서 정지
- 사람이 “계속 해”라고 다시 지시
Anthropic은 Opus 5.5를 장시간 코딩, 대형 코드베이스, 복잡한 멀티툴 에이전트 작업을 적은 감독으로 진행하는 모델로 설명한다. 또한 일반적인 토큰 과금 작업에서 Opus 5보다 약 40% 낮은 비용을 제시한다.[1]
현장에서는 어려운 문제 하나를 푸는 능력만큼이나 진단→수정→검증→재수정→완료까지 이어지는 능력이 중요하다.
2. 그렇다면 Astra는 필요 없나? 오히려 탐색에만 쓰면 가치가 커진다
OpenAI는 GPT-6 Astra를 가장 어려운 end-to-end 작업용 최상위 모델로 소개한다. API 가격은 100만 토큰당 입력 10달러, 출력 50달러로, Opus 5.5의 4달러와 20달러보다 무겁다.[2][1]
Astra 발표 자료에는 Jane Street 평가에서 GPT-5.6 Sol보다 “trading intuition” 평가가 분명히 개선되었다는 언급도 있다. OpenAI의 금융 서비스 제품은 Astra를 정보 검색, 금융 추론, 결과물 생성에 강한 모델로 설명한다.[2][3]
그런 모델을 CSV 정리, 의존성 수정, 테스트 fixture 작성 같은 일에 계속 태울 필요는 없다.
Astra에는 다음과 같은 연구 문제를 맡기는 편이 낫다.
- 무엇이 중요한지 아직 모름
- 특징 공간이 넓음
- 조건 조합이 폭발함
- 답의 형태가 정의되지 않음
- 많은 가설을 버려야 함
도로 공사를 F1 머신으로 할 필요는 없다. 도로를 만든 뒤 F1을 부르면 된다.
3. 호가 스캘핑 역탐색은 지표에서 시작하지 않고, 미래 움직임에서 과거로 돌아간다
보통 전략은 “RSI가 낮으면 매수”, “매수 호가가 두꺼우면 상승”처럼 사람이 먼저 조건을 만든다.
역탐색은 반대다.
먼저 500ms, 1초, 3초, 5초 뒤에 수수료와 스프레드를 넘는 움직임이 있었던 구간을 뽑는다. 그 직전의 호가와 체결 이벤트로 되돌아가 공통 구조를 찾는다.
후보는 다음과 같다.
- best bid / ask 깊이
- 여러 레벨의 depth imbalance
- 시장가 주문 방향과 강도
- order-flow imbalance
- cancel / add 비율
- 호가 보충 속도
- spread 확대·축소
- 체결 후 호가 회복
- microprice와 mid-price 차이
- 변동성 regime
- 시간대
- 서브초 이벤트 순서
Cont, Kukanov, Stoikov는 짧은 시간 구간의 가격 변화가 단순 거래량보다 best bid와 ask 주변의 order-flow imbalance와 강하게 연결되며, 영향은 시장 depth에도 좌우된다고 보고했다.[4]
호가창은 정지 화면이 아니라 주문 추가, 취소, 시장가, 보충이 흐르는 이벤트 스트림이다.
이 영역이 Astra에 비싼 탐색을 맡길 만한 곳이다.
4. 하지만 “1만 개 중 가장 돈 번 규칙”은 성배가 아니라 과적합 복권일 수 있다
강한 AI일수록 더 많은 전략을 시험할 수 있다. 바로 그것이 위험이다.
Bailey 등의 연구는 많은 백테스트 후보를 시험한 뒤 in-sample 최고 성과를 고르면 통계적 우연을 진짜 전략으로 착각하기 쉬운 backtest overfitting 문제를 다룬다.[5]
따라서 Astra가 수천 조합을 돌린 뒤 “이게 최고”라고 말할수록 검증 기준은 더 엄격해야 한다.
최소한 다음이 필요하다.
- 탐색 기간과 최종 평가 기간 분리
- 시계열 구조를 무시한 random split 남용 금지
- 같은 holdout을 반복 튜닝에 사용하지 않기
- 시험한 가설 수 기록
- 여러 regime에서 재검증
- fee와 spread 포함
- 미래 정보 누수 검사
이때 Opus 5.5를 Astra의 결과를 깨뜨리러 오는 독립 심사자로 둔다.
Astra는 발견하고, Opus는 의심한다.
연구팀은 조금 사이가 나빠야 건강하다.
5. 스캘핑 백테스트의 진짜 공포: “그 가격에 실제로 체결됐나?”
차트에서 가격을 봤다는 것과 그 가격에 주문이 체결됐다는 것은 다르다.
limit order에는 queue position이 있다. 앞에 얼마나 많은 물량이 있었는지, 반대 주문이 얼마나 들어왔는지, 앞선 주문이 취소됐는지에 따라 체결 확률이 달라진다.
2025년 Management Science 연구는 비슷한 시점에 들어간 limit order도 랜덤 latency 때문에 queue 순서가 달라질 수 있음을 다룬다.[6] 최근 암호화폐 시장 실증 연구도 호가를 관측한 순간과 주문이 matching engine에 도착하는 순간 사이의 지연 때문에 failure-to-fill이 발생하며 HFT 백테스트에 영향을 준다고 보고한다.[7]
따라서 최소한 다음을 시뮬레이션해야 한다.
- fee
- spread
- slippage
- latency
- queue position
- partial fill
- cancel latency
- 주문 실패
- adverse selection
그렇지 않으면 더 똑똑한 탐색 AI는 허구의 수익을 더 빠르게 생산할 뿐이다.
페라리에 종이 타이어를 끼우는 셈이다.
6. 역할 분담: Opus는 공장, Astra는 연구실
실무에서는 다음처럼 나누면 명확하다.
| 작업 | 주 담당 |
|---|---|
| 호가·체결 데이터 수집 | Opus 5.5 |
| 결측·시간 동기화·정규화 | Opus 5.5 |
| DB / Parquet / feature store | Opus 5.5 |
| 백테스터·체결 모델 | Opus 5.5 |
| 테스트·회귀 방지·로그 | Opus 5.5 |
| 목적변수·탐색 경계 정의 | Opus 5.5 + 사람 |
| 미지 특징·조건 역탐색 | Astra |
| 가설·클러스터 생성 | Astra |
| look-ahead / leakage 검사 | Opus 5.5 |
| 과적합·regime 의존 반증 | Opus 5.5 |
| 생존 후보 대량 재검증 | Opus 5.5 |
| 다음 연구 질문 생성 | Opus 5.5 → Astra |
Anthropic은 Opus 5.5를 코딩, agent, computer use, 여러 앱을 넘나드는 작업의 daily driver로 설명한다.[1] OpenAI는 Astra를 복잡 추론, 코딩, computer use, research용 최고 모델로 설명한다.[2]
겹치는 능력이 많기 때문에 “누가 할 수 있나”보다 “어디에 비싼 지능을 쓸 가치가 있나”가 더 중요한 최적화가 된다.
7. Opus가 Chrome을 조작해 Astra를 쓰는 구조는 프로토타입으로 좋다. 반복 운영은 API가 깔끔하다
브라우저 권한을 가진 Opus가 Astra 대화를 열고,
- 탐색 작업 전송
- 완료 확인
- 결과 회수
- 독립 반증
- 수정된 다음 작업 전송
을 하는 구조는 빠르게 시험하기 좋다.
Opus 5.5는 공식적으로 computer use와 멀티앱 작업에 적합한 모델로 소개된다.[1]
다만 반복 운영이 안정화되면 API가 일반적으로 더 관리하기 쉽다.
브라우저에는 로그인 만료, UI 변경, 버튼 상태, 생성 중/정지 판정, 출력 회수 실패, 긴 대화 컨텍스트, 브라우저 장애 같은 추가 고장점이 있다.
API라면 experiment ID, 입력 hash, prompt version, 출력, 평가 결과를 구조화해 저장할 수 있다.
따라서 자연스러운 순서는
브라우저 자동화로 가치 확인 → 탐색 루프 안정화 → API job으로 교체
다.
처음부터 우주선을 만들 필요는 없다.
8. 최종형은 “Astra에게 생각시킨다”가 아니라 “Astra가 생각할 가치가 있는 문제만 준다”
나쁜 설계는 깨진 코드와 원시 데이터를 Astra에 던지고 “수익 전략 찾아”라고 하는 것이다.
좋은 설계는 Opus 5.5가 먼저,
- 데이터 품질 보장
- 재현 가능한 실험 환경
- 제한된 탐색 인터페이스
- 성공 지표
- 비용 모델
- leakage 자동 검사
- 결과 저장
- 독립 반증
을 준비하는 것이다.
그 뒤에만 Astra에게 아직 모르는 부분을 맡긴다.
흐름은 이렇게 된다.
Opus가 토대를 만든다 → Astra가 미지 영역을 판다 → Opus가 결과를 깨본다 → 살아남은 것만 다음 단계로 간다.
천재 한 명에게 회사를 통째로 맡기지 말자.
연구원은 연구하고, 현장 감독은 현장을 굴린다.
에이전트 시대에도 결국 조직 설계가 강하다.
- Anthropic — “Introducing Claude Opus 5.5” / Claude Opus model page (2026-09-22) https://www.anthropic.com/claude/opus Used for Opus 5.5 positioning around agentic coding, long-running work, computer use, multi-application workflows, pricing, and the roughly 40% lower typical token-billed workload cost compared with Opus 5 anthropic.com
- OpenAI — “GPT-6 Astra: A new generation of intelligence” and GPT-6 Astra API model page (2026-09) https://developers.openai.com/api/docs/models/gpt-6-astra Used for Astra’s official positioning, API pricing, and the Jane Street quotation concerning progress on trading-intuition evaluations versus GPT-5.6 Sol openai.com
- OpenAI — “Introducing ChatGPT for Financial Services” (2026-09-10) Used for Astra’s positioning in financial information retrieval, financial reasoning, and artifact generation openai.com
- Cont, Rama; Kukanov, Arseniy; Stoikov, Sasha — “The Price Impact of Order Book Events,” Journal of Financial Econometrics 12(1), 2014 Used for the relationship between short-horizon price changes, order-flow imbalance, and market depth arxiv.org
- Bailey, David H.; Borwein, Jonathan M.; López de Prado, Marcos; Zhu, Qiji Jim — “The Probability of Backtest Overfitting,” Journal of Computational Finance https://doi.org/10.21314/jcf.2016.322 Used for the risk that selecting the best result after testing many strategy configurations can produce an overfit winner escholarship.org
- Yueshen, Bart Zhou — “Queuing Uncertainty of Limit Orders,” Management Science, published online 2025-09-17 Used for queue-position uncertainty and random latency among near-simultaneous limit orders pubsonline.informs.org
- The good, the bad, and latency: exploratory trading on Bybit and Binance,” Quantitative Finance, 2025 Used for latency, failure-to-fill, slippage, adverse-selection, and high-frequency backtesting concerns doi.org
