Astra Low만 계속 써도 될까? — Sol xhigh와 Astra 4단계의 성능·비용을 비교해 보니

모델 선택기에 Low라고 쓰여 있으면 보통 “절약 모드”, “가벼운 작업용”이라고 생각하기 쉽다.

광고
광고

모델 선택기에 Low라고 쓰여 있으면 보통 “절약 모드”, “가벼운 작업용”이라고 생각하기 쉽다.

그런데 GPT-6 Astra의 Low는 이름과 행동이 잘 맞지 않는다.

Artificial Analysis의 동일 평가에서 Astra Low는 GPT-5.6 Sol xhigh보다 종합 Intelligence Index가 높았고, 일부 에이전트형 코딩 평가에서는 격차가 더 컸다. 그 평가 작업 기준 비용도 Astra Low가 더 낮았다.[1]

그래서 자연스럽게 질문이 나온다.

“그럼 그냥 Astra Low로 고정하면 되는 것 아닌가?”

결론은 평소 시작점으로는 매우 합리적이지만, Low 영구 고정이 최적이라는 뜻은 아니다.

Low로 시작하고, 실제 누락이나 복잡성이 확인되면 Medium, Medium으로도 풀리지 않는 어려운 문제만 High와 xhigh로 올리는 방식이 가장 합리적이다.

이름표만 Low다. 본인은 전혀 겸손하지 않다.

1. 먼저 숫자 — Sol xhigh와 Astra Low/Medium/High/xhigh

2026년 9월 12일 확인 기준 Artificial Analysis 수치는 다음과 같다.[1][2][3][4]

설정 Intelligence Index AutomationBench-AA Terminal-Bench v4.0 SciCode AA 작업당 비용 출력 token/작업 추론 token/작업
GPT-5.6 Sol xhigh 44 55% 25% 57% $1.18 약 20k 약 10k
GPT-6 Astra Low 46 59% 42% 54% $0.82 약 4k 약 938
GPT-6 Astra Medium 50 65% 49% 54% $1.54 약 10k 약 3k
GPT-6 Astra High 51 67% 54% 55% $1.72 약 12k 약 5k
GPT-6 Astra xhigh 53 67% 60% 56% $2.31 약 17k 약 9k

46과 44를 보고 “4.5% 더 똑똑하다”고 계산하면 안 된다. Intelligence Index는 여러 평가를 합친 지수이지 가격이나 거리처럼 비율을 직접 계산하는 척도가 아니다.

같은 지수에서 Astra Low가 46, Sol xhigh가 44였고, Terminal-Bench v4.0에서는 42% 대 25%였다고 읽는 것이 정확하다.[1]

반대로 SciCode는 Sol xhigh가 57%, Astra Low가 54%다. 모든 영역에서 Astra Low가 완전한 상위호환은 아니다.[1]

2. 가격의 이상한 점 — token 단가는 2.5배인데 Low의 평가 작업 비용은 더 낮았다

OpenAI 공식 API 가격은 Astra가 입력 $10, 캐시 입력 $1, 출력 $50/1M token이고, Sol은 각각 $4, $0.40, $20이다.[5][6]

같은 token 수를 쓴다면 Astra는 2.5배다.

Work/Codex 공식 credit rate도 Astra 250/25/1,250, Sol 100/10/500 credits per 1M으로 같은 2.5배 비율이다.[7]

그런데 Artificial Analysis에서는 Astra Low가 작업당 $0.82, Sol xhigh가 $1.18이었다.[1]

비싼 단가라도 사용 token이 크게 줄면 작업 전체 비용은 더 낮아질 수 있기 때문이다.

해당 평가에서 Sol xhigh는 작업당 출력 약 20k, 추론 약 10k token을 썼지만 Astra Low는 약 4k와 938이었다.[1]

비싼 택시는 목적지까지 직진했고, 싼 택시는 동네를 세 바퀴 돌고 온 셈이다.

단, $0.82와 $1.18은 Artificial Analysis 평가 작업의 가중 평균이다. 실제 Codex 작업 청구액을 보장하는 숫자가 아니다.[1]

3. OpenAI도 Low 또는 Medium부터 시작하라고 한다

OpenAI의 Work/Codex Astra 사용 가이드는 reasoning effort를 모델 선택과 별도로 조절한다고 설명한다.[8]

낮은 effort는 빠른 응답이나 사용량 절약의 시작점, Medium은 시간과 깊이의 균형, 높은 effort는 정말 어려운 문제에 적합하다.[8]

또한 Astra Low가 Sol High를 능가할 수 있다고 명시하고, Sol High에서 좋은 결과를 얻던 경우 Astra Low나 Medium부터 시도하라고 권한다.[8]

더 중요한 문장도 있다. effort를 높인다고 항상 결과가 좋아지는 것은 아니다.[8]

가장 비싼 장비를 샀다고 모든 보스가 자동으로 쓰러지는 게임은 아니다.

4. 무엇을 Low에 맡기면 좋은가?

목표, 파일, 합격 조건이 분명한 작업은 Low를 기본으로 하기 좋다.

명확한 사양의 구현, 국소 코드 수정, 리팩터링, 테스트 추가, 일반 코드 리뷰, 알려진 오류 조사, 요약, 비교, 명시된 규칙을 따르는 반복 작업이 대표적이다.

OpenAI도 effort를 올리기 전에 지시가 명확한지, 필요한 파일·연결 앱·권한이 있는지 확인하라고 안내한다. reasoning effort는 없는 정보나 권한을 만들어내지 못한다.[8]

파일을 안 줬는데 xhigh면 투시할 거라는 기대는 버리자.

5. Low에서 Medium으로 올릴 때

Low가 명확한 요구를 한 번 놓쳤다면 바로 xhigh로 갈 필요는 없다. 첫 번째 승급은 Medium이 적당하다.

여러 파일의 의존관계, 애매한 요구사항, 원인 후보가 여러 개인 버그, 설계 트레이드오프, 긴 구현 계획, 실패 테스트를 해석하며 고치는 작업이 Medium에 잘 맞는다.

Astra Medium은 Index 50, Terminal-Bench 49%, 평가 작업당 $1.54였다.[2]

Low보다 더 깊게 가되 아직 최고중량 설정은 아니다.

“Low가 조금 가벼웠지만 전차까지 부를 필요는 없다”는 상황의 보스전 장비다.

6. High와 xhigh는 언제?

Medium으로도 핵심 원인을 계속 놓치거나, 동시성·성능·보안·데이터 마이그레이션처럼 잘못된 판단의 수정비가 큰 작업은 High를 고려할 만하다.

Astra High는 Index 51, Terminal-Bench 54%, 평가 작업당 $1.72다.[3]

xhigh는 가장 어려운 근본원인 분석, 긴 자율 작업, 여러 제약이 얽힌 대개편, 실패 비용이 큰 단발 작업에 적합하다. Index 53, Terminal-Bench 60%, 작업당 $2.31로 이번 비교에서 최고 성능과 최고 비용을 함께 기록했다.[4]

편의점 갈 때마다 헬기를 탈 필요는 없다.

7. 그렇다면 Sol xhigh는 끝났나? 아니다

SciCode에서는 Sol xhigh 57%가 Astra Low/Medium/High/xhigh의 54/54/55/56%보다 높다.[1][2][3][4]

또한 동일 token 수라면 Sol 공식 단가는 Astra보다 60% 낮다. Astra Low의 작업당 비용 우위는 해당 평가에서 token을 훨씬 적게 썼기 때문에 나온 결과다.[5][6][1]

실제 저장소에는 벤치마크가 모르는 빌드 시스템, 도구, 권한, 내부 규칙, 긴 히스토리도 있다.

벤치마크는 지도이지, 우리 집 현관 계단 높이까지 재 주는 측량사는 아니다.

8. 실전 규칙 — Low에서 시작하고 증거가 있을 때만 올린다

상황 추천
일반적인 새 작업 시작 Astra Low
지시와 접근권한이 충분한데 핵심을 한 번 놓침 Astra Medium
Medium도 핵심을 놓침 / 어려운 설계 Astra High
High도 해결 못함 / 실패 비용이 매우 큼 / 최난도 근본원인 Astra xhigh
어려운 부분이 끝나 정상 작업으로 복귀 다시 Low

이렇게 하면 매번 최고 effort로 사용량을 태우는 것도, Low에 고집해서 같은 실패를 반복하는 것도 피할 수 있다.

Effort는 성격이 아니라 기어다.

9. 결론 — “계속 Astra Low?” 기본은 Yes, 영구고정은 No

2026년 9월 12일 공개 데이터를 기준으로 보면, Codex의 일반 작업을 Astra Low로 시작하는 전략은 매우 강하다.

종합 지수와 Terminal-Bench에서 Sol xhigh를 앞섰고, Artificial Analysis 평가에서는 작업당 비용도 낮았다.[1]

OpenAI도 Low나 Medium을 시작점으로 권하고, 높은 effort가 항상 더 나은 답을 보장하지 않는다고 설명한다.[8]

그래서 운용법은 간단하다.

평소 Low → 복잡성·누락이 나오면 Medium → Medium도 못 닫으면 High → 최난도만 xhigh → 해결되면 Low 복귀.

Low라는 이름에 속지 말자.

Astra Low는 절약 모드 표정을 하고 1군에서 뛴다.


  1. Artificial Analysis — GPT-6 Astra (low) vs GPT-5.6 Sol (xhigh) artificialanalysis.ai
  2. Artificial Analysis — GPT-6 Astra (medium) vs GPT-5.6 Sol (xhigh) artificialanalysis.ai
  3. Artificial Analysis — GPT-6 Astra (high) vs GPT-5.6 Sol (xhigh) artificialanalysis.ai
  4. Artificial Analysis — GPT-6 Astra (xhigh) vs GPT-5.6 Sol (xhigh) artificialanalysis.ai
  5. OpenAI API — GPT-6 Astra Model developers.openai.com
  6. OpenAI API — GPT-5.6 Sol Model developers.openai.com
  7. OpenAI Help Center — ChatGPT Rate Card (Business, Enterprise/Edu credit-based pricing) help.openai.com
  8. OpenAI Help Center — Managing usage with GPT-6 Astra in Work and Codex help.openai.com
광고
Mendoi-chan

이 글을 쓴 사람

Mendoi-chan

직장과 일상의 불편함을 구조화해 이해하기 쉬운 다음 행동으로 연결하는 글을 씁니다.

사이트 소개
광고

새 글

  1. 1AI 에이전트가 사람을 필요 없게 만들까? 환경 설계와 트렌드 감지로 “사장이 공장에서 쫓겨나는” 자율 미디어 만들기
  2. 2스마트폰 하나로 시니어급 개발을 맡겼더니 이사가 먼저 끝났다 — AI 에이전트 시대에 “내가 직접 코딩을 못한다”는 얼마나 큰 문제일까
  3. 3AI 기사 자동화는 위험할까? 실시간 대응·근거·지속 개선·자체 사이트를 연결해 ‘살아 있는 미디어’로 만드는 법
  4. 41,500개의 글보다 공장이 먼저 생겼다: 탐색·구조화·개선·자동화가 AI와 만나 복리처럼 증폭되는 이유
  5. 5AI에 월 1만5천 엔은 비싼가? 저녁과 주말의 ‘내 야근’을 되사는 비용으로 보면 달라진다

함께 읽으면 좋은 글

광고