Opus 5.5가 왜 이렇게 난리인가? “더 똑똑한 AI”보다 “끝까지 일하는 AI”가 더 무섭다

출시 직후 몇 시간 동안 High로 돌려도 사용량이 거의 줄지 않았다는 이야기, 여러 코딩·창작 작업을 병렬로 돌려도 괜찮다는 이야기가 쏟아졌다.

읽기 기능 사용법

듣기는 본문을 읽어 줍니다. 속독은 구절을 차례로 표시하며 속도를 조절할 수 있습니다. 언어 연습은 다른 언어판과 번역을 비교합니다. 저장한 북마크는 이 브라우저의 플레이어 목록에서 다시 열 수 있습니다.

이 글 공유하기

이 글 공유하기

광고
광고

5초 요약: Claude Opus 5.5의 핵심 변화는 단발성 정답률만이 아니다. 긴 코딩 작업, 거대한 저장소, 반복적인 도구 사용, 자기 검증, 여러 단계의 완료 작업을 Opus 5보다 적은 단계와 토큰으로 수행하기 쉬워졌다는 점이 더 크다. API 가격도 내려갔다. AI 경쟁이 “누가 IQ 테스트를 이기나”에서 “누가 진짜 끝까지 일하나”로 이동하고 있다. [1]

1. SNS는 “Opus 미쳤다”로 도배됐지만, 진짜 핵심은 사용량 막대가 아니다

출시 직후 몇 시간 동안 High로 돌려도 사용량이 거의 줄지 않았다는 이야기, 여러 코딩·창작 작업을 병렬로 돌려도 괜찮다는 이야기가 쏟아졌다.

재미있는 사례지만 사용량 막대만으로는 과학이 아니다. 요금제, 캐시 적중률, effort 수준, 작업 종류, 리셋 여부가 다르면 같은 8%도 의미가 다르다.

다만 이번에는 공식 효율 수치가 뒤따른다. Anthropic은 Opus 5.5가 일반적인 작업에서 Opus 5보다 약 40% 저렴하고, 출력은 30% 이상 빠르며, API 가격은 100만 토큰당 입력 4달러, 출력 20달러, 캐시 읽기 0.20달러라고 밝혔다. Opus 5는 각각 5달러, 25달러, 0.50달러였다. [1]

중요한 것은 “답을 짧게 해서 절약한다”가 아니라, 업무를 끝낼 때까지의 불필요한 왕복 자체를 줄인다는 방향이다.

2. 5에서 5.5로 바뀐 것은 머리뿐 아니라 일하는 방식이다

사례가 꽤 노골적이다.

Anthropic은 한 초기 사용자가 68만 줄 규모 코드 마이그레이션을 하루 안에 끝냈다고 소개했다. 또 20만 줄 코드베이스 감사·수정에서는 Opus 5.5가 3시간 미만, Opus 5는 20시간 이상이 걸렸고 Opus 5가 약 2.5배의 토큰을 사용했다고 한다. [1]

웹 앱 최적화 테스트에서는 전체 페이지의 로딩 시간을 줄이는 시도 40번 중 39번 성공했다. GitHub, Lovable, Kiro 등의 초기 평가에서는 한 번 모은 맥락을 더 잘 재사용하고, 재시도 루프에 덜 빠지며, 더 적은 단계와 도구 호출로 작업을 끝낸다는 보고가 나왔다. [1]

기존 에이전트의 전형적인 사고는 이렇다.

  1. 조사한다.
  2. 절반만 고친다.
  3. 다른 문제를 발견한다.
  4. “문제를 발견했습니다”라고 자랑스럽게 종료한다.
  5. 사람이 “그래서 고치라고”라고 다시 말한다.

Opus 5.5의 진짜 진화는 이 “중간 결과 택배 서비스”를 줄이고 조사→수정→검사→재수정→완료 확인을 연결하는 쪽에 가깝다.

3. Astra보다 탐색을 잘하나? 탐색의 종류에 따라 답이 바뀐다

탐색을 하나의 숫자로 만들면 바로 혼란이 온다.

Anthropic 비교표에서 Terminal-Bench 4.0은 Opus 5.5 66.4%, GPT-6 Astra 57.9%다. FrontierCode Main은 54.4% 대 53.3%, GDPval-AA 지식 업무는 1846 대 1542였다. [1]

반면 과학 연구 워크플로의 Terminal-Bench Science 0.1은 Opus 5.5 58.7%, Astra 64.6%다. AutomationBench도 40.0% 대 41.4%로 Astra가 약간 높다. [1]

OpenAI는 Astra가 새로운 환경 적응을 보는 ARC-AGI-3에서 99.9%, 과학 워크플로에서 64.6%를 기록했다고 별도로 발표했다. [2]

대략 이렇게 볼 수 있다.

탐색 종류 현재 경향
거대한 저장소를 읽고 원인을 좁히며 계속 수정 Opus 5.5 강점
여러 파일 수정→테스트→재수정 Opus 5.5 강점
긴 세션에서 같은 목표 유지 Opus 5.5가 크게 개선
과학 소프트웨어·시뮬레이션·모델 피팅 Astra가 높은 평가
완전히 새로운 환경의 규칙 학습 Astra가 매우 강함
브라우저·컴퓨터·여러 앱을 넘나드는 작업 하네스와 작업에 따라 다름

따라서 “Astra 끝”도 아니고 “Opus가 전부 승리”도 아니다.

탐색은 한 번에 정답을 떠올리는 능력만이 아니다. 가지를 만들고, 시험하고, 버리고, 맥락을 유지하며 계속 가는 능력이다. 그래서 토큰 효율과 도구 사용 품질도 실질적인 지능의 일부가 된다.

4. GPT-6 Sol도 싸졌다. AI의 야근 수당이 갑자기 내려갔다

OpenAI도 같은 경제성 경쟁을 하고 있다.

GPT-6 Sol 공식 모델 페이지는 100만 토큰당 입력 2달러, 출력 10달러, 캐시 입력 0.20달러를 제시한다. 컨텍스트는 105만 토큰, 최대 출력은 12.8만 토큰이며 복잡한 코딩과 에이전트 워크플로용 모델로 설명된다. [3]

따라서 경쟁 질문이 바뀐다.

“누가 제일 똑똑한가?”

보다,

“100번 도구를 호출하고 몇 시간 돌려도 예산과 제한이 먼저 죽지 않는 모델은 누구인가?”

가 중요해진다.

추론 비용이 내려가면 탐색 가지를 더 만들고, 검증을 한 번 더 하고, 서브에이전트를 더 붙일 수 있다.

지능의 가격 인하는 곧 시행착오의 가격 인하다.

5. Claude 요금제는? 월 20달러부터지만 “전부 무제한”은 아니다

Anthropic의 개인용 요금은 Free 0달러, Pro 월 20달러 또는 연 200달러, Max 5x 월 100달러, Max 20x 월 200달러다. Max는 Pro보다 약 5배 또는 20배의 세션 용량을 제공하고 Claude Code도 포함한다. [4][5][6]

핵심은 구독, 대화형 Claude Code, API, 비대화형 실행을 하나의 지갑으로 착각하지 않는 것이다.

Pro나 Max를 구독해도 Anthropic API가 무제한 무료가 되는 것은 아니다. 일반 API key 사용은 종량제이며 Opus 5.5의 기본 API 가격은 백만 토큰당 입력 4달러, 출력 20달러다. [1][4]

대화형 Claude Code는 구독에 포함된 사용량을 소비한다.

반면 2026년 6월 15일부터 대상 Pro, Max, Team, Enterprise 사용자의 Agent SDK와 Claude Code 비대화형 모드 claude -p는 일반 Claude 플랜 사용 한도와 분리되었다. 대상자는 별도 월간 Agent SDK 크레딧을 받을 수 있으며 Pro 20달러, Max 5x 100달러, Max 20x 200달러다. API key로 직접 쓰는 종량제 Claude Platform 계정은 이 크레딧 대상이 아니다. [7]

즉 구독 하나로 모든 것이 무한이라는 뜻은 아니지만, 대화 작업과 자동 작업을 나누면 비용 구조가 갑자기 꽤 매력적으로 변한다. AI 요금제가 통신사 요금표보다 복잡해지는 날이 왔다.

6. OpenCode에 Opus 5.5를 넣을 수 있나? API라면 가능, 구독 직결은 별개 문제다

OpenCode는 여러 LLM 제공자를 지원하므로 Anthropic API 키로 Claude 모델을 사용하는 구조는 자연스럽다. [8]

하지만 “Pro/Max를 이미 내는데 그 정액제를 OpenCode가 그대로 쓰면 공짜 아닌가?”라는 생각에는 주의가 필요하다.

OpenCode의 현재 문서는 Pro/Max 모델을 OpenCode에서 쓰게 해 주는 플러그인이 존재하지만 Anthropic이 이를 명시적으로 금지하며, OpenCode 1.3.0부터는 해당 플러그인을 번들하지 않는다고 적고 있다. [8]

따라서 깔끔한 경로는 다음과 같다.

  • OpenCode + Anthropic API: 자유롭지만 종량제.
  • Claude Code + Pro/Max: Anthropic의 공식 경로이며 대화형 사용은 구독 한도를 사용.

저렴한 대량 실행은 GPT-6 Sol, 긴 저장소 작업의 완수는 Opus 5.5, 과학·미지 환경의 어려운 탐색은 Astra처럼 역할을 나누는 방식도 현실적이다.

AI도 이제 직무 분장이 생겼다. 다행히 아직 주간 회의는 잡지 않는다.

7. 진짜 지각변동은 “지능”보다 “맡기는 방식”의 변화다

기존 최상위 모델은 훌륭한 조언자였지만, 일꾼으로 쓰면 종종 이렇게 끝났다.

“조사했습니다.”
“원인을 찾았습니다.”
“다음 단계는 이것입니다.”

그러면 사람이 다시 “응, 그 다음 단계를 해”라고 해야 했다.

Opus 5.5에서 주목할 점은 장시간 계속 가는 사례다. 초기 사용자는 여섯 개 저장소를 넘나드는 작업을 18시간 이상 무인으로 진행했다고 보고했고, 대규모 마이그레이션과 감사, 자기 검증 루프 개선 사례도 제시됐다. [1]

이런 행동이 일반화된다면 프롬프트도 바뀐다.

“이 함수 고쳐.”

보다,

“이 결과를 달성하라. 원인을 찾고, 필요한 변경을 하고, 테스트하고, 실패하면 수정하고, 완료 조건을 충족할 때까지 계속하라.”

가 현실적인 지시가 된다.

모델 평가도 하나의 왕관 대신 완수율, 사람의 추가 지시 횟수, 총 토큰, 도구 호출 수, 실제 시간, 실패 후 자기 복구율을 보는 편이 실무적이다.

범용 최강 모델은 하나가 아닐 수 있다.

하지만 Opus 5.5는 AI 경쟁이 능력 시험에서 근태와 완수 실적으로 넘어가고 있다는 사실을 꽤 잘 보여 주는 출시다.

8. 그래서 실제로 얼마나 빨리 줄어드나? Astra는 공식 표부터 연비가 무겁다

이제 인터넷이 가장 좋아하는 벤치마크, 사용량 바 관찰 경기다.

OpenAI의 현재 도움말에 따르면 Work와 Codex는 공통 사용량을 쓰며, 일부 플랜에는 5시간 제한과 주간 제한이 함께 적용된다. 5시간당 예상 로컬 메시지 수는 GPT-6 Astra가 Plus 545, Pro 5x 25225, Pro 20x 100900이다. GPT-5.6 Sol은 각각 10100, 50500, 2002,000이다. [9]

고정 메시지 한도는 아니다. 실제 사용량은 작업, 추론 설정, 컨텍스트에 따라 달라진다. 그래도 공식 표만 봐도 Astra는 Sol보다 같은 포함량에서 요청 횟수가 적은 모델로 잡혀 있다.

커뮤니티 실측도 같은 방향을 보인다. 한 사용자는 20일 동안 저가 Claude와 Codex 플랜을 함께 측정해, API 비용 환산 기준 Claude의 실효 주간 허용량이 모델에 따라 Codex의 약 3~5배였다고 보고했다. [10] 다른 장기 Codex 사용자는 200달러급 플랜에서 Astra High로 약 20시간 코딩한 주에 주간 한도를 모두 소진했다고 했다. [11]

Hacker News에서는 100달러급 Astra를 약 5시간 사용해 주간 한도의 70%를 썼다는 사례가 있는 반면, Opus 5.5로 깊은 알고리즘 작업을 8시간 하고도 주간 5%였다는 사례도 있다. [12]

이를 “Claude는 항상 14배 싸다”로 읽으면 곧바로 과장이 된다. 통제 실험이 아니며 작업, effort, 캐시, subagent, reset 시점이 다르다. Opus 5.5 출시 때 Anthropic이 5시간 한도를 올린 점도 있다. [1]

방어 가능한 결론은 더 좁다.

Astra는 강하지만 quota 연비가 무겁다. Opus 5.5는 현재 성능뿐 아니라 ‘한 주 연료통으로 몇 시간 일하느냐’에서도 경쟁력이 높아 보인다.

AI 비교가 마력에서 연비로 넘어왔다.

9. Claude Code의 최저 진입가는 월 20달러다. 처음부터 100달러를 낼 필요는 없다

Claude Code를 subscription으로 쓰는 가장 낮은 진입점은 Pro로 월 20달러다. 연간 결제는 200달러로 월 환산 약 17달러다. Max 5x는 월 100달러, Max 20x는 월 200달러다. [6][5]

따라서 “Claude Code를 시험해 보고 싶다”면 최소 비용은 20달러다.

Max의 주된 가치는 사용량이다. Max 5x는 Pro의 약 5배, Max 20x는 약 20배의 세션 용량을 제공한다. [5]

비교할 때는 같은 repo, 비슷한 작업을 돌리고 다음을 기록하면 된다.

  • 5시간 제한이 실제로 언제 걸리는가
  • 주간 사용량이 몇 % 줄어드는가
  • 인간 개입이 몇 번 필요한가
  • 테스트까지 끝냈는가
  • 불필요한 변경이 얼마나 생겼는가

상위 플랜은 “더 똑똑한 뇌 구매”라기보다, 괜찮은 작업자를 확인한 뒤 근무 시간을 늘리는 것에 가깝다.

10. Codex에서 Claude Code로 무엇을 옮겨야 하나? ‘뇌’가 아니라 Git과 인수인계 문서다

코딩 에이전트를 바꾸면 예전 채팅을 전부 import해서 “학습”시켜야 할 것처럼 느껴진다.

실무에서는 거대한 대화 로그보다 결정 사항을 압축한 파일을 repo에 두는 방식이 더 안정적이다.

Claude Code는 repo root의 CLAUDE.md를 각 세션 시작 때 자동으로 읽는다. Anthropic은 여기에 build/test 명령, 디렉터리 구조, 코딩 규칙, 지속적인 제약을 넣으라고 권장하며 대략 200줄 이하를 목표로 하라고 안내한다. [13]

실용적인 이관 구조는 다음과 같다.

  • Git repo: 코드와 이력의 source of truth
  • AGENTS.md: 이전 agent가 사용하던 규칙의 참고 자료
  • CLAUDE.md: Claude가 매 세션 읽을 안정 규칙
  • docs/AI-HANDOFF.md: 현재 상태, 미해결 문제, 최근 결정
  • Git history: 왜 현재 구조가 되었는지 확인하는 증거

/init으로 CLAUDE.md 초안을 만들게 할 수도 있다. [13]

CLAUDE.md를 “인류 지식 전집.txt”로 만들면 안 된다. 매 세션 읽히므로 길수록 중요한 규칙이 희석된다. secret, token, credential, connection string도 넣지 않는다. [13]

즉 이관은 모델 재학습이 아니다.

한 모델의 뇌를 복제하는 것이 아니라 프로젝트의 헌법과 인수인계 노트를 Git에 넣는 것이다.

11. Claude에게 처음 줄 지시는 “고쳐”보다 먼저 “repo에서 세계관을 복원해”

첫 세션에서는 바로 코드를 바꾸기보다 먼저 상황을 복원시키는 편이 안전하다.

인수인계 prompt 예시

다른 coding agent가 작업하던 이 repository를 인수인계받아라.
코드를 변경하기 전에 repo 전체, README, AGENTS.md, docs,
package scripts, CI/deploy 설정, Git history를 확인하라.
source of truth, build/test/deploy 경로, 완료 조건, 금지 사항,
미해결 문제를 정리하라.
안정적인 규칙은 CLAUDE.md에, 현재 상태와 변동 정보는
docs/AI-HANDOFF.md에 정리하라.
secret, token, 인증 정보는 표시·기록·commit하지 마라.
질문하기 전에 repo와 이력에서 먼저 근거를 찾아라.
테스트나 확인 가능한 production 검증이 남아 있으면 완료라고 하지 마라.

이렇게 하면 사람이 프로젝트 역사를 처음부터 다시 구술할 필요가 없다.

원시 채팅 로그를 전부 밀어 넣는 대신 현재도 유효한 결정만 압축하므로 컨텍스트도 덜 더러워진다.

AI 직원 온보딩도 결국 문서화가 이긴다.

12. 노트북을 닫아도 계속하는 기능은? 로그아웃 마법이 아니라 cloud execution이다

용어를 분리하면 간단하다.

Claude Code on the web는 GitHub repo를 Anthropic의 원격 환경에 clone하고 격리된 VM에서 작업한다. 작업이 시작되면 페이지를 떠나도 계속 진행되고, 완료 후 변경을 branch에 push해 review용 PR을 만들 수 있다. [14]

Claude Code Desktop에는 “Continue with Claude Code on the web”가 있어 로컬 세션을 cloud로 넘긴 뒤 web이나 mobile에서 이어갈 수 있다. [15]

반복 작업도 둘로 나뉜다.

  • /loop: 로컬 반복 실행. 약 3일까지의 로컬 주기 작업용이며 PC에 의존한다.
  • /schedule: Cloud Jobs. 노트북을 닫아도 cloud에서 계속된다. [16]

Routines는 prompt, repo, connector를 묶어 schedule, API call, event를 trigger로 Claude Code web infrastructure에서 무인 실행할 수 있다. [17]

즉 핵심은 로컬 프로세스를 억지로 살려 두는 것이 아니라 일 자체를 cloud로 넘기는 것이다.

브라우저를 닫았다고 AI가 퇴근하는 시대는 끝났다. 사람만 먼저 퇴근할 수 있다.

단, 로컬 PC에만 있는 파일이나 물리 PC 조작이 필요한 작업은 별개다. cloud가 볼 수 없는 것은 텔레파시로 가져오지 못한다.

2026년 코딩 AI 선택은 이제 “누가 제일 똑똑한가?”만으로 부족하다.

성능 × 완수율 × 주간 연비 × 인수인계성 × cloud execution.

이 곱으로 보면 왜 Opus 5.5와 Claude Code 조합이 갑자기 강하게 보이는지 설명된다.


  1. Anthropic — “Introducing Claude Opus 5.5” (2026-09-22) Used for release claims, pricing, speed, Opus 5 comparisons, benchmark table, long-running coding examples, early-tester reports, and efficiency claims anthropic.com
  2. OpenAI — “GPT-6 Astra: A new generation of intelligence” Used for Astra benchmark results, ARC-AGI-3, Terminal-Bench Science, coding comparisons, and positioning around novel-environment adaptation openai.com
  3. OpenAI Developers — GPT-6 Sol model page Used for GPT-6 Sol model positioning, context/output limits, and advertised token pricing developers.openai.com
  4. Anthropic Help Center — “Choose a Claude plan” Used for Free, Pro, Max 5x, and Max 20x consumer pricing support.claude.com
  5. Anthropic Help Center — “What is the Max plan?” Used for Max usage multipliers and Claude Code access support.claude.com
  6. Anthropic Help Center — “What is the Pro plan?” Used for Pro pricing and Claude Code inclusion support.claude.com
  7. Anthropic Help Center — “Use the Claude Agent SDK with your Claude plan” Used for the June 15, 2026 separation of Agent SDK / claude -p usage from normal interactive plan limits, and the separate monthly credits for eligible Pro, Max, Team, and Enterprise users support.claude.com
  8. OpenCode — “Providers” Used for Anthropic provider setup and OpenCode’s current warning that using Claude Pro/Max through OpenCode is explicitly prohibited by Anthropic and that such plugins stopped being bundled from OpenCode 1.3.0 opencode.ai
  9. OpenAI Help Center — “Managing usage with GPT-6 Astra in Work and Codex” Used for shared Work/Codex allowance mechanics, five-hour and weekly-limit caveats, and estimated local messages per five-hour period for Astra, Sol, and other models help.openai.com
  10. Reddit r/codex — “Measured Claude usage limits are 3–5× those of Codex” (2026-09-18) Community measurement based on roughly twenty days of usage logging. Treated as anecdotal observational evidence, not a controlled benchmark reddit.com
  11. Reddit r/codex — “Codex is in a really bad spot right now…” (2026-09-23) Used only for community reports about heavy Astra weekly-quota consumption and Opus 5.5 usage experience. Not treated as vendor-independent benchmark proof reddit.com
  12. Hacker News — “Claude Opus 5.5” discussion (2026-09-23/24) Used for contrasting real-user usage anecdotes, including heavy Astra quota consumption and low Opus 5.5 weekly consumption in long algorithmic work. These reports are uncontrolled news.ycombinator.com
  13. Anthropic Help Center — “Give Claude context: CLAUDE.md and better prompts” Used for CLAUDE.md automatic loading, /init, recommended content, and keeping project instructions concise support.claude.com
  14. Anthropic Help Center — “Claude Code on the web” Used for remote GitHub execution, isolated environments, leaving the page while work continues, and branch/PR workflows support.claude.com
  15. Anthropic — “Preview, review, and merge with Claude Code” (2026-02-20) Used for “Continue with Claude Code on the web” and moving a desktop session into the cloud claude.com
  16. Anthropic Help Center — “Claude Code power user tips” Used for /loop as local recurring execution and /schedule as Cloud Jobs that continue when the laptop is closed support.claude.com
  17. Anthropic — “Introducing routines in Claude Code” (2026-04-14) Used for cloud routines triggered by schedules, API calls, or events claude.com

이 글 공유하기

광고

다른 글 찾기

모든 기사

Mendoi-chan

이 글을 쓴 사람

Mendoi-chan

직장과 일상의 불편함을 구조화해 이해하기 쉬운 다음 행동으로 연결하는 글을 씁니다.

사이트 소개
광고

새 글

  1. 1제로가 물러난 순간 흑의 기사단도 빠졌어야 했다|토도와 제로 의존의 한계
  2. 21기 25화에서 R2까지 기다린 실시간 시청자들의 지옥|총구 엔딩 뒤 기억이 조작된 듯 시작한 R2
  3. 3블루문은 파란색 달이 아니다
  4. 4“답장은 하는데 왜 ‘전혀 답을 안 해’가 되는가” — 대화 엔진을 한쪽에 외주 주면 생기는 일
  5. 5상담에서 늘려야 하는 것은 ‘확신’이 아니라 ‘정보’다

함께 읽으면 좋은 글

광고