5 秒结论: Claude Opus 5.5 的关键进步并不只是单题正确率更高。更重要的是,它更擅长长时间编码、巨型代码库、连续调用工具、自我检查和多阶段任务,而且比 Opus 5 用更少的步骤和 token 完成工作。API 价格也下降了。前沿 AI 的比赛正在从“谁更像智商测试冠军”变成“谁能一直干到验收通过”。[1]
1. 社交媒体都在喊“Opus 太离谱”,但真正重要的不是用量条
发布后很快出现了各种体验帖:高 effort 跑几个小时,用量似乎没掉多少;多个编码、动画、音乐任务并行,限制也没有迅速见底。
这些故事很有趣,但用量条不是严谨实验。套餐、缓存命中率、effort、任务类型、重置机制都会影响“用了 8%”到底代表什么。
不过这一次,官方数据确实支持“效率大幅提高”这一方向。
Anthropic 表示,Opus 5.5 在典型工作负载下比 Opus 5 便宜约 40%,输出速度快 30% 以上。API 每百万 token 的输入价格为 4 美元,输出 20 美元,缓存读取 0.20 美元;Opus 5 分别为 5、25 和 0.50 美元。[1]
关键不是“回答更短所以更省”,而是从接任务到完成任务之间的无效往返更少。
2. 从 5 到 5.5,进化的不只是脑子,还有“工作习惯”
Anthropic 给出的案例相当直接。
一位早期用户在不到一天内完成了约 68 万行代码的迁移。另一个约 20 万行代码库的审计与修复任务中,Opus 5.5 用不到 3 小时完成,而 Opus 5 超过 20 小时,且使用了约 2.5 倍的 token。[1]
在网页性能优化测试中,Opus 5.5 尝试 40 次,有 39 次成功改善了整个应用的加载速度。GitHub、Lovable、Kiro 等早期测试者也表示,它更倾向于一次收集上下文后做完整修改,更少陷入重试循环,并使用更少的工具调用和步骤完成任务。[1]
传统 AI agent 最经典的事故流程是:
- 调查;
- 修一半;
- 发现另一个问题;
- 高兴地宣布“已发现问题”;
- 等人类回来问:“很好,所以你倒是修啊?”
Opus 5.5 真正重要的变化,是减少这种“中间成果快递”,把调查→修改→测试→再修改→确认完成串起来。
3. 它的探索能力比 GPT-6 Astra 强吗?要先定义“探索”
把探索压成一个数字,很容易得出错误结论。
在 Anthropic 的对照表中,Terminal-Bench 4.0:Opus 5.5 为 66.4%,Astra 为 57.9%;FrontierCode Main 为 54.4% 对 53.3%;GDPval-AA 知识工作为 1846 对 1542。[1]
但科学研究工作流 Terminal-Bench Science 0.1 则是 Opus 5.5 58.7%,Astra 64.6%。AutomationBench 也是 Astra 略高:41.4% 对 40.0%。[1]
OpenAI 还报告 Astra 在 ARC-AGI-3 上达到 99.9%,强调它在全新环境中的规则学习与适应能力。[2]
粗略来说:
| 探索类型 | 当前倾向 |
|---|---|
| 阅读大型代码库、定位原因、持续修复 | Opus 5.5 很强 |
| 多文件修改、测试、反复纠错 | Opus 5.5 很强 |
| 长时间保持同一个工程目标 | Opus 5.5 提升明显 |
| 科学软件、模拟、拟合和研究流程 | Astra 评价更高 |
| 学习陌生环境规则并攻略 | Astra 非常强 |
| 浏览器、电脑、多应用综合 agent | 很依赖 harness 与任务 |
所以既不是“Astra 过时了”,也不是“Opus 全面碾压”。
探索不仅是突然想出正确答案,更包括建立分支、试验、丢弃失败方案、保留上下文并继续前进。此时 token 效率、工具使用质量和长程稳定性本身就是能力的一部分。
4. GPT-6 Sol 也降价了:AI 的“加班费”突然变便宜
OpenAI 也在打同一场效率战。
GPT-6 Sol 官方模型页面列出的价格是每百万 token 输入 2 美元、输出 10 美元、缓存输入 0.20 美元;上下文窗口 105 万 token,最大输出 12.8 万 token,并明确面向复杂编码与 agent 工作流。[3]
于是竞争问题开始变化。
不再只是:
“谁最聪明?”
而越来越像:
“谁能调用 100 次工具、跑几个小时,还不先把预算和速率限制打爆?”
推理变便宜,就意味着可以多做几条探索分支、多跑一轮验证、多加几个子 agent。
智能降价,本质上也是试错降价。
5. Claude 套餐多少钱?20 美元起,但不等于“全部无限”
Anthropic 当前个人套餐为:Free 0 美元,Pro 每月 20 美元或每年 200 美元,Max 5x 每月 100 美元,Max 20x 每月 200 美元。Max 大约提供 Pro 5 倍或 20 倍的会话容量,并包含 Claude Code。[4][5][6]
最重要的是,不要把订阅、交互式 Claude Code、API、非交互式执行当成同一个钱包。
购买 Pro 或 Max 并不意味着 Anthropic API 无限免费。普通 API key 仍按量计费,Opus 5.5 的基础价格为每百万 token 输入 4 美元、输出 20 美元。[1][4]
交互式 Claude Code 则会使用套餐内额度。
从 2026 年 6 月 15 日起,符合条件的 Pro、Max、Team、Enterprise 用户使用 Agent SDK 和 Claude Code 非交互模式 claude -p 时,不再占用普通 Claude 套餐的使用上限,并可领取独立的月度 Agent SDK credit:Pro 20 美元、Max 5x 100 美元、Max 20x 200 美元。直接用 API key 的 Claude Platform 按量计费账户不享受这项 credit。[7]
所以结论不是“订阅之后全部无限”,而是:如果把交互工作和自动化工作拆开设计,费用结构会突然变得很有意思。AI 价格表已经开始向电信套餐进化。
6. 能把 Opus 5.5 塞进 OpenCode 吗?API 可以,直接吃订阅套餐则是另一回事
OpenCode 支持大量 LLM provider,所以用 Anthropic API key 接 Claude 模型本身很正常。[8]
但“我已经买了 Claude Pro/Max,OpenCode 能不能直接吃这个包月额度?”需要谨慎。
OpenCode 当前文档写得很明确:确实存在让 OpenCode 使用 Claude Pro/Max 模型的插件,但 Anthropic 明确禁止这种用法;OpenCode 从 1.3.0 起也不再内置这些插件。[8]
因此最干净的两条路线是:
- OpenCode + Anthropic API:自由,但按量收费。
- Claude Code + Pro/Max:Anthropic 官方路径,交互式使用消耗订阅额度。
也可以做角色分工:GPT-6 Sol 负责便宜的大批量任务,Opus 5.5 负责长时间代码库级完工,Astra 负责最难的科学与陌生环境探索。
AI 终于也开始岗位分工了。至少它们还没有要求开周会。
7. 真正的地壳运动,是“怎么把工作交给 AI”变了
过去的顶级模型常常是很聪明的顾问,却未必是好员工。
它们喜欢在这里停下:
“我调查了问题。”
“我找到根因了。”
“下一步建议是……”
然后人类只能回:“对,所以请做下一步。”
Opus 5.5 值得关注的是持续工作的案例。Anthropic 的早期用户报告中,有跨 6 个代码库无人运行超过 18 小时的任务,也有大规模迁移、审计和更容易建立自我验证循环的案例。[1]
如果这种能力能稳定复现,提示词会从:
“修这个函数。”
变成:
“实现这个目标。调查原因,做必要修改,运行测试,失败就修复,直到满足完成条件。”
模型评估也会从单一 benchmark 排名,转向更实际的指标:完成率、人类追加提示次数、总 token、总工具调用、实际耗时、失败后的自我恢复率。
也许不存在一个全能的“最强模型”。
但 Opus 5.5 很像一个时代信号:AI agent 的竞争,正在从能力考试走向出勤记录和完工记录。
8. 那到底掉额度有多快?Astra 从官方表看就属于“油耗高”
现在进入互联网最爱看的项目:额度条移动速度大赛。
OpenAI 当前帮助文档说明,Work 和 Codex 共用一套使用额度,一些套餐同时有 5 小时限制和周限制。每 5 小时预计可发送的本地消息数,GPT-6 Astra 在 Plus 为 5–45、Pro 5x 为 25–225、Pro 20x 为 100–900;GPT-5.6 Sol 则分别为 10–100、50–500、200–2,000。[9]
这不是固定消息上限,真实消耗会随任务、推理设置和上下文变化。但仅从官方表就能看出,Astra 被设计成同样套餐额度下可运行次数更少的重型模型。
社区实测方向也类似。一位用户连续 20 天同时记录低价 Claude 与 Codex 套餐,按 API 价格换算后估计 Claude 的有效周额度约为 Codex 的 3–5 倍,具体取决于模型。[10] 另一位长期 Codex 用户表示,在 200 美元档使用 Astra High 进行约 20 小时编码后就耗尽了整周额度。[11]
Hacker News 也有人报告,100 美元档 Astra 约 5 小时就消耗了周额度 70%;另一位用户则称 Opus 5.5 做 8 小时深度算法工作只用了周额度 5%。[12]
当然,这不能直接翻译成“Claude 永远便宜 14 倍”。这些不是受控实验,任务、effort、缓存、subagent、reset 时间都不同,而且 Opus 5.5 发布时 Anthropic 还提高了 5 小时额度。[1]
较稳妥的结论是:
Astra 很强,但 quota 油耗高;Opus 5.5 目前不仅性能有竞争力,在“一周油箱能跑多久”上也很亮眼。
AI 比较终于从马力表进入百公里油耗表。
9. Claude Code 最低只要每月 20 美元,不必一上来就冲 100 美元
Claude Code 的订阅入口是 Pro:月付 20 美元,年付 200 美元,折合约 17 美元/月。Max 5x 为 100 美元/月,Max 20x 为 200 美元/月。[6][5]
所以如果只是想测试 Claude Code,最低门槛是 20 美元。
Max 主要买的是用量。Max 5x 大约是 Pro 的 5 倍会话容量,Max 20x 约为 20 倍。[5]
比较时可以固定同一个 repo 和类似任务,然后记录:
- 什么时候真正碰到 5 小时限制;
- 周额度下降多少百分比;
- 人类需要介入几次;
- 是否真正跑完测试;
- 是否制造了不必要的改动。
更贵的套餐与其说是“买更聪明的大脑”,不如说是确认员工靠谱以后给他排更长的班。
10. 从 Codex 迁到 Claude Code,要搬什么?不是“脑子”,是 Git 和交接文档
换 coding agent 时,很容易觉得应该把历史聊天全部导入,让新模型重新“学习”。
实际工程里,比起巨大的聊天原文,把仍然有效的决策压缩成 repo 内文件通常更可靠。
Claude Code 会在每个 session 开始时自动读取 repo 根目录的 CLAUDE.md。Anthropic 建议把 build/test 命令、目录结构、编码规范和长期约束放在这里,并建议尽量控制在约 200 行以内。[13]
一个实用的迁移结构是:
- Git repo:代码与历史的 source of truth;
- AGENTS.md:旧 agent 规则的参考;
- CLAUDE.md:Claude 每次 session 都要读取的稳定规则;
- docs/AI-HANDOFF.md:当前状态、未解决问题、近期决策;
- Git history:解释系统为什么变成今天这样。
还可以通过 /init 让 Claude Code 先生成 CLAUDE.md 草案。[13]
不要把 CLAUDE.md 写成“全人类知识.txt”。它会反复加载,越长越容易稀释真正重要的规则。secret、token、credential、连接字符串也不要放进去。[13]
迁移并不是重新训练模型。
不是复制一个模型的脑,而是把项目宪法与交接笔记放进 Git。
11. 给 Claude 的第一条指令,应该先是“从 repo 还原世界观”,再是“开始改”
第一次 session 如果先恢复上下文,再动代码,通常更不容易把旧系统误当成待重写项目。
交接 prompt 示例
接手这个由其他 coding agent 持续维护的 repository。
在修改代码之前,先检查整个 repo、README、AGENTS.md、docs、
package scripts、CI/deploy 配置以及 Git history。
找出 source of truth、build/test/deploy 路径、完成条件、
禁止事项和未解决问题。
将稳定的长期规则整理到 CLAUDE.md,
将当前状态和易变化信息整理到 docs/AI-HANDOFF.md。
不要显示、记录或 commit secret、token、credential。
提问前先从 repo 与历史记录中寻找证据。
只要测试或可执行的 production 验证仍未完成,就不要称任务已完成。
好处很直接:人不用把项目历史重新讲一遍。
而且只压缩仍然有效的决策,比把几个月的聊天原文塞进上下文干净得多。
AI 员工入职,最后居然还是文档最有用。
12. 电脑关掉还能继续跑的是哪个功能?不是“登出魔法”,而是云端执行
把术语分开就很简单。
Claude Code on the web 会把 GitHub repo 克隆到 Anthropic 管理的远端环境,在隔离 VM 中工作。任务开始后,即使离开页面也会继续执行;完成后可以把修改 push 到新 branch,并准备 PR 供审查。[14]
Claude Code Desktop 还有 “Continue with Claude Code on the web”,可以把本地桌面 session 转到云端,之后从 Web 或手机继续。[15]
周期任务也分两种:
- /loop:本地循环任务,适合最长约 3 天的本地周期执行,依赖本机;
- /schedule:Cloud Jobs,笔记本关上后仍在云端继续。[16]
Routines 更进一步:把 prompt、repo、connector 打包成自动化,在 Claude Code Web 基础设施上由定时、API 调用或事件触发无人执行。[17]
所以秘诀不是让本地进程靠意志力活下去,而是把工作本身搬到云端。
关浏览器不再等于 AI 下班,人类反而可以先回家。
当然,如果任务需要只存在于本机的文件或直接操作那台电脑,就另当别论。云端看不到的东西,AI 也不会突然学会心灵感应。
到了 2026 年,选 coding AI 已经不能只问“谁最聪明”。
要看的是 性能 × 完成率 × 周额度油耗 × 交接便利性 × 云端执行能力。
这也解释了为什么 Opus 5.5 + Claude Code 突然显得非常有竞争力。
参考资料(17条)
- Anthropic — “Introducing Claude Opus 5.5” (2026-09-22) Used for release claims, pricing, speed, Opus 5 comparisons, benchmark table, long-running coding examples, early-tester reports, and efficiency claims anthropic.com
- OpenAI — “GPT-6 Astra: A new generation of intelligence” Used for Astra benchmark results, ARC-AGI-3, Terminal-Bench Science, coding comparisons, and positioning around novel-environment adaptation openai.com
- OpenAI Developers — GPT-6 Sol model page Used for GPT-6 Sol model positioning, context/output limits, and advertised token pricing developers.openai.com
- Anthropic Help Center — “Choose a Claude plan” Used for Free, Pro, Max 5x, and Max 20x consumer pricing support.claude.com
- Anthropic Help Center — “What is the Max plan?” Used for Max usage multipliers and Claude Code access support.claude.com
- Anthropic Help Center — “What is the Pro plan?” Used for Pro pricing and Claude Code inclusion support.claude.com
- Anthropic Help Center — “Use the Claude Agent SDK with your Claude plan” Used for the June 15, 2026 separation of Agent SDK / claude -p usage from normal interactive plan limits, and the separate monthly credits for eligible Pro, Max, Team, and Enterprise users support.claude.com
- OpenCode — “Providers” Used for Anthropic provider setup and OpenCode’s current warning that using Claude Pro/Max through OpenCode is explicitly prohibited by Anthropic and that such plugins stopped being bundled from OpenCode 1.3.0 opencode.ai
- OpenAI Help Center — “Managing usage with GPT-6 Astra in Work and Codex” Used for shared Work/Codex allowance mechanics, five-hour and weekly-limit caveats, and estimated local messages per five-hour period for Astra, Sol, and other models help.openai.com
- Reddit r/codex — “Measured Claude usage limits are 3–5× those of Codex” (2026-09-18) Community measurement based on roughly twenty days of usage logging. Treated as anecdotal observational evidence, not a controlled benchmark reddit.com
- Reddit r/codex — “Codex is in a really bad spot right now…” (2026-09-23) Used only for community reports about heavy Astra weekly-quota consumption and Opus 5.5 usage experience. Not treated as vendor-independent benchmark proof reddit.com
- Hacker News — “Claude Opus 5.5” discussion (2026-09-23/24) Used for contrasting real-user usage anecdotes, including heavy Astra quota consumption and low Opus 5.5 weekly consumption in long algorithmic work. These reports are uncontrolled news.ycombinator.com
- Anthropic Help Center — “Give Claude context: CLAUDE.md and better prompts” Used for CLAUDE.md automatic loading, /init, recommended content, and keeping project instructions concise support.claude.com
- Anthropic Help Center — “Claude Code on the web” Used for remote GitHub execution, isolated environments, leaving the page while work continues, and branch/PR workflows support.claude.com
- Anthropic — “Preview, review, and merge with Claude Code” (2026-02-20) Used for “Continue with Claude Code on the web” and moving a desktop session into the cloud claude.com
- Anthropic Help Center — “Claude Code power user tips” Used for /loop as local recurring execution and /schedule as Cloud Jobs that continue when the laptop is closed support.claude.com
- Anthropic — “Introducing routines in Claude Code” (2026-04-14) Used for cloud routines triggered by schedules, API calls, or events claude.com
