Opus 5.5 到底为什么这么夸张?真正可怕的不是“更聪明的 AI”,而是“真的能把活干完的 AI”

发布后很快出现了各种体验帖:高 effort 跑几个小时,用量似乎没掉多少;多个编码、动画、音乐任务并行,限制也没有迅速见底。

阅读功能说明

收听会朗读正文;速读会按顺序显示短语,速度可调。语言练习可对照已有的不同语言版本。收藏保存在本浏览器中,可从播放器的收藏列表再次打开。

分享这篇文章

分享这篇文章

广告
广告

5 秒结论: Claude Opus 5.5 的关键进步并不只是单题正确率更高。更重要的是,它更擅长长时间编码、巨型代码库、连续调用工具、自我检查和多阶段任务,而且比 Opus 5 用更少的步骤和 token 完成工作。API 价格也下降了。前沿 AI 的比赛正在从“谁更像智商测试冠军”变成“谁能一直干到验收通过”。[1]

1. 社交媒体都在喊“Opus 太离谱”,但真正重要的不是用量条

发布后很快出现了各种体验帖:高 effort 跑几个小时,用量似乎没掉多少;多个编码、动画、音乐任务并行,限制也没有迅速见底。

这些故事很有趣,但用量条不是严谨实验。套餐、缓存命中率、effort、任务类型、重置机制都会影响“用了 8%”到底代表什么。

不过这一次,官方数据确实支持“效率大幅提高”这一方向。

Anthropic 表示,Opus 5.5 在典型工作负载下比 Opus 5 便宜约 40%,输出速度快 30% 以上。API 每百万 token 的输入价格为 4 美元,输出 20 美元,缓存读取 0.20 美元;Opus 5 分别为 5、25 和 0.50 美元。[1]

关键不是“回答更短所以更省”,而是从接任务到完成任务之间的无效往返更少。

2. 从 5 到 5.5,进化的不只是脑子,还有“工作习惯”

Anthropic 给出的案例相当直接。

一位早期用户在不到一天内完成了约 68 万行代码的迁移。另一个约 20 万行代码库的审计与修复任务中,Opus 5.5 用不到 3 小时完成,而 Opus 5 超过 20 小时,且使用了约 2.5 倍的 token。[1]

在网页性能优化测试中,Opus 5.5 尝试 40 次,有 39 次成功改善了整个应用的加载速度。GitHub、Lovable、Kiro 等早期测试者也表示,它更倾向于一次收集上下文后做完整修改,更少陷入重试循环,并使用更少的工具调用和步骤完成任务。[1]

传统 AI agent 最经典的事故流程是:

  1. 调查;
  2. 修一半;
  3. 发现另一个问题;
  4. 高兴地宣布“已发现问题”;
  5. 等人类回来问:“很好,所以你倒是修啊?”

Opus 5.5 真正重要的变化,是减少这种“中间成果快递”,把调查→修改→测试→再修改→确认完成串起来。

3. 它的探索能力比 GPT-6 Astra 强吗?要先定义“探索”

把探索压成一个数字,很容易得出错误结论。

在 Anthropic 的对照表中,Terminal-Bench 4.0:Opus 5.5 为 66.4%,Astra 为 57.9%;FrontierCode Main 为 54.4% 对 53.3%;GDPval-AA 知识工作为 1846 对 1542。[1]

但科学研究工作流 Terminal-Bench Science 0.1 则是 Opus 5.5 58.7%,Astra 64.6%。AutomationBench 也是 Astra 略高:41.4% 对 40.0%。[1]

OpenAI 还报告 Astra 在 ARC-AGI-3 上达到 99.9%,强调它在全新环境中的规则学习与适应能力。[2]

粗略来说:

探索类型 当前倾向
阅读大型代码库、定位原因、持续修复 Opus 5.5 很强
多文件修改、测试、反复纠错 Opus 5.5 很强
长时间保持同一个工程目标 Opus 5.5 提升明显
科学软件、模拟、拟合和研究流程 Astra 评价更高
学习陌生环境规则并攻略 Astra 非常强
浏览器、电脑、多应用综合 agent 很依赖 harness 与任务

所以既不是“Astra 过时了”,也不是“Opus 全面碾压”。

探索不仅是突然想出正确答案,更包括建立分支、试验、丢弃失败方案、保留上下文并继续前进。此时 token 效率、工具使用质量和长程稳定性本身就是能力的一部分。

4. GPT-6 Sol 也降价了:AI 的“加班费”突然变便宜

OpenAI 也在打同一场效率战。

GPT-6 Sol 官方模型页面列出的价格是每百万 token 输入 2 美元、输出 10 美元、缓存输入 0.20 美元;上下文窗口 105 万 token,最大输出 12.8 万 token,并明确面向复杂编码与 agent 工作流。[3]

于是竞争问题开始变化。

不再只是:

“谁最聪明?”

而越来越像:

“谁能调用 100 次工具、跑几个小时,还不先把预算和速率限制打爆?”

推理变便宜,就意味着可以多做几条探索分支、多跑一轮验证、多加几个子 agent。

智能降价,本质上也是试错降价。

5. Claude 套餐多少钱?20 美元起,但不等于“全部无限”

Anthropic 当前个人套餐为:Free 0 美元,Pro 每月 20 美元或每年 200 美元,Max 5x 每月 100 美元,Max 20x 每月 200 美元。Max 大约提供 Pro 5 倍或 20 倍的会话容量,并包含 Claude Code。[4][5][6]

最重要的是,不要把订阅、交互式 Claude Code、API、非交互式执行当成同一个钱包。

购买 Pro 或 Max 并不意味着 Anthropic API 无限免费。普通 API key 仍按量计费,Opus 5.5 的基础价格为每百万 token 输入 4 美元、输出 20 美元。[1][4]

交互式 Claude Code 则会使用套餐内额度。

从 2026 年 6 月 15 日起,符合条件的 Pro、Max、Team、Enterprise 用户使用 Agent SDK 和 Claude Code 非交互模式 claude -p 时,不再占用普通 Claude 套餐的使用上限,并可领取独立的月度 Agent SDK credit:Pro 20 美元、Max 5x 100 美元、Max 20x 200 美元。直接用 API key 的 Claude Platform 按量计费账户不享受这项 credit。[7]

所以结论不是“订阅之后全部无限”,而是:如果把交互工作和自动化工作拆开设计,费用结构会突然变得很有意思。AI 价格表已经开始向电信套餐进化。

6. 能把 Opus 5.5 塞进 OpenCode 吗?API 可以,直接吃订阅套餐则是另一回事

OpenCode 支持大量 LLM provider,所以用 Anthropic API key 接 Claude 模型本身很正常。[8]

但“我已经买了 Claude Pro/Max,OpenCode 能不能直接吃这个包月额度?”需要谨慎。

OpenCode 当前文档写得很明确:确实存在让 OpenCode 使用 Claude Pro/Max 模型的插件,但 Anthropic 明确禁止这种用法;OpenCode 从 1.3.0 起也不再内置这些插件。[8]

因此最干净的两条路线是:

  • OpenCode + Anthropic API:自由,但按量收费。
  • Claude Code + Pro/Max:Anthropic 官方路径,交互式使用消耗订阅额度。

也可以做角色分工:GPT-6 Sol 负责便宜的大批量任务,Opus 5.5 负责长时间代码库级完工,Astra 负责最难的科学与陌生环境探索。

AI 终于也开始岗位分工了。至少它们还没有要求开周会。

7. 真正的地壳运动,是“怎么把工作交给 AI”变了

过去的顶级模型常常是很聪明的顾问,却未必是好员工。

它们喜欢在这里停下:

“我调查了问题。”
“我找到根因了。”
“下一步建议是……”

然后人类只能回:“对,所以请做下一步。”

Opus 5.5 值得关注的是持续工作的案例。Anthropic 的早期用户报告中,有跨 6 个代码库无人运行超过 18 小时的任务,也有大规模迁移、审计和更容易建立自我验证循环的案例。[1]

如果这种能力能稳定复现,提示词会从:

“修这个函数。”

变成:

“实现这个目标。调查原因,做必要修改,运行测试,失败就修复,直到满足完成条件。”

模型评估也会从单一 benchmark 排名,转向更实际的指标:完成率、人类追加提示次数、总 token、总工具调用、实际耗时、失败后的自我恢复率。

也许不存在一个全能的“最强模型”。

但 Opus 5.5 很像一个时代信号:AI agent 的竞争,正在从能力考试走向出勤记录和完工记录。

8. 那到底掉额度有多快?Astra 从官方表看就属于“油耗高”

现在进入互联网最爱看的项目:额度条移动速度大赛。

OpenAI 当前帮助文档说明,Work 和 Codex 共用一套使用额度,一些套餐同时有 5 小时限制和周限制。每 5 小时预计可发送的本地消息数,GPT-6 Astra 在 Plus 为 5–45、Pro 5x 为 25–225、Pro 20x 为 100–900;GPT-5.6 Sol 则分别为 10–100、50–500、200–2,000。[9]

这不是固定消息上限,真实消耗会随任务、推理设置和上下文变化。但仅从官方表就能看出,Astra 被设计成同样套餐额度下可运行次数更少的重型模型。

社区实测方向也类似。一位用户连续 20 天同时记录低价 Claude 与 Codex 套餐,按 API 价格换算后估计 Claude 的有效周额度约为 Codex 的 3–5 倍,具体取决于模型。[10] 另一位长期 Codex 用户表示,在 200 美元档使用 Astra High 进行约 20 小时编码后就耗尽了整周额度。[11]

Hacker News 也有人报告,100 美元档 Astra 约 5 小时就消耗了周额度 70%;另一位用户则称 Opus 5.5 做 8 小时深度算法工作只用了周额度 5%。[12]

当然,这不能直接翻译成“Claude 永远便宜 14 倍”。这些不是受控实验,任务、effort、缓存、subagent、reset 时间都不同,而且 Opus 5.5 发布时 Anthropic 还提高了 5 小时额度。[1]

较稳妥的结论是:

Astra 很强,但 quota 油耗高;Opus 5.5 目前不仅性能有竞争力,在“一周油箱能跑多久”上也很亮眼。

AI 比较终于从马力表进入百公里油耗表。

9. Claude Code 最低只要每月 20 美元,不必一上来就冲 100 美元

Claude Code 的订阅入口是 Pro:月付 20 美元,年付 200 美元,折合约 17 美元/月。Max 5x 为 100 美元/月,Max 20x 为 200 美元/月。[6][5]

所以如果只是想测试 Claude Code,最低门槛是 20 美元。

Max 主要买的是用量。Max 5x 大约是 Pro 的 5 倍会话容量,Max 20x 约为 20 倍。[5]

比较时可以固定同一个 repo 和类似任务,然后记录:

  • 什么时候真正碰到 5 小时限制;
  • 周额度下降多少百分比;
  • 人类需要介入几次;
  • 是否真正跑完测试;
  • 是否制造了不必要的改动。

更贵的套餐与其说是“买更聪明的大脑”,不如说是确认员工靠谱以后给他排更长的班。

10. 从 Codex 迁到 Claude Code,要搬什么?不是“脑子”,是 Git 和交接文档

换 coding agent 时,很容易觉得应该把历史聊天全部导入,让新模型重新“学习”。

实际工程里,比起巨大的聊天原文,把仍然有效的决策压缩成 repo 内文件通常更可靠。

Claude Code 会在每个 session 开始时自动读取 repo 根目录的 CLAUDE.md。Anthropic 建议把 build/test 命令、目录结构、编码规范和长期约束放在这里,并建议尽量控制在约 200 行以内。[13]

一个实用的迁移结构是:

  • Git repo:代码与历史的 source of truth;
  • AGENTS.md:旧 agent 规则的参考;
  • CLAUDE.md:Claude 每次 session 都要读取的稳定规则;
  • docs/AI-HANDOFF.md:当前状态、未解决问题、近期决策;
  • Git history:解释系统为什么变成今天这样。

还可以通过 /init 让 Claude Code 先生成 CLAUDE.md 草案。[13]

不要把 CLAUDE.md 写成“全人类知识.txt”。它会反复加载,越长越容易稀释真正重要的规则。secret、token、credential、连接字符串也不要放进去。[13]

迁移并不是重新训练模型。

不是复制一个模型的脑,而是把项目宪法与交接笔记放进 Git。

11. 给 Claude 的第一条指令,应该先是“从 repo 还原世界观”,再是“开始改”

第一次 session 如果先恢复上下文,再动代码,通常更不容易把旧系统误当成待重写项目。

交接 prompt 示例

接手这个由其他 coding agent 持续维护的 repository。
在修改代码之前,先检查整个 repo、README、AGENTS.md、docs、
package scripts、CI/deploy 配置以及 Git history。
找出 source of truth、build/test/deploy 路径、完成条件、
禁止事项和未解决问题。
将稳定的长期规则整理到 CLAUDE.md,
将当前状态和易变化信息整理到 docs/AI-HANDOFF.md。
不要显示、记录或 commit secret、token、credential。
提问前先从 repo 与历史记录中寻找证据。
只要测试或可执行的 production 验证仍未完成,就不要称任务已完成。

好处很直接:人不用把项目历史重新讲一遍。

而且只压缩仍然有效的决策,比把几个月的聊天原文塞进上下文干净得多。

AI 员工入职,最后居然还是文档最有用。

12. 电脑关掉还能继续跑的是哪个功能?不是“登出魔法”,而是云端执行

把术语分开就很简单。

Claude Code on the web 会把 GitHub repo 克隆到 Anthropic 管理的远端环境,在隔离 VM 中工作。任务开始后,即使离开页面也会继续执行;完成后可以把修改 push 到新 branch,并准备 PR 供审查。[14]

Claude Code Desktop 还有 “Continue with Claude Code on the web”,可以把本地桌面 session 转到云端,之后从 Web 或手机继续。[15]

周期任务也分两种:

  • /loop:本地循环任务,适合最长约 3 天的本地周期执行,依赖本机;
  • /schedule:Cloud Jobs,笔记本关上后仍在云端继续。[16]

Routines 更进一步:把 prompt、repo、connector 打包成自动化,在 Claude Code Web 基础设施上由定时、API 调用或事件触发无人执行。[17]

所以秘诀不是让本地进程靠意志力活下去,而是把工作本身搬到云端。

关浏览器不再等于 AI 下班,人类反而可以先回家。

当然,如果任务需要只存在于本机的文件或直接操作那台电脑,就另当别论。云端看不到的东西,AI 也不会突然学会心灵感应。

到了 2026 年,选 coding AI 已经不能只问“谁最聪明”。

要看的是 性能 × 完成率 × 周额度油耗 × 交接便利性 × 云端执行能力。

这也解释了为什么 Opus 5.5 + Claude Code 突然显得非常有竞争力。


参考资料(17条)

  1. Anthropic — “Introducing Claude Opus 5.5” (2026-09-22) Used for release claims, pricing, speed, Opus 5 comparisons, benchmark table, long-running coding examples, early-tester reports, and efficiency claims anthropic.com
  2. OpenAI — “GPT-6 Astra: A new generation of intelligence” Used for Astra benchmark results, ARC-AGI-3, Terminal-Bench Science, coding comparisons, and positioning around novel-environment adaptation openai.com
  3. OpenAI Developers — GPT-6 Sol model page Used for GPT-6 Sol model positioning, context/output limits, and advertised token pricing developers.openai.com
  4. Anthropic Help Center — “Choose a Claude plan” Used for Free, Pro, Max 5x, and Max 20x consumer pricing support.claude.com
  5. Anthropic Help Center — “What is the Max plan?” Used for Max usage multipliers and Claude Code access support.claude.com
  6. Anthropic Help Center — “What is the Pro plan?” Used for Pro pricing and Claude Code inclusion support.claude.com
  7. Anthropic Help Center — “Use the Claude Agent SDK with your Claude plan” Used for the June 15, 2026 separation of Agent SDK / claude -p usage from normal interactive plan limits, and the separate monthly credits for eligible Pro, Max, Team, and Enterprise users support.claude.com
  8. OpenCode — “Providers” Used for Anthropic provider setup and OpenCode’s current warning that using Claude Pro/Max through OpenCode is explicitly prohibited by Anthropic and that such plugins stopped being bundled from OpenCode 1.3.0 opencode.ai
  9. OpenAI Help Center — “Managing usage with GPT-6 Astra in Work and Codex” Used for shared Work/Codex allowance mechanics, five-hour and weekly-limit caveats, and estimated local messages per five-hour period for Astra, Sol, and other models help.openai.com
  10. Reddit r/codex — “Measured Claude usage limits are 3–5× those of Codex” (2026-09-18) Community measurement based on roughly twenty days of usage logging. Treated as anecdotal observational evidence, not a controlled benchmark reddit.com
  11. Reddit r/codex — “Codex is in a really bad spot right now…” (2026-09-23) Used only for community reports about heavy Astra weekly-quota consumption and Opus 5.5 usage experience. Not treated as vendor-independent benchmark proof reddit.com
  12. Hacker News — “Claude Opus 5.5” discussion (2026-09-23/24) Used for contrasting real-user usage anecdotes, including heavy Astra quota consumption and low Opus 5.5 weekly consumption in long algorithmic work. These reports are uncontrolled news.ycombinator.com
  13. Anthropic Help Center — “Give Claude context: CLAUDE.md and better prompts” Used for CLAUDE.md automatic loading, /init, recommended content, and keeping project instructions concise support.claude.com
  14. Anthropic Help Center — “Claude Code on the web” Used for remote GitHub execution, isolated environments, leaving the page while work continues, and branch/PR workflows support.claude.com
  15. Anthropic — “Preview, review, and merge with Claude Code” (2026-02-20) Used for “Continue with Claude Code on the web” and moving a desktop session into the cloud claude.com
  16. Anthropic Help Center — “Claude Code power user tips” Used for /loop as local recurring execution and /schedule as Cloud Jobs that continue when the laptop is closed support.claude.com
  17. Anthropic — “Introducing routines in Claude Code” (2026-04-14) Used for cloud routines triggered by schedules, API calls, or events claude.com

分享这篇文章

广告

查找其他文章

所有文章

Mendoi-chan

作者

Mendoi-chan

把工作与日常生活中的麻烦整理成清晰的结构和下一步行动。

关于本站
广告

最新文章

  1. 1Zero撤退的那一刻,黑色骑士团也该撤了|藤堂与“过度依赖Zero”的组织极限
  2. 2从第一季第25话等到R2:实时追番观众的地狱|枪口悬念之后,R2又像从“记忆被改写”开始
  3. 3蓝月亮,并不是蓝色的月亮
  4. 4为什么 Niconico 动画的评论,会带来一个人看时笑不出来的笑点
  5. 5“明明回复了,却被说成‘你根本不回’”——当聊天引擎被外包给一个人,会发生什么

推荐阅读

广告