5 秒結論: Claude Opus 5.5 的關鍵進步不只是單題正確率提高。更重要的是,它更能處理長時間程式工作、巨大程式庫、連續工具呼叫、自我檢查與多階段任務,而且比 Opus 5 用更少步驟與 token 完成。API 價格也下降。前沿 AI 的比賽正在從「誰是智力測驗冠軍」變成「誰真的會做到驗收」。[1]
1. 社群媒體都在喊「Opus 太扯」,但真正重要的不是用量條
發布後很快出現各種體驗文:High effort 跑幾個小時,用量似乎只掉一點;同時跑多個程式、動畫、音樂任務也沒有立刻撞上限制。
這些故事很好玩,但用量條不是嚴謹實驗。方案、快取命中率、effort、工作類型、重置機制都會改變「用了 8%」的意義。
不過這一次,官方數字確實支持效率大增。
Anthropic 表示,Opus 5.5 在典型工作負載下比 Opus 5 便宜約 40%,輸出速度快 30% 以上。API 每百萬 token 的輸入為 4 美元、輸出 20 美元、快取讀取 0.20 美元;Opus 5 則是 5、25、0.50 美元。[1]
重點不是「回答變短」,而是從接到任務到完成任務之間的無效往返變少。
2. 從 5 到 5.5,進步的不只是腦袋,而是工作方式
Anthropic 的案例很直接。
一位早期使用者在不到一天內完成約 68 萬行程式碼遷移。另一個約 20 萬行程式庫的稽核與修復工作,Opus 5.5 不到 3 小時完成,Opus 5 超過 20 小時,並使用約 2.5 倍 token。[1]
在網站效能測試中,Opus 5.5 針對全站載入時間的 40 次嘗試有 39 次成功。GitHub、Lovable、Kiro 等早期測試者也回報,它更能一次收集脈絡後做完整修改、更少掉入重試迴圈,並用更少工具呼叫與步驟完成工作。[1]
傳統 agent 的經典事故:
- 調查;
- 修一半;
- 發現另一個問題;
- 很開心地說「已找到問題」;
- 等人類回來說:「很好,所以修掉啊?」
Opus 5.5 真正重要的方向,是減少這種「中間成果宅配」,把調查→修改→測試→再修改→確認完成接起來。
3. 探索能力比 GPT-6 Astra 強嗎?要先說你指哪一種探索
把探索壓成單一分數,很容易出事。
Anthropic 的比較表中,Terminal-Bench 4.0 是 Opus 5.5 66.4%、Astra 57.9%;FrontierCode Main 是 54.4% 對 53.3%;GDPval-AA 知識工作則是 1846 對 1542。[1]
但科學研究流程 Terminal-Bench Science 0.1 是 Opus 5.5 58.7%、Astra 64.6%。AutomationBench 也由 Astra 以 41.4% 對 40.0% 略高。[1]
OpenAI 另外報告 Astra 在 ARC-AGI-3 上達 99.9%,強調它在陌生環境中學習規則與適應的能力。[2]
大致可以這樣看:
| 探索種類 | 目前傾向 |
|---|---|
| 讀巨大 repo、找原因、持續修復 | Opus 5.5 很強 |
| 多檔修改、測試、反覆修正 | Opus 5.5 很強 |
| 長時間維持同一工程目標 | Opus 5.5 改善很大 |
| 科學軟體、模擬、擬合、研究流程 | Astra 評分較高 |
| 學習全新環境規則並破解 | Astra 非常強 |
| 瀏覽器、電腦、多應用 agent | 很依賴 harness 與任務 |
所以既不是「Astra 退休」,也不是「Opus 全面勝利」。
探索不是只靠靈光一閃,而是建立分支、嘗試、淘汰失敗方案、保留脈絡並繼續前進。token 效率與工具使用品質因此也變成實際能力的一部分。
4. GPT-6 Sol 也降價了:AI 的加班費突然變便宜
OpenAI 也在打同一場效率戰。
GPT-6 Sol 官方模型頁列出的價格是每百萬 token 輸入 2 美元、輸出 10 美元、快取輸入 0.20 美元;上下文 105 萬 token、最大輸出 12.8 萬 token,定位就是複雜程式與 agent 工作流。[3]
因此問題開始從:
「誰最聰明?」
變成:
「誰能呼叫 100 次工具、跑幾個小時,還不先把預算和限額炸掉?」
推理成本下降,就能多做探索分支、多跑一輪驗證、多開幾個子 agent。
智慧降價,其實也是試錯降價。
5. Claude 方案多少錢?20 美元起,但不代表「全部無限」
Anthropic 目前個人方案為 Free 0 美元、Pro 每月 20 美元或每年 200 美元、Max 5x 每月 100 美元、Max 20x 每月 200 美元。Max 約提供 Pro 的 5 倍或 20 倍會話容量,並包含 Claude Code。[4][5][6]
重點是不要把訂閱、互動式 Claude Code、API、非互動執行當成同一個錢包。
買 Pro 或 Max 並不會讓 Anthropic API 無限免費。一般 API key 仍按量計費,Opus 5.5 基礎價格是每百萬 token 輸入 4 美元、輸出 20 美元。[1][4]
互動式 Claude Code 則會使用方案內額度。
自 2026 年 6 月 15 日起,符合資格的 Pro、Max、Team、Enterprise 使用者,其 Agent SDK 與 Claude Code 非互動模式 claude -p 已與一般 Claude 方案使用上限分離,並可領取獨立的每月 Agent SDK credit:Pro 20 美元、Max 5x 100 美元、Max 20x 200 美元。直接以 API key 使用 Claude Platform 的按量付費帳戶不適用此 credit。[7]
所以真正的結論不是「訂閱後全部無限」,而是:把互動工作和自動化工作拆開,成本結構可能突然變得很漂亮。AI 價目表已經開始有電信資費表的氣質了。
6. 能把 Opus 5.5 放進 OpenCode 嗎?API 可以,直接吃訂閱額度是另一回事
OpenCode 支援大量 LLM provider,因此用 Anthropic API key 接 Claude 模型本身很正常。[8]
但「我已經付 Pro/Max,能不能讓 OpenCode 直接吃包月額度?」要小心。
OpenCode 現行文件寫明:確實有讓 OpenCode 使用 Claude Pro/Max 模型的外掛,但 Anthropic 明確禁止這種用法;OpenCode 自 1.3.0 起也不再內建那些外掛。[8]
因此乾淨的路徑是:
- OpenCode + Anthropic API:自由,但按量收費。
- Claude Code + Pro/Max:Anthropic 官方路線,互動使用消耗訂閱限額。
實務上也可以角色分工:GPT-6 Sol 做便宜的大量執行,Opus 5.5 做長時間 repo 完工,Astra 做最難的科學或陌生環境探索。
AI 也有職務分工了。好消息是它們還不會要求每週站會。
7. 真正的地殼變動,是「怎麼把工作交給 AI」改變了
過去的頂級模型常是很好的顧問,但不一定是好工人。
常常停在:
「我調查了。」
「我找到根因了。」
「下一步建議是……」
然後人類只能回:「對,所以做下一步。」
Opus 5.5 值得注意的是持續工作的案例。Anthropic 早期使用者曾讓它跨 6 個 repo 無人運作超過 18 小時,也有大型遷移、稽核與自我驗證迴圈更容易建立的報告。[1]
如果這種表現能穩定重現,提示方式會從:
「修這個函式。」
變成:
「達成這個結果。調查原因、做必要修改、跑測試、失敗就修,直到完成條件全部滿足。」
評估模型也會從單一 benchmark 王冠,轉向完工率、人類追加指示次數、總 token、工具呼叫、實際時間、失敗後自我恢復率。
也許永遠沒有一個全能「最強模型」。
但 Opus 5.5 很像一個時代標誌:AI agent 的競爭正在從能力考試走向出勤紀錄與完工紀錄。
8. 到底額度掉多快?Astra 從官方表看就是高油耗型
現在進入網路最愛的比賽:看使用量進度條跑多快。
OpenAI 現行說明指出,Work 與 Codex 共用使用額度,部分方案同時受 5 小時與每週限制。每 5 小時預估本機訊息數,GPT-6 Astra 在 Plus 為 5–45、Pro 5x 為 25–225、Pro 20x 為 100–900;GPT-5.6 Sol 則分別是 10–100、50–500、200–2,000。[9]
這不是固定訊息上限,實際消耗會隨工作、推理設定與 context 改變。但官方表本身已經把 Astra 定位成同一額度下可執行次數較少的重型模型。
社群實測方向也接近。一位使用者連續 20 天記錄低價 Claude 與 Codex 方案,依 API 價格換算後估計 Claude 的有效每週額度約為 Codex 的 3–5 倍,視模型而定。[10] 另一位長期 Codex 使用者則表示,在 200 美元級方案用 Astra High 編碼約 20 小時後就用完整週額度。[11]
Hacker News 上也有人回報,100 美元級 Astra 約 5 小時就吃掉每週 70%;另一人則稱 Opus 5.5 做 8 小時深度演算法工作只用了每週 5%。[12]
這當然不能直接變成「Claude 永遠便宜 14 倍」。這些不是受控實驗,task、effort、cache、subagent、reset 時間都不同,而且 Opus 5.5 發布時 Anthropic 也提高了 5 小時上限。[1]
比較穩健的解讀是:
Astra 很強,但 quota 油耗重;Opus 5.5 目前不只能力有競爭力,在“一週油箱能跑多久”這件事也很突出。
AI 比較正式從馬力進入油耗。
9. Claude Code 最低每月 20 美元,不需要一開始就衝 100 美元
Claude Code 的訂閱入口是 Pro:月付 20 美元,年付 200 美元,折合約每月 17 美元。Max 5x 每月 100 美元,Max 20x 每月 200 美元。[6][5]
所以如果只是想測 Claude Code,最低門檻是 20 美元。
Max 主要買的是用量。Max 5x 約為 Pro 的 5 倍 session 容量,Max 20x 約為 20 倍。[5]
比較時可以固定同一個 repo 和相似任務,記錄:
- 何時真的撞到 5 小時限制;
- 每週額度掉了多少百分比;
- 人類需要介入幾次;
- 測試是否真的跑完;
- 多做了多少不必要變更。
較高方案與其說是「買更聰明的大腦」,不如說是確認這名員工值得用之後再加長班表。
10. 從 Codex 換到 Claude Code,要搬什麼?不是「腦」,而是 Git 與交接文件
換 coding agent 時,很容易以為所有舊聊天都要搬過去,讓新模型重新「學習」。
實務上,比巨大聊天紀錄更可靠的做法是把仍有效的決策壓縮成 repo 裡的文件。
Claude Code 會在每個 session 開始時自動讀取 repo 根目錄的 CLAUDE.md。Anthropic 建議把 build/test 指令、目錄結構、程式規範與長期約束放在這裡,並建議盡量保持在約 200 行以下。[13]
實用的遷移結構如下:
- Git repo:程式碼與歷史的 source of truth;
- AGENTS.md:舊 agent 規則的參考;
- CLAUDE.md:Claude 每次 session 都要讀的穩定規則;
- docs/AI-HANDOFF.md:目前狀態、未解問題、近期決策;
- Git history:還原「為什麼現在長這樣」的證據。
也可以使用 /init 讓 Claude Code 先草擬 CLAUDE.md。[13]
不要把 CLAUDE.md 變成「全人類知識.txt」。它每次都會載入,太長反而讓真正重要的規則被沖淡。secret、token、credential、連線字串也不要放進去。[13]
所以遷移不是重新訓練。
不是複製一個模型的大腦,而是把專案憲法和交接筆記放進 Git。
11. 第一次給 Claude 的指示,先說「從 repo 還原世界觀」,再說「開始改」
第一次 session 先恢復 context,再動程式碼,通常比較不會把既有設計誤判成應該重寫的東西。
交接 prompt 範例
接手這個由其他 coding agent 持續維護的 repository。
修改程式碼前,先檢查整個 repo、README、AGENTS.md、docs、
package scripts、CI/deploy 設定與 Git history。
找出 source of truth、build/test/deploy 路徑、完成條件、
禁止事項與未解問題。
將穩定長期規則整理到 CLAUDE.md,
將目前狀態與易變資訊整理到 docs/AI-HANDOFF.md。
不要顯示、記錄或 commit secret、token、credential。
提問前先從 repo 與歷史中尋找證據。
只要測試或可執行的 production 驗證仍未完成,就不要稱工作已完成。
這樣人類就不用把整個專案歷史再口述一次。
而且只壓縮仍有效的決策,比把數月聊天原文塞進 context 乾淨得多。
AI 員工 onboarding,最後還是文件最可靠。
12. 電腦關掉還會繼續跑的是什麼?不是登出魔法,是 cloud execution
把概念分開就很簡單。
Claude Code on the web 會把 GitHub repo clone 到 Anthropic 管理的遠端環境,在隔離 VM 裡工作。任務開始後離開頁面也會繼續,完成後可把變更 push 到新 branch,並準備 PR 供 review。[14]
Claude Code Desktop 的 “Continue with Claude Code on the web” 可以把本機桌面 session 移到雲端,之後從 Web 或手機繼續。[15]
週期任務又分兩種:
- /loop:本機循環,適合約 3 天內的 local recurring task,依賴本機;
- /schedule:Cloud Jobs,筆電關上後仍會在雲端繼續。[16]
Routines 則可把 prompt、repo、connector 包成自動化,透過 schedule、API call 或 event 在 Claude Code Web 基礎設施上無人執行。[17]
所以訣竅不是硬讓 local process 活著,而是把工作本身搬到雲端。
關瀏覽器已經不代表 AI 下班,反而人類可以先下班。
當然,若工作需要只存在本機的檔案或直接操作那台電腦,就另當別論。雲端看不到的東西不會靠心電感應出現。
2026 年選 coding AI,已經不能只問「誰最聰明」。
要看 性能 × 完成率 × 每週油耗 × 交接便利性 × cloud execution。
這個乘積,就是 Opus 5.5 + Claude Code 突然變得很有吸引力的原因。
參考資料(17筆)
- Anthropic — “Introducing Claude Opus 5.5” (2026-09-22) Used for release claims, pricing, speed, Opus 5 comparisons, benchmark table, long-running coding examples, early-tester reports, and efficiency claims anthropic.com
- OpenAI — “GPT-6 Astra: A new generation of intelligence” Used for Astra benchmark results, ARC-AGI-3, Terminal-Bench Science, coding comparisons, and positioning around novel-environment adaptation openai.com
- OpenAI Developers — GPT-6 Sol model page Used for GPT-6 Sol model positioning, context/output limits, and advertised token pricing developers.openai.com
- Anthropic Help Center — “Choose a Claude plan” Used for Free, Pro, Max 5x, and Max 20x consumer pricing support.claude.com
- Anthropic Help Center — “What is the Max plan?” Used for Max usage multipliers and Claude Code access support.claude.com
- Anthropic Help Center — “What is the Pro plan?” Used for Pro pricing and Claude Code inclusion support.claude.com
- Anthropic Help Center — “Use the Claude Agent SDK with your Claude plan” Used for the June 15, 2026 separation of Agent SDK / claude -p usage from normal interactive plan limits, and the separate monthly credits for eligible Pro, Max, Team, and Enterprise users support.claude.com
- OpenCode — “Providers” Used for Anthropic provider setup and OpenCode’s current warning that using Claude Pro/Max through OpenCode is explicitly prohibited by Anthropic and that such plugins stopped being bundled from OpenCode 1.3.0 opencode.ai
- OpenAI Help Center — “Managing usage with GPT-6 Astra in Work and Codex” Used for shared Work/Codex allowance mechanics, five-hour and weekly-limit caveats, and estimated local messages per five-hour period for Astra, Sol, and other models help.openai.com
- Reddit r/codex — “Measured Claude usage limits are 3–5× those of Codex” (2026-09-18) Community measurement based on roughly twenty days of usage logging. Treated as anecdotal observational evidence, not a controlled benchmark reddit.com
- Reddit r/codex — “Codex is in a really bad spot right now…” (2026-09-23) Used only for community reports about heavy Astra weekly-quota consumption and Opus 5.5 usage experience. Not treated as vendor-independent benchmark proof reddit.com
- Hacker News — “Claude Opus 5.5” discussion (2026-09-23/24) Used for contrasting real-user usage anecdotes, including heavy Astra quota consumption and low Opus 5.5 weekly consumption in long algorithmic work. These reports are uncontrolled news.ycombinator.com
- Anthropic Help Center — “Give Claude context: CLAUDE.md and better prompts” Used for CLAUDE.md automatic loading, /init, recommended content, and keeping project instructions concise support.claude.com
- Anthropic Help Center — “Claude Code on the web” Used for remote GitHub execution, isolated environments, leaving the page while work continues, and branch/PR workflows support.claude.com
- Anthropic — “Preview, review, and merge with Claude Code” (2026-02-20) Used for “Continue with Claude Code on the web” and moving a desktop session into the cloud claude.com
- Anthropic Help Center — “Claude Code power user tips” Used for /loop as local recurring execution and /schedule as Cloud Jobs that continue when the laptop is closed support.claude.com
- Anthropic — “Introducing routines in Claude Code” (2026-04-14) Used for cloud routines triggered by schedules, API calls, or events claude.com
