Opus 5.5 到底為什麼這麼誇張?真正可怕的不是「更聰明的 AI」,而是「真的會把工作做完的 AI」

發布後很快出現各種體驗文:High effort 跑幾個小時,用量似乎只掉一點;同時跑多個程式、動畫、音樂任務也沒有立刻撞上限制。

閱讀功能說明

收聽會朗讀正文;速讀會依序顯示短語,速度可調。語言練習可對照現有的不同語言版本。收藏儲存在本瀏覽器中,可從播放器的收藏清單再次開啟。

分享這篇文章
廣告
廣告

5 秒結論: Claude Opus 5.5 的關鍵進步不只是單題正確率提高。更重要的是,它更能處理長時間程式工作、巨大程式庫、連續工具呼叫、自我檢查與多階段任務,而且比 Opus 5 用更少步驟與 token 完成。API 價格也下降。前沿 AI 的比賽正在從「誰是智力測驗冠軍」變成「誰真的會做到驗收」。[1]

1. 社群媒體都在喊「Opus 太扯」,但真正重要的不是用量條

發布後很快出現各種體驗文:High effort 跑幾個小時,用量似乎只掉一點;同時跑多個程式、動畫、音樂任務也沒有立刻撞上限制。

這些故事很好玩,但用量條不是嚴謹實驗。方案、快取命中率、effort、工作類型、重置機制都會改變「用了 8%」的意義。

不過這一次,官方數字確實支持效率大增。

Anthropic 表示,Opus 5.5 在典型工作負載下比 Opus 5 便宜約 40%,輸出速度快 30% 以上。API 每百萬 token 的輸入為 4 美元、輸出 20 美元、快取讀取 0.20 美元;Opus 5 則是 5、25、0.50 美元。[1]

重點不是「回答變短」,而是從接到任務到完成任務之間的無效往返變少。

2. 從 5 到 5.5,進步的不只是腦袋,而是工作方式

Anthropic 的案例很直接。

一位早期使用者在不到一天內完成約 68 萬行程式碼遷移。另一個約 20 萬行程式庫的稽核與修復工作,Opus 5.5 不到 3 小時完成,Opus 5 超過 20 小時,並使用約 2.5 倍 token。[1]

在網站效能測試中,Opus 5.5 針對全站載入時間的 40 次嘗試有 39 次成功。GitHub、Lovable、Kiro 等早期測試者也回報,它更能一次收集脈絡後做完整修改、更少掉入重試迴圈,並用更少工具呼叫與步驟完成工作。[1]

傳統 agent 的經典事故:

  1. 調查;
  2. 修一半;
  3. 發現另一個問題;
  4. 很開心地說「已找到問題」;
  5. 等人類回來說:「很好,所以修掉啊?」

Opus 5.5 真正重要的方向,是減少這種「中間成果宅配」,把調查→修改→測試→再修改→確認完成接起來。

3. 探索能力比 GPT-6 Astra 強嗎?要先說你指哪一種探索

把探索壓成單一分數,很容易出事。

Anthropic 的比較表中,Terminal-Bench 4.0 是 Opus 5.5 66.4%、Astra 57.9%;FrontierCode Main 是 54.4% 對 53.3%;GDPval-AA 知識工作則是 1846 對 1542。[1]

但科學研究流程 Terminal-Bench Science 0.1 是 Opus 5.5 58.7%、Astra 64.6%。AutomationBench 也由 Astra 以 41.4% 對 40.0% 略高。[1]

OpenAI 另外報告 Astra 在 ARC-AGI-3 上達 99.9%,強調它在陌生環境中學習規則與適應的能力。[2]

大致可以這樣看:

探索種類 目前傾向
讀巨大 repo、找原因、持續修復 Opus 5.5 很強
多檔修改、測試、反覆修正 Opus 5.5 很強
長時間維持同一工程目標 Opus 5.5 改善很大
科學軟體、模擬、擬合、研究流程 Astra 評分較高
學習全新環境規則並破解 Astra 非常強
瀏覽器、電腦、多應用 agent 很依賴 harness 與任務

所以既不是「Astra 退休」,也不是「Opus 全面勝利」。

探索不是只靠靈光一閃,而是建立分支、嘗試、淘汰失敗方案、保留脈絡並繼續前進。token 效率與工具使用品質因此也變成實際能力的一部分。

4. GPT-6 Sol 也降價了:AI 的加班費突然變便宜

OpenAI 也在打同一場效率戰。

GPT-6 Sol 官方模型頁列出的價格是每百萬 token 輸入 2 美元、輸出 10 美元、快取輸入 0.20 美元;上下文 105 萬 token、最大輸出 12.8 萬 token,定位就是複雜程式與 agent 工作流。[3]

因此問題開始從:

「誰最聰明?」

變成:

「誰能呼叫 100 次工具、跑幾個小時,還不先把預算和限額炸掉?」

推理成本下降,就能多做探索分支、多跑一輪驗證、多開幾個子 agent。

智慧降價,其實也是試錯降價。

5. Claude 方案多少錢?20 美元起,但不代表「全部無限」

Anthropic 目前個人方案為 Free 0 美元、Pro 每月 20 美元或每年 200 美元、Max 5x 每月 100 美元、Max 20x 每月 200 美元。Max 約提供 Pro 的 5 倍或 20 倍會話容量,並包含 Claude Code。[4][5][6]

重點是不要把訂閱、互動式 Claude Code、API、非互動執行當成同一個錢包。

買 Pro 或 Max 並不會讓 Anthropic API 無限免費。一般 API key 仍按量計費,Opus 5.5 基礎價格是每百萬 token 輸入 4 美元、輸出 20 美元。[1][4]

互動式 Claude Code 則會使用方案內額度。

自 2026 年 6 月 15 日起,符合資格的 Pro、Max、Team、Enterprise 使用者,其 Agent SDK 與 Claude Code 非互動模式 claude -p 已與一般 Claude 方案使用上限分離,並可領取獨立的每月 Agent SDK credit:Pro 20 美元、Max 5x 100 美元、Max 20x 200 美元。直接以 API key 使用 Claude Platform 的按量付費帳戶不適用此 credit。[7]

所以真正的結論不是「訂閱後全部無限」,而是:把互動工作和自動化工作拆開,成本結構可能突然變得很漂亮。AI 價目表已經開始有電信資費表的氣質了。

6. 能把 Opus 5.5 放進 OpenCode 嗎?API 可以,直接吃訂閱額度是另一回事

OpenCode 支援大量 LLM provider,因此用 Anthropic API key 接 Claude 模型本身很正常。[8]

但「我已經付 Pro/Max,能不能讓 OpenCode 直接吃包月額度?」要小心。

OpenCode 現行文件寫明:確實有讓 OpenCode 使用 Claude Pro/Max 模型的外掛,但 Anthropic 明確禁止這種用法;OpenCode 自 1.3.0 起也不再內建那些外掛。[8]

因此乾淨的路徑是:

  • OpenCode + Anthropic API:自由,但按量收費。
  • Claude Code + Pro/Max:Anthropic 官方路線,互動使用消耗訂閱限額。

實務上也可以角色分工:GPT-6 Sol 做便宜的大量執行,Opus 5.5 做長時間 repo 完工,Astra 做最難的科學或陌生環境探索。

AI 也有職務分工了。好消息是它們還不會要求每週站會。

7. 真正的地殼變動,是「怎麼把工作交給 AI」改變了

過去的頂級模型常是很好的顧問,但不一定是好工人。

常常停在:

「我調查了。」
「我找到根因了。」
「下一步建議是……」

然後人類只能回:「對,所以做下一步。」

Opus 5.5 值得注意的是持續工作的案例。Anthropic 早期使用者曾讓它跨 6 個 repo 無人運作超過 18 小時,也有大型遷移、稽核與自我驗證迴圈更容易建立的報告。[1]

如果這種表現能穩定重現,提示方式會從:

「修這個函式。」

變成:

「達成這個結果。調查原因、做必要修改、跑測試、失敗就修,直到完成條件全部滿足。」

評估模型也會從單一 benchmark 王冠,轉向完工率、人類追加指示次數、總 token、工具呼叫、實際時間、失敗後自我恢復率。

也許永遠沒有一個全能「最強模型」。

但 Opus 5.5 很像一個時代標誌:AI agent 的競爭正在從能力考試走向出勤紀錄與完工紀錄。

8. 到底額度掉多快?Astra 從官方表看就是高油耗型

現在進入網路最愛的比賽:看使用量進度條跑多快。

OpenAI 現行說明指出,Work 與 Codex 共用使用額度,部分方案同時受 5 小時與每週限制。每 5 小時預估本機訊息數,GPT-6 Astra 在 Plus 為 5–45、Pro 5x 為 25–225、Pro 20x 為 100–900;GPT-5.6 Sol 則分別是 10–100、50–500、200–2,000。[9]

這不是固定訊息上限,實際消耗會隨工作、推理設定與 context 改變。但官方表本身已經把 Astra 定位成同一額度下可執行次數較少的重型模型。

社群實測方向也接近。一位使用者連續 20 天記錄低價 Claude 與 Codex 方案,依 API 價格換算後估計 Claude 的有效每週額度約為 Codex 的 3–5 倍,視模型而定。[10] 另一位長期 Codex 使用者則表示,在 200 美元級方案用 Astra High 編碼約 20 小時後就用完整週額度。[11]

Hacker News 上也有人回報,100 美元級 Astra 約 5 小時就吃掉每週 70%;另一人則稱 Opus 5.5 做 8 小時深度演算法工作只用了每週 5%。[12]

這當然不能直接變成「Claude 永遠便宜 14 倍」。這些不是受控實驗,task、effort、cache、subagent、reset 時間都不同,而且 Opus 5.5 發布時 Anthropic 也提高了 5 小時上限。[1]

比較穩健的解讀是:

Astra 很強,但 quota 油耗重;Opus 5.5 目前不只能力有競爭力,在“一週油箱能跑多久”這件事也很突出。

AI 比較正式從馬力進入油耗。

9. Claude Code 最低每月 20 美元,不需要一開始就衝 100 美元

Claude Code 的訂閱入口是 Pro:月付 20 美元,年付 200 美元,折合約每月 17 美元。Max 5x 每月 100 美元,Max 20x 每月 200 美元。[6][5]

所以如果只是想測 Claude Code,最低門檻是 20 美元。

Max 主要買的是用量。Max 5x 約為 Pro 的 5 倍 session 容量,Max 20x 約為 20 倍。[5]

比較時可以固定同一個 repo 和相似任務,記錄:

  • 何時真的撞到 5 小時限制;
  • 每週額度掉了多少百分比;
  • 人類需要介入幾次;
  • 測試是否真的跑完;
  • 多做了多少不必要變更。

較高方案與其說是「買更聰明的大腦」,不如說是確認這名員工值得用之後再加長班表。

10. 從 Codex 換到 Claude Code,要搬什麼?不是「腦」,而是 Git 與交接文件

換 coding agent 時,很容易以為所有舊聊天都要搬過去,讓新模型重新「學習」。

實務上,比巨大聊天紀錄更可靠的做法是把仍有效的決策壓縮成 repo 裡的文件。

Claude Code 會在每個 session 開始時自動讀取 repo 根目錄的 CLAUDE.md。Anthropic 建議把 build/test 指令、目錄結構、程式規範與長期約束放在這裡,並建議盡量保持在約 200 行以下。[13]

實用的遷移結構如下:

  • Git repo:程式碼與歷史的 source of truth;
  • AGENTS.md:舊 agent 規則的參考;
  • CLAUDE.md:Claude 每次 session 都要讀的穩定規則;
  • docs/AI-HANDOFF.md:目前狀態、未解問題、近期決策;
  • Git history:還原「為什麼現在長這樣」的證據。

也可以使用 /init 讓 Claude Code 先草擬 CLAUDE.md。[13]

不要把 CLAUDE.md 變成「全人類知識.txt」。它每次都會載入,太長反而讓真正重要的規則被沖淡。secret、token、credential、連線字串也不要放進去。[13]

所以遷移不是重新訓練。

不是複製一個模型的大腦,而是把專案憲法和交接筆記放進 Git。

11. 第一次給 Claude 的指示,先說「從 repo 還原世界觀」,再說「開始改」

第一次 session 先恢復 context,再動程式碼,通常比較不會把既有設計誤判成應該重寫的東西。

交接 prompt 範例

接手這個由其他 coding agent 持續維護的 repository。
修改程式碼前,先檢查整個 repo、README、AGENTS.md、docs、
package scripts、CI/deploy 設定與 Git history。
找出 source of truth、build/test/deploy 路徑、完成條件、
禁止事項與未解問題。
將穩定長期規則整理到 CLAUDE.md,
將目前狀態與易變資訊整理到 docs/AI-HANDOFF.md。
不要顯示、記錄或 commit secret、token、credential。
提問前先從 repo 與歷史中尋找證據。
只要測試或可執行的 production 驗證仍未完成,就不要稱工作已完成。

這樣人類就不用把整個專案歷史再口述一次。

而且只壓縮仍有效的決策,比把數月聊天原文塞進 context 乾淨得多。

AI 員工 onboarding,最後還是文件最可靠。

12. 電腦關掉還會繼續跑的是什麼?不是登出魔法,是 cloud execution

把概念分開就很簡單。

Claude Code on the web 會把 GitHub repo clone 到 Anthropic 管理的遠端環境,在隔離 VM 裡工作。任務開始後離開頁面也會繼續,完成後可把變更 push 到新 branch,並準備 PR 供 review。[14]

Claude Code Desktop 的 “Continue with Claude Code on the web” 可以把本機桌面 session 移到雲端,之後從 Web 或手機繼續。[15]

週期任務又分兩種:

  • /loop:本機循環,適合約 3 天內的 local recurring task,依賴本機;
  • /schedule:Cloud Jobs,筆電關上後仍會在雲端繼續。[16]

Routines 則可把 prompt、repo、connector 包成自動化,透過 schedule、API call 或 event 在 Claude Code Web 基礎設施上無人執行。[17]

所以訣竅不是硬讓 local process 活著,而是把工作本身搬到雲端。

關瀏覽器已經不代表 AI 下班,反而人類可以先下班。

當然,若工作需要只存在本機的檔案或直接操作那台電腦,就另當別論。雲端看不到的東西不會靠心電感應出現。

2026 年選 coding AI,已經不能只問「誰最聰明」。

要看 性能 × 完成率 × 每週油耗 × 交接便利性 × cloud execution。

這個乘積,就是 Opus 5.5 + Claude Code 突然變得很有吸引力的原因。


參考資料(17筆)

  1. Anthropic — “Introducing Claude Opus 5.5” (2026-09-22) Used for release claims, pricing, speed, Opus 5 comparisons, benchmark table, long-running coding examples, early-tester reports, and efficiency claims anthropic.com
  2. OpenAI — “GPT-6 Astra: A new generation of intelligence” Used for Astra benchmark results, ARC-AGI-3, Terminal-Bench Science, coding comparisons, and positioning around novel-environment adaptation openai.com
  3. OpenAI Developers — GPT-6 Sol model page Used for GPT-6 Sol model positioning, context/output limits, and advertised token pricing developers.openai.com
  4. Anthropic Help Center — “Choose a Claude plan” Used for Free, Pro, Max 5x, and Max 20x consumer pricing support.claude.com
  5. Anthropic Help Center — “What is the Max plan?” Used for Max usage multipliers and Claude Code access support.claude.com
  6. Anthropic Help Center — “What is the Pro plan?” Used for Pro pricing and Claude Code inclusion support.claude.com
  7. Anthropic Help Center — “Use the Claude Agent SDK with your Claude plan” Used for the June 15, 2026 separation of Agent SDK / claude -p usage from normal interactive plan limits, and the separate monthly credits for eligible Pro, Max, Team, and Enterprise users support.claude.com
  8. OpenCode — “Providers” Used for Anthropic provider setup and OpenCode’s current warning that using Claude Pro/Max through OpenCode is explicitly prohibited by Anthropic and that such plugins stopped being bundled from OpenCode 1.3.0 opencode.ai
  9. OpenAI Help Center — “Managing usage with GPT-6 Astra in Work and Codex” Used for shared Work/Codex allowance mechanics, five-hour and weekly-limit caveats, and estimated local messages per five-hour period for Astra, Sol, and other models help.openai.com
  10. Reddit r/codex — “Measured Claude usage limits are 3–5× those of Codex” (2026-09-18) Community measurement based on roughly twenty days of usage logging. Treated as anecdotal observational evidence, not a controlled benchmark reddit.com
  11. Reddit r/codex — “Codex is in a really bad spot right now…” (2026-09-23) Used only for community reports about heavy Astra weekly-quota consumption and Opus 5.5 usage experience. Not treated as vendor-independent benchmark proof reddit.com
  12. Hacker News — “Claude Opus 5.5” discussion (2026-09-23/24) Used for contrasting real-user usage anecdotes, including heavy Astra quota consumption and low Opus 5.5 weekly consumption in long algorithmic work. These reports are uncontrolled news.ycombinator.com
  13. Anthropic Help Center — “Give Claude context: CLAUDE.md and better prompts” Used for CLAUDE.md automatic loading, /init, recommended content, and keeping project instructions concise support.claude.com
  14. Anthropic Help Center — “Claude Code on the web” Used for remote GitHub execution, isolated environments, leaving the page while work continues, and branch/PR workflows support.claude.com
  15. Anthropic — “Preview, review, and merge with Claude Code” (2026-02-20) Used for “Continue with Claude Code on the web” and moving a desktop session into the cloud claude.com
  16. Anthropic Help Center — “Claude Code power user tips” Used for /loop as local recurring execution and /schedule as Cloud Jobs that continue when the laptop is closed support.claude.com
  17. Anthropic — “Introducing routines in Claude Code” (2026-04-14) Used for cloud routines triggered by schedules, API calls, or events claude.com
廣告

尋找其他文章

所有文章

Mendoi-chan

作者

Mendoi-chan

把工作與日常生活中的麻煩整理成清楚的結構與下一步行動。

關於本站
廣告

最新文章

  1. 1Zero撤退的那一刻,黑色騎士團也該撤了|藤堂與「過度依賴Zero」的組織極限
  2. 2從第一季第25話等到R2:即時追番觀眾的地獄|槍口懸念之後,R2又像從「記憶被改寫」開始
  3. 3藍月亮,並不是藍色的月亮
  4. 4當外貌不再左右決定——從戀愛焦慮消失,到優先考慮契合度與生活設計
  5. 5「明明有回,卻被說『你根本沒回』」——把聊天引擎外包給一個人會發生什麼事

推薦閱讀

廣告