Vì sao Opus 5.5 lại gây sốc đến vậy? Điều đáng sợ không phải “AI thông minh hơn” mà là “AI thực sự làm việc đến cùng”

Ngay sau khi phát hành, xuất hiện nhiều chia sẻ rằng người dùng chạy High trong nhiều giờ nhưng quota chỉ giảm ít, hoặc chạy đồng thời nhiều nhiệm vụ code và…

Cách dùng công cụ đọc

Nghe đọc bài thành tiếng. Đọc nhanh hiển thị lần lượt các cụm từ theo tốc độ bạn chọn. Luyện ngôn ngữ giúp đối chiếu các bản dịch hiện có. Lưu tạo dấu trang trong trình duyệt này; mở lại từ danh sách đã lưu của trình phát.

Chia sẻ bài viết này

Chia sẻ bài viết này

Quảng cáo
Quảng cáo

Kết luận 5 giây: Bước tiến của Claude Opus 5.5 không chỉ nằm ở độ chính xác của từng câu hỏi. Điểm lớn hơn là khả năng duy trì các nhiệm vụ lập trình dài, codebase khổng lồ, gọi công cụ liên tục, tự kiểm tra và hoàn tất quy trình nhiều bước với ít vòng lặp và ít token hơn Opus 5. Giá API cũng giảm. Cuộc đua AI đang chuyển từ “ai thắng bài kiểm tra IQ?” sang “ai làm đến khi nghiệm thu xong?”. [1]

1. Mạng xã hội hét “Opus quá điên”, nhưng thanh usage không phải câu chuyện chính

Ngay sau khi phát hành, xuất hiện nhiều chia sẻ rằng người dùng chạy High trong nhiều giờ nhưng quota chỉ giảm ít, hoặc chạy đồng thời nhiều nhiệm vụ code và sáng tạo.

Thú vị, nhưng thanh usage không phải benchmark khoa học. Gói thuê bao, cache hit, effort, loại công việc và reset giới hạn đều có thể khiến con số “chỉ dùng 8%” mang ý nghĩa khác nhau.

Lần này có số liệu chính thức hỗ trợ câu chuyện hiệu quả. Anthropic nói Opus 5.5 rẻ hơn khoảng 40% so với Opus 5 trên workload điển hình, tạo output nhanh hơn trên 30%, với giá API 4 USD cho một triệu token input, 20 USD cho output và 0,20 USD cho cache read. Opus 5 trước đó là 5, 25 và 0,50 USD. [1]

Điểm quan trọng không phải “trả lời ngắn để tiết kiệm”, mà là giảm các bước lãng phí từ lúc nhận việc đến lúc hoàn thành.

2. Từ 5 lên 5.5, thứ tiến hóa không chỉ là trí thông minh mà còn là cách làm việc

Các ví dụ rất rõ.

Anthropic cho biết một người dùng sớm hoàn thành migration khoảng 680.000 dòng code trong chưa đầy một ngày. Ở một nhiệm vụ audit và sửa codebase khoảng 200.000 dòng, Opus 5.5 mất dưới 3 giờ; Opus 5 mất hơn 20 giờ và dùng khoảng 2,5 lần số token. [1]

Trong thử nghiệm tối ưu web, Opus 5.5 thành công 39 trong 40 lần giảm thời gian tải. Các nhóm thử nghiệm từ GitHub, Lovable và Kiro cũng nói mô hình ít rơi vào vòng retry hơn, chỉnh sửa hoàn chỉnh hơn sau khi thu thập context và dùng ít tool call hơn. [1]

Tai nạn kinh điển của agent:

  1. điều tra;
  2. sửa một nửa;
  3. phát hiện lỗi khác;
  4. tuyên bố “đã phát hiện vấn đề”;
  5. chờ con người quay lại nói: “Tốt. Giờ sửa nó đi.”

Opus 5.5 có vẻ tiến bộ mạnh ở việc giảm “dịch vụ giao kết quả giữa chừng” và nối điều tra→thay đổi→kiểm thử→sửa tiếp→xác nhận hoàn tất.

3. Khả năng khám phá có hơn GPT-6 Astra không? Phụ thuộc bạn gọi gì là “khám phá”

Ép exploration thành một con số duy nhất rất dễ gây nhầm.

Trong bảng của Anthropic, Terminal-Bench 4.0: Opus 5.5 đạt 66,4%, Astra 57,9%. FrontierCode Main: 54,4% so với 53,3%. GDPval-AA cho knowledge work: 1846 so với 1542. [1]

Nhưng Terminal-Bench Science 0.1 lại nghiêng về Astra: 64,6% so với Opus 5.5 là 58,7%. AutomationBench cũng là 41,4% so với 40,0%. [1]

OpenAI còn báo Astra đạt 99,9% trên ARC-AGI-3, nhấn mạnh khả năng học và thích nghi trong môi trường mới. [2]

Có thể chia thô như sau:

Kiểu khám phá Xu hướng
Đọc repo lớn, cô lập nguyên nhân, sửa liên tục Opus 5.5 rất mạnh
Sửa nhiều file, test, rồi sửa lại Opus 5.5 rất mạnh
Giữ cùng một mục tiêu trong phiên dài Opus 5.5 cải thiện lớn
Phần mềm khoa học, mô phỏng, fitting, nghiên cứu Astra điểm cao hơn
Học quy luật của môi trường hoàn toàn mới Astra cực mạnh
Browser, computer, nhiều app Phụ thuộc mạnh vào harness

Vì vậy không phải “Astra hết thời”, cũng không phải “Opus thắng mọi thứ”.

Khám phá không chỉ là nghĩ ra đáp án đúng. Nó còn là tạo nhánh, thử, bỏ nhánh thất bại, giữ context và tiếp tục. Hiệu quả token và chất lượng dùng tool vì thế trở thành một phần của trí thông minh thực dụng.

4. GPT-6 Sol cũng rẻ hơn: tiền tăng ca của AI giảm mạnh

OpenAI cũng đang chơi cùng trò kinh tế.

Trang chính thức GPT-6 Sol liệt kê 2 USD cho một triệu token input, 10 USD cho output và 0,20 USD cho cached input. Mô hình có context window 1,05 triệu token, output tối đa 128.000 token và được định vị cho coding phức tạp cùng agent workflow. [3]

Câu hỏi cạnh tranh vì thế thay đổi.

Không chỉ còn:

“Mô hình nào thông minh nhất?”

mà còn:

“Mô hình nào gọi tool 100 lần, chạy hàng giờ mà ngân sách và rate limit chưa chết trước?”

Inference rẻ hơn cho phép thử nhiều nhánh hơn, kiểm tra thêm một vòng và dùng nhiều subagent hơn.

Giảm giá trí thông minh cũng là giảm giá thử và sai.

5. Gói Claude giá bao nhiêu? Bắt đầu từ 20 USD, nhưng không có nghĩa là “mọi thứ vô hạn”

Anthropic niêm yết Free 0 USD, Pro 20 USD/tháng hoặc 200 USD/năm, Max 5x 100 USD/tháng và Max 20x 200 USD/tháng. Max cung cấp khoảng 5 hoặc 20 lần dung lượng phiên của Pro và bao gồm Claude Code. [4][5][6]

Điểm quan trọng là đừng coi subscription, Claude Code tương tác, API và thực thi không tương tác như cùng một chiếc ví.

Mua Pro hoặc Max không khiến Anthropic API trở thành vô hạn. Dùng API key thông thường vẫn tính theo mức sử dụng; Opus 5.5 có giá cơ bản 4 USD input và 20 USD output trên một triệu token. [1][4]

Claude Code tương tác dùng quota đi kèm gói.

Từ ngày 15/6/2026, với người dùng Pro, Max, Team và Enterprise đủ điều kiện, Agent SDK và chế độ Claude Code không tương tác claude -p không còn tính vào giới hạn sử dụng Claude thông thường. Họ cũng có thể nhận credit Agent SDK hàng tháng riêng: 20 USD cho Pro, 100 USD cho Max 5x và 200 USD cho Max 20x. Tài khoản Claude Platform pay-as-you-go dùng API key không nhận credit này. [7]

Vì vậy kết luận không phải “trả subscription là mọi thứ vô hạn”, mà là tách công việc tương tác và tự động hóa có thể làm bài toán chi phí hấp dẫn hơn hẳn. Bảng giá AI đang dần giống bảng cước viễn thông.

6. Có thể đưa Opus 5.5 vào OpenCode không? Qua API thì được; dùng thẳng quota subscription là chuyện khác

OpenCode hỗ trợ nhiều provider, vì vậy dùng Anthropic API key với Claude là kiến trúc bình thường. [8]

Ý tưởng hấp dẫn là: “Đã trả Pro hoặc Max rồi, OpenCode có thể dùng luôn quota cố định đó không?”

Tài liệu OpenCode hiện tại nói có plugin cho phép dùng model Claude Pro/Max trong OpenCode, nhưng Anthropic cấm rõ ràng kiểu sử dụng này; từ OpenCode 1.3.0 các plugin đó cũng không còn được bundle. [8]

Hai đường sạch sẽ:

  • OpenCode + Anthropic API: linh hoạt nhưng trả theo mức dùng.
  • Claude Code + Pro/Max: đường chính thức của Anthropic; sử dụng tương tác trừ quota subscription.

Cũng có thể phân vai: GPT-6 Sol cho công việc số lượng lớn giá rẻ, Opus 5.5 cho công việc repo dài cần làm đến cùng, Astra cho exploration khoa học hoặc môi trường mới khó nhất.

AI giờ cũng có phân công lao động. May là chưa đòi họp tuần.

7. Biến động thật sự là cách chúng ta giao việc cho AI thay đổi

Các model frontier trước đây có thể là cố vấn xuất sắc nhưng lại là nhân viên gây bực mình.

Chúng thường kết thúc bằng:

“Tôi đã điều tra.”
“Tôi đã tìm được nguyên nhân.”
“Bước tiếp theo là…”

Rồi con người phải nói: “Đúng. Làm bước tiếp theo đi.”

Điều đáng chú ý ở Opus 5.5 là các ví dụ về khả năng tiếp tục làm việc. Một người dùng sớm báo cáo hơn 18 giờ làm việc không giám sát trên sáu repo, cùng các ví dụ migration lớn, audit và self-verification loop dễ thiết lập hơn. [1]

Nếu hành vi này ổn định, prompt sẽ chuyển từ:

“Sửa hàm này.”

sang:

“Đạt kết quả này. Điều tra nguyên nhân, thực hiện thay đổi cần thiết, chạy test, sửa thất bại và tiếp tục đến khi đạt toàn bộ tiêu chí hoàn thành.”

Đánh giá thực tế cũng chuyển sang completion rate, số lần con người phải nhắc thêm, tổng token, tool call, thời gian thực và khả năng tự phục hồi sau lỗi.

Có thể sẽ không bao giờ có một “model tốt nhất” cho mọi việc.

Nhưng Opus 5.5 là biểu tượng rõ của giai đoạn mới: agent AI đang chuyển từ bài thi năng lực sang hồ sơ hoàn thành công việc.

8. Vậy quota thực sự tụt nhanh đến đâu? Astra đã nặng ngay trong bảng chính thức

Đến môn thể thao yêu thích của Internet: ngồi nhìn thanh usage chạy.

Tài liệu OpenAI hiện tại cho biết Work và Codex dùng chung allowance, và tùy gói có thể có cả giới hạn 5 giờ lẫn giới hạn tuần. Số local messages ước tính mỗi 5 giờ cho GPT-6 Astra là 5–45 ở Plus, 25–225 ở Pro 5x và 100–900 ở Pro 20x. Với GPT-5.6 Sol, các con số là 10–100, 50–500 và 200–2.000. [9]

Đây không phải giới hạn tin nhắn cố định. Mức dùng thật thay đổi theo task, reasoning setting và context. Nhưng ngay bảng chính thức đã cho thấy Astra là model nặng hơn, xử lý ít request hơn trên cùng allowance so với Sol.

Đo lường cộng đồng cũng theo hướng đó. Một người theo dõi gói giá thấp của Claude và Codex trong 20 ngày, rồi ước tính allowance tuần hiệu dụng quy đổi theo giá API của Claude cao hơn Codex khoảng 3–5 lần tùy model. [10] Một người dùng Codex lâu năm khác báo cáo đã dùng hết toàn bộ quota tuần của gói 200 USD sau khoảng 20 giờ coding với Astra High. [11]

Trên Hacker News, có người nói Astra ở gói 100 USD dùng khoảng 70% quota tuần trong gần 5 giờ; người khác báo cáo chỉ dùng 5% quota tuần sau 8 giờ làm thuật toán sâu với Opus 5.5. [12]

Không nên biến điều đó thành “Claude luôn rẻ hơn 14 lần”. Đây không phải thí nghiệm kiểm soát: workload, effort, cache, subagent và thời điểm reset khác nhau. Anthropic cũng tăng giới hạn 5 giờ khi ra mắt Opus 5.5. [1]

Kết luận hợp lý hơn:

Astra rất mạnh nhưng nặng quota. Opus 5.5 hiện có vẻ cạnh tranh không chỉ về năng lực mà cả số giờ công việc nghiêm túc có thể nhét vào một tuần.

So AI cuối cùng đã đi từ mã lực sang mức tiêu hao nhiên liệu.

9. Claude Code bắt đầu từ 20 USD/tháng; không cần nhảy thẳng lên 100 USD

Điểm vào subscription của Claude Code là Pro: 20 USD/tháng hoặc 200 USD/năm, tương đương khoảng 17 USD/tháng. Max 5x là 100 USD/tháng và Max 20x là 200 USD/tháng. [6][5]

Vì vậy nếu chỉ muốn thử Claude Code, mức tối thiểu là 20 USD.

Max chủ yếu mua thêm capacity. Max 5x có khoảng 5 lần usage của Pro mỗi session, còn Max 20x khoảng 20 lần. [5]

Một phép so sánh tốt nên giữ cùng repo và loại task tương tự, rồi ghi lại:

  • khi nào giới hạn 5 giờ thực sự trở thành vấn đề;
  • phần trăm quota tuần đã dùng;
  • số lần con người phải can thiệp;
  • test có được chạy đến cùng hay không;
  • có bao nhiêu thay đổi không cần thiết.

Gói cao hơn giống tăng ca cho một nhân viên đã chứng minh được năng lực hơn là “mua một bộ não thông minh hơn”.

10. Chuyển gì từ Codex sang Claude Code? Không phải “não”, mà là Git và tài liệu handoff

Khi đổi coding agent, người ta dễ nghĩ phải import toàn bộ chat cũ để model mới “học”.

Trong thực tế, thường hiệu quả hơn nếu nén những quyết định vẫn còn hiệu lực thành file trong repo.

Claude Code tự động đọc CLAUDE.md ở root repo khi bắt đầu mỗi session. Anthropic khuyên đưa vào đó lệnh build/test, cấu trúc thư mục, coding convention và các ràng buộc lâu dài, đồng thời gợi ý giữ dưới khoảng 200 dòng. [13]

Một cấu trúc thực tế:

  • Git repo: source of truth cho code và lịch sử;
  • AGENTS.md: tham chiếu các quy tắc agent cũ;
  • CLAUDE.md: quy tắc ổn định Claude đọc mỗi session;
  • docs/AI-HANDOFF.md: trạng thái hiện tại, vấn đề mở, quyết định gần đây;
  • Git history: bằng chứng vì sao hệ thống có hình dạng hiện tại.

Claude Code cũng có thể tạo bản nháp CLAUDE.md bằng /init. [13]

Đừng biến CLAUDE.md thành “toàn-bộ-tri-thức-nhân-loại.txt”. Vì nó được nạp lặp lại, quá nhiều chữ sẽ làm loãng quy tắc quan trọng. Cũng không nên đặt secret, token, credential hay connection string vào đó. [13]

Migration không phải re-training.

Bạn không copy bộ não model; bạn đặt hiến pháp của dự án và ghi chú handoff vào Git.

11. Prompt đầu tiên nên là “khôi phục thế giới từ repo” trước khi “bắt đầu sửa”

Ở session đầu, phục hồi context trước khi chỉnh code giúp giảm nguy cơ redesign không cần thiết.

Ví dụ prompt handoff

Tiếp quản repository này từ một coding agent trước đó.
Trước khi sửa code, hãy kiểm tra toàn bộ repo, README, AGENTS.md, docs,
package scripts, cấu hình CI/deploy và Git history.
Xác định source of truth, đường build/test/deploy, tiêu chí hoàn thành,
hành động bị cấm và các vấn đề chưa giải quyết.
Ghi quy tắc ổn định vào CLAUDE.md và thông tin trạng thái dễ thay đổi
vào docs/AI-HANDOFF.md.
Không hiển thị, ghi lại hay commit secret, token hoặc credential.
Trước khi hỏi tôi, hãy tìm bằng chứng trong repo và history.
Đừng tuyên bố hoàn thành nếu vẫn còn test hoặc production verification
có thể thực hiện.

Nhờ vậy con người không phải kể lại toàn bộ lịch sử dự án.

Và vì chỉ những quyết định còn hiệu lực được nén lại, context sạch hơn việc đổ nhiều tháng chat thô vào model mới.

Onboarding nhân viên AI cuối cùng vẫn quay về chuyện viết tài liệu.

12. Tính năng nào vẫn chạy khi gập laptop? Cloud execution, không phải phép thuật logout

Tách khái niệm ra là dễ.

Claude Code on the web clone GitHub repo vào môi trường remote do Anthropic quản lý và làm việc trong VM cô lập. Khi task đã bắt đầu, bạn có thể rời trang và nó vẫn tiếp tục. Khi hoàn tất, thay đổi có thể được push lên branch và tạo PR để review. [14]

Claude Code Desktop có “Continue with Claude Code on the web”, cho phép chuyển session local lên cloud rồi tiếp tục từ web hoặc mobile. [15]

Với việc lặp định kỳ có hai loại:

  • /loop: lặp local, dành cho job local kéo dài tối đa khoảng 3 ngày; phụ thuộc máy.
  • /schedule: Cloud Jobs; vẫn chạy trên cloud khi laptop đóng. [16]

Routines tiến thêm một bước: prompt, repo và connector có thể đóng gói thành automation chạy trên hạ tầng web Claude Code theo schedule, API call hoặc event. [17]

Vì vậy bí quyết không phải giữ process local sống bằng ý chí. Mà là chuyển chính công việc lên cloud.

Đóng browser không còn đồng nghĩa AI tan ca. Con người có thể về trước.

Nếu task cần file chỉ có trên PC local hoặc phải trực tiếp điều khiển máy đó thì khác: cloud không thể nhìn thấy thứ chưa được cung cấp.

Năm 2026, chọn coding AI không còn chỉ là hỏi “model nào thông minh nhất?”

Phải nhìn năng lực × completion rate × mức tiêu quota tuần × khả năng handoff × cloud execution.

Phép nhân đó giải thích vì sao Opus 5.5 + Claude Code đột nhiên trông rất mạnh.


  1. Anthropic — “Introducing Claude Opus 5.5” (2026-09-22) Used for release claims, pricing, speed, Opus 5 comparisons, benchmark table, long-running coding examples, early-tester reports, and efficiency claims anthropic.com
  2. OpenAI — “GPT-6 Astra: A new generation of intelligence” Used for Astra benchmark results, ARC-AGI-3, Terminal-Bench Science, coding comparisons, and positioning around novel-environment adaptation openai.com
  3. OpenAI Developers — GPT-6 Sol model page Used for GPT-6 Sol model positioning, context/output limits, and advertised token pricing developers.openai.com
  4. Anthropic Help Center — “Choose a Claude plan” Used for Free, Pro, Max 5x, and Max 20x consumer pricing support.claude.com
  5. Anthropic Help Center — “What is the Max plan?” Used for Max usage multipliers and Claude Code access support.claude.com
  6. Anthropic Help Center — “What is the Pro plan?” Used for Pro pricing and Claude Code inclusion support.claude.com
  7. Anthropic Help Center — “Use the Claude Agent SDK with your Claude plan” Used for the June 15, 2026 separation of Agent SDK / claude -p usage from normal interactive plan limits, and the separate monthly credits for eligible Pro, Max, Team, and Enterprise users support.claude.com
  8. OpenCode — “Providers” Used for Anthropic provider setup and OpenCode’s current warning that using Claude Pro/Max through OpenCode is explicitly prohibited by Anthropic and that such plugins stopped being bundled from OpenCode 1.3.0 opencode.ai
  9. OpenAI Help Center — “Managing usage with GPT-6 Astra in Work and Codex” Used for shared Work/Codex allowance mechanics, five-hour and weekly-limit caveats, and estimated local messages per five-hour period for Astra, Sol, and other models help.openai.com
  10. Reddit r/codex — “Measured Claude usage limits are 3–5× those of Codex” (2026-09-18) Community measurement based on roughly twenty days of usage logging. Treated as anecdotal observational evidence, not a controlled benchmark reddit.com
  11. Reddit r/codex — “Codex is in a really bad spot right now…” (2026-09-23) Used only for community reports about heavy Astra weekly-quota consumption and Opus 5.5 usage experience. Not treated as vendor-independent benchmark proof reddit.com
  12. Hacker News — “Claude Opus 5.5” discussion (2026-09-23/24) Used for contrasting real-user usage anecdotes, including heavy Astra quota consumption and low Opus 5.5 weekly consumption in long algorithmic work. These reports are uncontrolled news.ycombinator.com
  13. Anthropic Help Center — “Give Claude context: CLAUDE.md and better prompts” Used for CLAUDE.md automatic loading, /init, recommended content, and keeping project instructions concise support.claude.com
  14. Anthropic Help Center — “Claude Code on the web” Used for remote GitHub execution, isolated environments, leaving the page while work continues, and branch/PR workflows support.claude.com
  15. Anthropic — “Preview, review, and merge with Claude Code” (2026-02-20) Used for “Continue with Claude Code on the web” and moving a desktop session into the cloud claude.com
  16. Anthropic Help Center — “Claude Code power user tips” Used for /loop as local recurring execution and /schedule as Cloud Jobs that continue when the laptop is closed support.claude.com
  17. Anthropic — “Introducing routines in Claude Code” (2026-04-14) Used for cloud routines triggered by schedules, API calls, or events claude.com

Chia sẻ bài viết này

Quảng cáo

Tìm bài viết khác

Tất cả bài viết

Mendoi-chan

Tác giả

Mendoi-chan

Biến những vướng mắc trong công việc và đời sống hằng ngày thành cấu trúc rõ ràng và bước tiếp theo thực tế.

Giới thiệu
Quảng cáo

Bài viết mới

  1. 1Bài 5: Khi Zero rút lui, Hắc Kỵ Sĩ Đoàn cũng nên rút theo|Todo và giới hạn của một tổ chức phụ thuộc quá nhiều vào Zero
  2. 2Bài 8: Địa ngục của khán giả phải chờ từ tập 25 mùa 1 đến R2|Từ cái kết chĩa súng vào nhau đến màn mở đầu với ký ức bị sửa đổi
  3. 3Trăng Xanh không phải là Mặt Trăng có màu xanh
  4. 4Khi vẻ đẹp không còn điều khiển quyết định: hết vội vàng trong tình yêu và ưu tiên sự tương hợp cùng thiết kế cuộc sống
  5. 5“Rõ ràng có trả lời mà vẫn bị nói là ‘chẳng bao giờ trả lời’” — chuyện gì xảy ra khi một người phải gánh toàn bộ động cơ hội thoại

Có thể bạn quan tâm

Quảng cáo