Kết luận trong 5 giây: cùng một model vẫn có thể tiêu thụ allowance rất khác nhau tùy context gửi ở mỗi lượt, số lần gọi model, lượng output từ tool được giữ lại, thời điểm compaction và cách retry. Nếu model là động cơ thì harness là hộp số, phun nhiên liệu, GPS và đội pit.
1. “Cùng cửa sổ năm giờ nhưng làm được hơn gấp đôi” là trải nghiệm thực tế, không phải benchmark chính thức
Một developer chia sẻ trên mạng xã hội rằng sau khi chuyển từ Codex sang OpenCode, vẫn dùng GPT-5.6 Sol qua xác thực ChatGPT, họ cảm thấy có thể làm hơn gấp đôi lượng công việc trong cùng giới hạn năm giờ và hàng tuần.
Các phản hồi nhắc đến harness khác như pi, nghi ngờ cấu hình giới hạn context, và đề xuất dùng routing hoặc telemetry để xem mức tiêu thụ thực.
Điểm cần tách rõ: không có bảo đảm chính thức rằng OpenCode làm allowance tăng gấp đôi.
OpenAI chính thức giải thích rằng mức sử dụng Codex không phải số message cố định. Nó thay đổi theo model, nơi chạy task, độ phức tạp, context, reasoning, speed và tools. Một số plan có cả cửa sổ năm giờ và giới hạn tuần.
Vì vậy việc đổi harness làm thay đổi “mức tiêu hao nhiên liệu” là hoàn toàn có thể về mặt kỹ thuật, nhưng con số gấp đôi chưa phải quy luật đã được chứng minh.
2. Harness là gì? Toàn bộ phần bao quanh bộ não
Nếu chỉ nhìn model:
Sol = bộ não.
Nhưng coding agent còn phải quyết định:
- ghép system instructions như thế nào
- đọc file nào
- giữ bao nhiêu history
- công khai bao nhiêu tool schema
- giữ lại bao nhiêu output shell/GitHub
- retry bao nhiêu lần
- chạy bao nhiêu vòng plan, implement, review
- khi nào compact
- có dùng subagent không
- tiêu chí nào để xem là hoàn tất
Toàn bộ tầng điều phối này là harness theo nghĩa rộng.
OpenAI cũng dùng chính thuật ngữ “Codex harness” và mô tả App Server kết nối conversation, client và tool.
Do đó:
cùng model không có nghĩa là cùng hệ thống.
Cùng một động cơ đặt lên hai chiếc xe khác trọng lượng và hộp số sẽ không có cùng mức tiêu hao.
3. Thứ đốt nhiên liệu thường là hành lý mang theo trong mỗi chuyến
Một session dài có thể lặp lại:
- history dài
- system prompt lớn
- quy tắc dự án
- MCP tool schema
- file repository
- terminal log
- kết quả test
- lỗi trước đó
- retry state
Đọc một log lớn một lần chưa chắc là vấn đề lớn nhất.
Nặng hơn là mang active context lớn vào 10, 20 hoặc 30 lần gọi model.
Cách orchestration cũng tạo khác biệt. Harness A có thể hoàn tất trong 15 calls, còn B dùng 30 calls cho planning, tìm kiếm lại, review và review lại.
Có thể hình dung:
mức dùng ≈ hành lý × số chuyến × retry
Đây không phải công thức billing, nhưng là trực giác kỹ thuật hữu ích.
4. Vì sao OpenCode đáng chú ý: ChatGPT auth, MCP và compaction
Tài liệu OpenCode cho phép kết nối OpenAI bằng lựa chọn ChatGPT Plus/Pro và xác thực qua browser, tách biệt với việc nhập API key.
OpenCode cũng là MCP client hỗ trợ server local và remote.
Ví dụ:
OpenCode → GitHub MCP → database MCP → API riêng → tool khác
OpenCode còn có automatic compaction. Tài liệu hiện tại cho thấy tính năng này bật mặc định và ví dụ giữ một checkpoint cùng khoảng 15.000 token gần nhất.
Ý tưởng là:
lưu lịch sử trong kho nhưng không mang cả kho vào mỗi lần gọi model.
Tuy nhiên OpenCode cũng cảnh báo MCP server làm tăng context. Tool set lớn như GitHub MCP có thể dùng nhiều token.
Kết nối hai mươi MCP không tự động biến agent thành siêu nhân.
Đôi khi chỉ là bắt nhân vật đeo cả nhà kho sau lưng.
5. Dùng ChatGPT + MCP để điều khiển mọi thứ về cơ bản cũng là cùng kiến trúc
Nếu ChatGPT là bộ điều khiển trung tâm và MCP/connectors thao tác GitHub, server, cloud và storage, cấu trúc vẫn là:
model + harness + tools.
ChatGPT → MCP / connector → GitHub, server, cloud, storage
ChatGPT xử lý quyết định, MCP là tay chân, còn hệ thống bên ngoài giữ state thật.
OpenCode cũng tương tự:
OpenCode → MCP / shell / API → repository, server, cloud
Khác biệt nằm ở nơi lưu conversation state, nơi tool loop chạy, thời điểm compact context và cách xác minh completion.
Vì vậy câu hỏi “đây chẳng phải gần giống việc điều khiển mọi thứ từ ChatGPT qua MCP sao?” có câu trả lời:
về kiến trúc, rất giống.
Cùng tòa nhà, khác phòng điều khiển.
6. ChatGPT có thể giao việc cho OpenCode không?
OpenCode chính thức hỗ trợ vai trò MCP client. Nó cũng cung cấp opencode serve để chạy headless HTTP/OpenAPI server, cùng SDK và ACP.
Kiến trúc sạch có thể là:
ChatGPT → MCP bridge mỏng → OpenCode Server → Sol → MCP / shell / API → GitHub và cloud
Bridge chỉ cần vài tool cấp cao:
- chạy OpenCode task
- lấy status
- lấy kết quả cuối
Nhờ vậy ChatGPT không cần mang hàng chục GitHub schema và log khổng lồ ở mỗi lượt. Vòng thực thi dài nằm trong OpenCode và chỉ kết quả quay lại.
Điểm chính không phải là thêm một ứng dụng, mà là di chuyển ranh giới agent loop.
7. Muốn giảm tiêu thụ, hãy giảm số lần workflow quay lại AI
Thiết kế hiệu quả thường:
- đưa bước deterministic vào script
- lưu state và receipt bên ngoài chat
- chỉ bật tool cần thiết
- trích xuất và tóm tắt log dài
- không đọc lại file không đổi
- lưu lý do thất bại và next action
- chỉ gọi model mạnh khi có sự mơ hồ
- trả về final production readback
Phân vai:
AI = xử lý mơ hồ
script/workflow = thực hiện quy trình xác định
GitHub/DB/state = bộ nhớ
Nếu AI phải tự tìm lại “bước tiếp theo là gì?” ở mỗi vòng, bạn đang trả tiền cho việc kiểm kê kho lặp lại.
8. Điều gì chưa được chứng minh
OpenAI tài liệu hóa rằng Work và Codex dùng chung allowance và mức tiêu thụ thay đổi theo context, tools và các yếu tố khác. Các plan phù hợp có cửa sổ năm giờ và tuần.
OpenCode tài liệu hóa ChatGPT Plus/Pro authentication.
Nhưng các nguồn chính thức này không nói rằng OpenCode qua ChatGPT OAuth luôn được đo bằng đúng cùng công thức nội bộ như Codex, cũng không bảo đảm một hệ số hiệu quả cố định.
Do đó:
“Tôi làm được gấp đôi” là một phép đo đáng chú ý.
“Luôn luôn gấp đôi” chưa được chứng minh.
Benchmark tốt phải giữ nguyên repo, model, task và completion criteria, rồi đo model calls, tokens, compaction, tool calls, retries, thời gian và test cuối.
Đơn vị tốt hơn là mức tiêu thụ trên mỗi task thành công.
9. Kết luận: trong thời đại agent, dây nối gần quan trọng bằng động cơ
Chọn model vẫn quan trọng.
Nhưng với task dài và tools, quản lý context, state, số tool, retry, compaction và completion logic đều thay đổi sản lượng.
Model là động cơ.
Harness là phần còn lại của chiếc xe.
Khi bắt đầu kết nối nhiều hệ thống bằng MCP, bạn không chỉ “dùng AI” nữa.
Bạn đang thiết kế nơi làm việc cho AI.
Và tối ưu tốt nhất đôi khi không phải thêm tool mới, mà là tạo ra bước không cần hỏi AI thêm lần nào nữa.
[1] https://openai.com/index/unlocking-the-codex-harness/ [2] https://help.openai.com/ja-jp/articles/11369540 [3] https://help.openai.com/ja-jp/articles/20001516-managing-usage-with-gpt-6-astra-in-work-and-codex [4] https://opencode.ai/docs/providers [5] https://opencode.ai/v2/docs/mcp-servers [6] https://opencode.ai/v2/docs/compaction [7] https://dev.opencode.ai/docs/server/ https://dev.opencode.ai/docs/ja/sdk/ [8] https://opencode.ai/v2/docs/cli/acp/
- OpenAI, Unlocking the Codex harness: how we built the App Server openai.com
- OpenAI Help Center, ChatGPTプランでCodexを使う help.openai.com
- OpenAI Help Center, WorkとCodexでのGPT-6 Astraの利用量管理 help.openai.com
- OpenCode Docs, Providers opencode.ai
- OpenCode Docs, MCP servers opencode.ai
- OpenCode Docs, Compaction opencode.ai
- https://dev.opencode.ai/docs/ja/sdk/ dev.opencode.ai
- OpenCode Docs, ACP opencode.ai
