0. Kết luận trong năm giây: AI có thể giải bài cực khó nhưng trước đây vẫn lạc trong một trò đơn giản không có hướng dẫn
Năng lực AI từ lâu đã phát triển rất không đồng đều.
Máy tính đã vượt con người trong cờ vua từ lâu, và năm 2025 một phiên bản Gemini Deep Think nâng cao đạt 35/42 điểm, chuẩn huy chương vàng, trong đánh giá chính thức của Olympic Toán quốc tế. Tuy vậy, các mô hình frontier vẫn có thể gặp khó nghiêm trọng khi được đưa vào một môi trường 2D đơn giản, không có hướng dẫn hay mục tiêu rõ ràng, rồi phải tự tìm cách chơi.[1]
ARC-AGI-3 được tạo ra để đo đúng khoảng trống đó. Tác nhân phải hành động, quan sát thay đổi, suy ra cơ chế, tìm mục tiêu và lập kế hoạch mà không có luật bằng ngôn ngữ tự nhiên.[2][3]
Tháng 9/2026, GPT-6 Astra đạt 62,71% trên ARC-AGI-3 Semi-Private với Standard harness và đạt mức xác minh cao nhất 99,95% với Provider Adapter của OpenAI.[2][4]
Điều đó không chứng minh AGI đã hoàn tất. Kết quả chưa phải 100%, và mức 99,95% dùng cơ chế quản lý ngữ cảnh riêng của nhà cung cấp.
Thay đổi quan trọng hơn là: AI đã giỏi hơn rất nhiều trong việc học ngay bên trong một môi trường mới, nơi ban đầu thậm chí bản thân nhiệm vụ cũng chưa rõ.
Trong thị trường, vai trò hợp lý hơn “dự đoán giá ngày mai” là một tác nhân tìm các edge ứng viên, kiểm tra chúng rồi chủ động phá chính kết luận của mình.
1. AGI là gì? Và 1, 2, 3 là các thế hệ bài kiểm tra, không phải cấp độ AI
AGI là Artificial General Intelligence, trí tuệ nhân tạo tổng quát.
ARC Prize xem AGI, theo nghĩa khái quát, là một hệ thống có thể học những kỹ năng con người có thể học với hiệu quả gần giống con người.[2]
ARC-AGI-1, 2 và 3 không có nghĩa là “AGI cấp 1, 2, 3”. Đó là các thế hệ benchmark.
- ARC-AGI-1: ra mắt năm 2019; các câu đố lưới màu, yêu cầu suy ra phép biến đổi ẩn từ vài ví dụ.[5]
- ARC-AGI-2: cùng định dạng nhưng khó hơn. Mọi bài được đưa vào đều được xác minh rằng ít nhất hai người có thể giải trong tối đa hai lần thử.[5][6]
- ARC-AGI-3: chuyển từ bài tĩnh sang môi trường tương tác mới, phải học qua nhiều hành động.[3]
Phiên bản cho trẻ em:
1 = câu đố hình ảnh
2 = câu đố hình ảnh khó hơn nhiều
3 = trò chơi mới sau khi ai đó vứt mất sách hướng dẫn
2. “Trò chơi chưa biết” trông thế nào? Một thế giới 2D chỉ lộ ý nghĩa sau khi bạn hành động
ARC-AGI-3 dùng môi trường lưới 2D theo lượt. Trạng thái có thể được biểu diễn trên lưới tối đa 64×64 và tác nhân chọn trong số các hành động có sẵn.[7]
Điểm quan trọng là biết có những nút nào không đồng nghĩa với biết thế nào là thắng.
Một ví dụ giả định, không phải bài chính thức, có thể bắt đầu như sau:
■■□□□□
■●□□▲□
□□□■□□
Không có giải thích.
Đi sang phải, dấu chấm di chuyển. Chạm tam giác, màu đổi. Đi tới chỗ khác, thứ giống cánh cửa mở ra.
Con người bắt đầu đặt giả thuyết:
“Có lẽ dấu chấm là mình.”
“Có lẽ tam giác là công tắc.”
“Có lẽ phải đổi trạng thái trước khi tới cửa.”
ARC-AGI-3 đo chu trình khám phá → mô hình hóa → tìm mục tiêu → lập kế hoạch và thực thi.[2]
Benchmark được thiết kế để con người nắm bắt tương đối nhanh, nhưng không có nghĩa mọi trẻ em đều dễ dàng hoàn thành tất cả trò chơi. Nghiên cứu con người năm 2026 có 458 người tham gia; các môi trường được hiệu chỉnh để con người có thể giải, nhưng tỉ lệ thành công cá nhân vẫn khác nhau.[8]
3. Vì sao AI giỏi cờ vua và toán khó nhưng lại yếu ở đây?
Cờ vua cho toàn bộ luật ngay từ đầu. Bài toán cũng cho biết điều cần chứng minh.
Nhiệm vụ có thể cực kỳ khó, nhưng khung vấn đề đã được cung cấp.
ARC-AGI-3 hỏi những câu còn sớm hơn:
“Điều gì được tính là tiến bộ?”
“Vật này dùng để làm gì?”
“Hành động vừa rồi đã làm thay đổi điều gì?”
Con người làm việc này liên tục với thiết bị, trò chơi, công việc và ứng dụng mới. Chúng ta thử vài lần rồi xây một mô hình thô: “có lẽ nó hoạt động như thế này”.
Các mô hình frontier trước đây có điểm yếu đáng kể trong việc xây dựng và duy trì loại mô hình này từ ít trải nghiệm.
Chúng có thể giải một định lý khó rồi lại lạc trong một giao diện trông như đồ chơi.
4. GPT-5.6 Sol: bộ não mạnh nhưng giống như vứt sổ ghi chép sau mỗi bước
GPT-5.6 Sol Max đạt 96,5% ở ARC-AGI-1 và 92,5% ở ARC-AGI-2, nhưng chỉ 7,78% ở ARC-AGI-3 Semi-Private.[9]
OpenAI điều tra và phát hiện một phần vấn đề nằm ở harness, phần mềm nối mô hình với trò chơi.[10]
Lý luận ẩn bị bỏ đi sau mỗi hành động, còn lịch sử cũ dần bị cắt khi ngữ cảnh quá dài.
Nếu là con người thì giống như:
“Dẫm vào ô đỏ sẽ mở cửa.”
→ đi một bước
→ xé tờ giấy ghi phát hiện đó
→ bước sau lại hỏi “cái màu đỏ này là gì?”
Khi OpenAI bật giữ lại reasoning và nén ngữ cảnh, điểm Sol trên Public set tăng từ 13,3% lên 38,3%.[10]
Không nên so trực tiếp 7,78 với 38,3: số đầu là Semi-Private, hai số sau là Public.
Bài học vẫn rõ: năng lực không chỉ phụ thuộc bộ não mô hình mà còn phụ thuộc cách kinh nghiệm được giữ và nén.
5. GPT-6 Astra: 62,71% và 99,95% không phải cùng một loại kết quả
ARC Prize xác minh GPT-6 Astra ngày 2/9/2026.[4]
Kết quả Semi-Private tốt nhất:
| Điều kiện | Điểm Astra tốt nhất |
|---|---|
| Standard harness | 62,71% (Max) |
| Provider Adapter | 99,95% (High) |
Standard harness gần với một giao diện tối thiểu dùng chung, nơi mô hình tự quyết định ghi chú hiển thị nào cần giữ.
Provider Adapter giữ trạng thái lý luận không hiển thị riêng của nhà cung cấp giữa các yêu cầu và dùng nén cho ngữ cảnh dài.[2][4]
Vì vậy nói “Astra một mình, không hỗ trợ, đạt 99,95%” là không chính xác. Chính xác hơn là Astra cộng quản lý ngữ cảnh do OpenAI thiết kế đạt 99,95%.
Ngay cả 62,71% Standard cũng là bước nhảy rất lớn so với 7,78% Semi-Private của Sol Max.[4][9]
So sánh với con người cũng phải đọc cẩn thận. Astra Max với Provider Adapter đạt 98,55% và ở các level hoàn thành, nó dùng ít hành động hơn chuẩn con người ở 96,0% level, trung bình ít hơn 51,7% hành động mỗi level.[2]
Điều đó không có nghĩa “thông minh hơn 96% con người”. Đây là so sánh hiệu quả theo từng level với mốc trung vị của người chơi.
6. Astra thực sự làm gì? Tự viết một cuốn vật lý nhỏ cho từng trò chơi
ARC Prize chú ý đến hành vi của Astra chứ không chỉ điểm số.
Thay vì giữ nguyên mọi quan sát, Astra nén thông tin về:
- vị trí vật thể,
- tác dụng của hành động,
- trạng thái hiện tại,
- kế hoạch chưa hoàn tất,
- thao tác hữu ích tiếp theo.
Nó thậm chí tự tạo ký hiệu ngắn để mô tả cơ chế trò chơi.[2]
Về ý tưởng, giống như:
đỏ + hành động sang phải → trạng thái B trạng thái B + mục tiêu xanh → cửa mở
Đó là một mô hình thế giới nhỏ: sách hướng dẫn nội bộ giúp dự đoán môi trường sẽ thay đổi thế nào tiếp theo.
Câu trả lời không được học thuộc từ trước; cấu trúc hữu ích phải được rút ra từ tương tác.
7. Vậy đây là AGI? ARC Prize nói rõ là chưa
ARC Prize mô tả Astra như một bước nhảy rõ rệt về năng lực frontier, nhưng không tuyên bố nó chứng minh AGI.[2]
ARC-AGI-3 vẫn là một thế giới giới hạn:
- lưới 2D,
- theo lượt,
- cơ chế xác định,
- mục tiêu khép kín.
Thế giới thật có luật thay đổi, biến ẩn, đối thủ chiến lược và mục tiêu mơ hồ.
Grand Prize cũng yêu cầu 100%. 99,95% rất gần nhưng về chính thức vẫn chưa phải 100%.[11]
Cách hiểu chính xác là: trí tuệ tổng quát chưa hoàn tất, nhưng điểm yếu lâu năm trong học hiệu quả ở môi trường tương tác mới đã giảm mạnh.
8. Có thể dùng vào đâu? Những công việc không ai viết hết luật trước được
Ứng dụng thú vị nhất vượt xa câu đố.
- Mô phỏng nhà máy và logistics: thay nhân sự, tồn kho, thứ tự, tuyến đường để tìm điều kiện giảm trễ và chi phí.
- Khám phá phần mềm: học giao diện lạ và tìm điều kiện tái hiện lỗi.
- Trò chơi và robot: học quan hệ nhân quả giữa hành động và kết quả với ít lần thử.
- Quảng cáo, giá và vận hành: khám phá tổ hợp quyết định và quan sát kết quả.
- Hỗ trợ nghiên cứu: tạo giả thuyết, thử nghiệm, loại bỏ thất bại, cập nhật mô hình hệ thống.
Mệnh lệnh chuyển từ “hãy làm theo luật này” sang “hãy tìm xem luật nào thực sự quan trọng”.
9. Còn cổ phiếu và scalping? Máy tìm edge ứng viên hợp lý hơn nhà tiên tri
Ở đây, edge nghĩa là một lợi thế thống kê nhỏ có thể lặp lại và vẫn còn sau chi phí giao dịch.
Cách tiếp cận kiểu Astra sẽ không bắt đầu bằng luật hoàn chỉnh như “RSI dưới 30 thì mua”. Nó quan sát sổ lệnh, giao dịch, giá, spread, khối lượng và thời gian.
Rồi hỏi:
Tổ hợp trạng thái hiện tại nào thường đi sau bởi một thiên lệch nhỏ của lợi suất trong vài giây hoặc vài phút tiếp theo?
AI có thể đưa ra giả thuyết kết hợp độ sâu bên mua tăng đột ngột, lệnh mua thị trường tăng, spread hẹp và một khung giờ cụ thể.
Đó vẫn chỉ là giả thuyết, không phải công thức kiếm tiền.
Thị trường khác ARC ở chỗ luật không ổn định. Người tham gia, tin tức, thanh khoản, quy định và chế độ thị trường đều thay đổi.
Nếu chỉ nói “tìm mẫu kiếm tiền”, AI rất dễ coi ngẫu nhiên lịch sử như quy luật tự nhiên.
10. Hệ thống nghiêm túc phải bắt AI tấn công chính phát hiện của mình
Backtest dùng dữ liệu lịch sử để đánh giá quy tắc giao dịch.
Nguy hiểm là khi thử hàng nghìn hoặc hàng triệu biến thể, một số sẽ trông cực kỳ đẹp chỉ nhờ may mắn. Đây là vấn đề backtest overfitting.[12][13]
Một edge explorer đáng tin nên:
- tạo giả thuyết;
- tìm ứng viên trong giai đoạn phát triển;
- loại bằng dữ liệu chưa từng dùng để khám phá;
- cố phá trong thị trường tăng, giảm, biến động cao và thấp;
- trừ phí, spread và slippage;
- ghi lại tổng số ý tưởng đã thử;
- kiểm định walk-forward theo đúng thứ tự thời gian;
- paper trading trước khi dùng tiền thật;
- đặt điều kiện dừng khi edge biến mất.
Vai trò lý tưởng không phải nhà tiên tri.
Mà là một nhà nghiên cứu đưa ra 1.000 giả thuyết cộng với một người phản biện tự tay giết 998 giả thuyết.
11. Kết luận: từ “AI trả lời” sang “AI tìm ra đâu mới là luật”
Điều quan trọng nhất của ARC-AGI-3 không chỉ là con số 99,95% bắt mắt.
Mà là chu trình:
quan sát → hành động → thất bại → suy ra luật → sửa giả thuyết → tiến tới mục tiêu.
Sol cho thấy mô hình mạnh có thể yếu đi thế nào khi kinh nghiệm không được lưu tốt. Astra cho thấy bước tiến lớn trong việc nén kinh nghiệm thành quy tắc hữu ích và thực thi bằng ít tương tác.
Vì vậy, nhiệm vụ giao cho tác nhân cao cấp cũng có thể thay đổi.
Không chỉ:
“Đây là quy tắc. Hãy làm.”
Mà là:
“Đây là môi trường và dữ liệu. Hãy tìm những quy tắc có vẻ quan trọng, thử phá chúng trong điều kiện khác, và chỉ mang về những gì sống sót.”
Không có gì đảm bảo điều này tạo lợi nhuận trên thị trường. Thị trường khắc nghiệt hơn ARC rất nhiều.
Nhưng nếu xem AI không phải thầy bói mà là máy phát hiện và tấn công giả thuyết, kết quả của Astra trở thành một tin rất thực dụng.
- Google DeepMind — IMO 2025 gold-medal-level result (2025-07-21) deepmind.google
- ARC Prize — “OpenAI's GPT-6 Astra on ARC-AGI-3” (2026-09-03) arcprize.org
- ARC Prize — “Announcing ARC-AGI-3” (2026-03-25) arcprize.org
- ARC Prize Verified Results — GPT-6 Astra (verified 2026-09-02) arcprize.org
- ARC Prize — ARC-AGI-1 & ARC-AGI-2 Guide arcprize.org
- ARC Prize — “ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems” (2025-05-20) arcprize.org
- ARC-AGI-3 Docs — Game Schema docs.arcprize.org
- ARC Prize — “Measuring Human Performance on ARC-AGI-3” (2026-04-14) arcprize.org
- ARC Prize Verified Results — GPT-5.6 arcprize.org
- OpenAI — “How two settings tripled our ARC-AGI-3 scores” (2026-07-29) openai.com
- ARC Prize 2026 — ARC-AGI-3 Competition; Grand Prize requires 100% arcprize.org
- Bailey, Borwein, López de Prado & Zhu — “The Probability of Backtest Overfitting papers.ssrn.com
- Bailey & López de Prado — “How ‘backtest overfitting’ in finance leads to false discoveries” (2021) academic.oup.com
