Ai từng tự tay nghiên cứu chiến lược giao dịch cực ngắn đều biết phần nặng nhất không chỉ là “tính toán”.
Khi tín hiệu A xuất hiện thì làm gì? Nếu B xuất hiện cùng lúc? Giữ lệnh khi biến động cao? Bỏ khi spread rộng? Phiên này theo xu hướng, phiên kia không vào?
Nếu kiểm tra từng nhánh một, một buổi tối bình thường nhanh chóng biến thành phòng thí nghiệm cá nhân. Dành vài giờ mỗi ngày trong nhiều năm rồi cuối cùng chỉ giữ được một chiến lược sống sót không phải chuyện lạ.
Rồi AI mạnh về khám phá xuất hiện.
Trong một quy trình như vậy, AI có thể thử hàng nghìn biến thể trong khung thời gian vài giờ, phân tích tiếp vì sao lợi nhuận không ổn định và dùng nguyên nhân thất bại để chọn thí nghiệm kế tiếp.
Phản ứng của con người rất tự nhiên:
“Nếu bắt người làm từng cái thì mất bao nhiêu ngày?”
Nhưng kết luận “AI thử được 4.000 chiến lược nên thắng rồi” lại rất nguy hiểm. Trong tài chính, thử càng nhiều cũng có nghĩa là càng có nhiều cơ hội tìm ra một mẫu chỉ tình cờ khớp với lịch sử.[1][2]
Công thức hữu ích hơn là:
giả thuyết của con người × khám phá của AI × phản chứng bằng AI × điều chỉnh thống kê cho tìm kiếm quy mô lớn.
Đừng chỉ có AI tìm người thắng. Hãy có thêm AI chuyên cố gắng giết người thắng đó.
1. Vì sao nhiều năm nghiên cứu thủ công có thể đột nhiên bị nén lại
Nghiên cứu chiến lược thủ công là chuỗi việc nhỏ:
- Đặt giả thuyết.
- Cài điều kiện.
- Backtest.
- Đọc kết quả.
- Hỏi vì sao không ổn định.
- Tách điều kiện.
- Thử lại.
Không bước nào nhất thiết quá khó. Gánh nặng đến từ việc lặp lại hàng trăm, hàng nghìn lần.
Con người còn phải trả chi phí chuyển ngữ cảnh: hôm qua đã thử đến đâu? Bộ lọc này từng dùng chưa? Kết quả này là trước hay sau khi thay giả định spread?
Một tác nhân khám phá có thể giữ vòng lặp chạy liên tục.
Nó không cần dừng ở “có lãi”. Nó có thể kiểm tra xem lợi nhuận chỉ đến từ vài ngày hay không, có biến mất sau chi phí không, chỉ tồn tại trong một phiên không, hoặc sụp khi bỏ một thành phần không.
Đây không chỉ là backtest nhanh hơn.
Đây là vòng lặp nghiên cứu nhanh hơn.
2. Điểm mạnh của Astra giống “đi được trong môi trường chưa biết” hơn là “biết sẵn đáp án”
ARC-AGI-3 giúp nhìn rõ khả năng này.
Đây là benchmark tương tác gồm các môi trường lưới 2D mới, không có hướng dẫn bằng ngôn ngữ tự nhiên và không nêu mục tiêu. Tác nhân phải tự khám phá, suy ra quy tắc, xây mô hình môi trường, tìm mục tiêu, lập kế hoạch, hành động và sửa khi thất bại.[3][4]
Tháng 7/2026, GPT-5.6 Sol đạt 7,78% trên bộ semi-private của ARC Prize. OpenAI cũng cho thấy trên bộ public rằng việc giữ trạng thái suy luận và nén ngữ cảnh trong một cấu hình khác có thể đưa Sol từ 13,3% lên 38,3%.[5]
Tháng 9, Astra đạt 62,7% trên cùng bộ semi-private bằng Standard harness của ARC Prize và 99,9% với Provider Adapter giữ nhiều trạng thái suy luận hơn giữa các hành động. Vì thiết kế harness ảnh hưởng rất mạnh đến điểm số, không nên đọc 99,9 so với 7,78 như một tỷ lệ trực tiếp trong điều kiện giống hệt nhau. Điểm đáng chú ý là bước nhảy về khám phá, mô hình hóa trạng thái và thích nghi dài hạn.[6][3]
ARC Prize còn báo cáo rằng ở 96% số level Astra hoàn thành, nó dùng ít hành động hơn trung vị của những người hoàn thành level đó.[3]
Đây là loại sức mạnh khác với việc giải một phương trình rất khó trong một lần.
Nó giống:
“Chạm cái này thì sao? Được. Thử cái kia? À, giờ hiểu quy tắc rồi.”
Những game 2D trông như trẻ em cũng có thể nghịch lại từng là bài toán khó với AI, nên sự thay đổi về khả năng khám phá tương tác rất dễ thấy.
ARC Prize cũng nhấn mạnh rằng đạt trần ARC-AGI-3 không chứng minh AGI. Benchmark này khép kín và mang tính xác định, khác xa thế giới thật.[3]
3. Vì sao khám phá game 2D lại gợi nhớ nghiên cứu scalping
Thị trường không phải trò chơi xác định. Có nhiều tác nhân, thông tin ẩn, chuyển regime, chi phí và hạn chế thực thi.
Nhưng vòng nghiên cứu lại giống nhau.
Giả sử thêm điều kiện mất cân bằng sổ lệnh làm backtest tốt hơn.
Các câu hỏi tiếp theo là bắt buộc:
- Bản thân mất cân bằng có thật sự dự báo không?
- Chỉ hoạt động khi biến động cao?
- Chỉ đẹp vì spread thấp?
- Tệ hơn một tick khi khớp lệnh thì biến mất?
- Chỉ có ở một phiên?
Quan sát. Thay đổi. Đo. Cập nhật giả thuyết.
Cấu trúc gần với ARC-AGI-3: cảm nhận → hành động → phản hồi → cập nhật mô hình → chọn hành động tiếp theo.[3][4]
Vì vậy chỉ dẫn tốt hơn “tìm tham số có lợi nhuận cao nhất” là:
“Phân rã vì sao lợi nhuận tồn tại, tìm điều kiện giết nó, rồi biến nguyên nhân thất bại thành thí nghiệm kế tiếp.”
4. Kinh nghiệm con người không biến mất — “khu vực này có mùi” trở thành bản đồ ban đầu
Có thể cho AI bắt đầu từ số 0.
Nhưng không gian tìm kiếm càng lớn, kinh nghiệm con người càng hữu ích để quyết định nơi nào nên tiêu ngân sách khám phá trước.
Người đã đọc và thử nhiều năm thường có tri thức nén kiểu:
- yếu khi đứng riêng nhưng có thể hữu ích như bộ lọc;
- chỉ thú vị trong regime có xu hướng;
- đẹp trên backtest nhưng yếu trước chi phí;
- tốt hơn để chặn entry xấu thay vì dự báo hướng;
- trông mạnh nhưng có thể chỉ tập trung ở một giai đoạn.
Đây không phải danh sách chân lý.
Đây là gợi ý trước cho không gian tìm kiếm.
Khoa học cũng có cấu trúc tương tự. Co-Scientist năm 2026 bắt đầu từ mục tiêu do nhà nghiên cứu đặt và bằng chứng trước đó, rồi liên tục sinh, phê bình, xếp hạng và phát triển giả thuyết khi tăng tài nguyên tính toán lúc thử nghiệm.[7]
Trong trading, con người nói “hãy đào ở đây trước”, còn AI đào hàng nghìn nhánh xung quanh.
Kinh nghiệm nên là công cụ phân bổ ngân sách khám phá, không phải giáo điều.
5. Vì sao tổ hợp nhiều điều kiện trở thành địa ngục nếu làm thủ công
Giả sử có 20 thành phần.
Chỉ hai lựa chọn — dùng hoặc không — đã có:
2^20 = 1.048.576 tổ hợp.
Ba lựa chọn — không dùng, dùng bình thường, dùng ngược — trở thành:
3^20 = 3.486.784.401 tổ hợp.
Thực tế không ai brute-force tất cả. Kiến thức lĩnh vực cắt bỏ những tổ hợp vô nghĩa.
Nhưng nghiên cứu thật còn thêm ngưỡng, thời gian, biến động, spread, thời gian giữ, lọc tin, bất đối xứng long/short và giả định fill.
Vì vậy quá trình cũ:
“Thêm cái này thì sao? Loại trường hợp kia? Chỉ dùng trong regime này?”
thực chất là con người đi bộ trong một cây tìm kiếm có điều kiện khổng lồ.
Mất nhiều năm là bình thường.
Bảng tính không có tội. Vũ trụ quá rộng.
6. Giá trị của AI không phải brute force; là chọn thí nghiệm kế tiếp
Một tác nhân khám phá tốt thay đổi phép thử sau dựa trên kết quả trước.
Nếu chiến lược là A+B+C+D, bỏ từng thành phần.
- Bỏ D gần như không đổi → D có thể chỉ là trang trí.
- B yếu một mình nhưng A+B giảm drawdown rõ rệt → B có thể là bộ lọc, không phải nguồn dự báo.
- C yếu toàn kỳ nhưng mạnh khi biến động cao → C có thể phụ thuộc regime.
Loại bỏ thành phần để hiểu đóng góp thường được gọi là kiểm tra ablation.
Tên gọi không quan trọng bằng mục đích:
tháo chiến lược phức tạp ra và chỉ giữ các bộ phận thật sự làm việc.
Khám phá → thất bại → phân loại nguyên nhân → chọn thí nghiệm tiếp theo.
Khi vòng này được tự động hóa, mô hình bắt đầu giống trợ lý nghiên cứu hơn là bộ tối ưu tham số.
7. Nguy hiểm lớn nhất vẫn là quá khớp — thử 4.000 thứ sẽ có một “thiên tài may mắn” xuất hiện
Đây là điểm sống còn trong tài chính.
Nếu thử 4.000 chiến lược rồi chỉ công bố cái đẹp nhất, người thắng có thể chỉ là cái tình cờ khớp lịch sử tốt nhất.
White hệ thống hóa vấn đề data snooping: dùng đi dùng lại cùng dữ liệu cho suy luận và chọn mô hình khiến kết quả tốt có thể xuất hiện vì ngẫu nhiên thay vì phương pháp thật sự vượt trội.[1]
Kết hợp nhiều tín hiệu làm vấn đề nặng hơn.
Novy-Marx cho thấy chiến lược đa tín hiệu có thể chịu bias quá khớp nghiêm trọng, và ngay cả tín hiệu ngẫu nhiên không có năng lực dự báo thật cũng có thể tạo backtest trông rất có ý nghĩa sau quá trình chọn và kết hợp.[2]
Khả năng khám phá có hai lưỡi.
AI có thể sai nhanh hơn hàng nghìn lần.
Rồi trao cúp cho sai lầm đẹp nhất.
Tìm kiếm càng lớn, chống quá khớp càng phải nằm trong chính quá trình tìm kiếm.
8. Chống quá khớp bắt đầu bằng việc ghi mọi thử nghiệm và giữ một bộ cuối không dùng để chọn
Nếu đã khám phá hàng nghìn ứng viên, các ứng viên bị loại cũng là bằng chứng.
Một pipeline mạnh nên có ít nhất:
- Ghi mọi trial. Đã đổi gì, thử bao nhiêu biến thể, vì sao loại.
- Tách dữ liệu khám phá và đánh giá cuối. Không nhìn đi nhìn lại bộ cuối trong lúc chọn mô hình.
- Kiểm tra tiến về phía trước theo thời gian. Xây trên dữ liệu cũ hơn và thử trên dữ liệu mới hơn bằng walk-forward.
- Cố ý làm điều kiện thực thi xấu hơn. Tăng spread, phí, slippage, độ trễ và giả định fill bi quan.
- Làm nhiễu tham số. Chiến lược chỉ sống ở một ngưỡng thần kỳ là dấu hiệu đáng ngờ.
- Tách regime. Xem lợi nhuận có chỉ đến từ một năm, phiên, mức biến động, hướng hay vài giao dịch không.
- Điều chỉnh thống kê cho việc đã thử rất nhiều thứ.
DSR điều chỉnh cách hiểu Sharpe cho bias lựa chọn do multiple testing và lợi nhuận không phân phối chuẩn.[8]
PBO được đề xuất riêng cho backtest đầu tư để ước lượng khả năng quá khớp bằng kiểm định chéo đối xứng tổ hợp.[9]
Reality Check của White xử lý data snooping giữa nhiều ứng viên; kiểm định SPA của Hansen được thiết kế mạnh hơn và ít nhạy với ứng viên tệ hoặc không liên quan.[1][10]
Không cần thuộc hết chữ viết tắt.
Chỉ cần nhớ:
nếu người thắng xuất hiện sau 4.000 lần thử, hãy đánh giá nó như người thắng của giải đấu 4.000 lần thử.
Và sau khi xem bộ dữ liệu “niêm phong” rồi sửa chiến lược, bộ đó không còn niêm phong nữa.
9. Kiến trúc mạnh có thể dùng hai AI: một tìm người thắng, một cố giết người thắng
Chia vai trò rõ ràng.
AI khám phá
- tạo điều kiện mới;
- tái kết hợp giả thuyết con người;
- tìm hiệu ứng theo regime;
- biến nguyên nhân thất bại thành thử nghiệm mới.
AI phản chứng
- làm chi phí xấu đi;
- trì hoãn fill;
- bỏ một số ngày;
- dịch ngưỡng;
- đổi thời kỳ và thị trường;
- áp dụng DSR, PBO, Reality Check, SPA;
- kiểm tra lợi nhuận có đến từ rất ít quan sát không.
AI khám phá nói: “Tìm thấy rồi.”
AI phản chứng hỏi: “Thật không?”
Nếu sống sót, đánh tiếp.
Trong nghiên cứu tài chính, tính cách khó chịu đó chính là kiểm soát chất lượng.
Mục tiêu nên rời khỏi “lợi nhuận lịch sử tối đa” và chuyển thành:
“một cấu trúc vẫn giải thích được và còn sống sau khi giả định, tham số, chi phí và mẫu bị làm xấu một cách hợp lý.”
10. Khi model mới ra, hãy tìm năng lực vừa vượt qua bức tường — đừng chỉ nhìn tổng điểm
Bài học này rộng hơn scalping rất nhiều.
Khi AI mới ra mắt, tăng vài phần trăm ở benchmark chung có thể ít quan trọng hơn một nhiệm vụ lạ vừa chuyển từ gần như bất khả thi sang khả dụng.
Câu hỏi đáng dùng là:
“Công việc nào ở thế hệ trước không đáng tiền, nhưng thế hệ này đột nhiên khả thi?”
Với Astra, ARC-AGI-3 làm nổi bật khám phá môi trường lạ, xây mô hình thế giới gọn, giữ trạng thái và hành động hiệu quả.[3]
Sau đó nối khả năng này với nút thắt thật:
- Ở đâu con người tốn thời gian chỉ để chọn nên thử gì tiếp?
- Ở đâu có hàng nghìn giả thuyết kiểm chứng được?
- Thành công và thất bại có đo khách quan không?
- Lặp lại nhiều có làm chênh lệch chi phí lao động tăng lớn không?
- Khám phá tốt hơn có chuyển thành lợi nhuận, giảm chi phí hoặc R&D nhanh hơn không?
Càng nhiều câu “có”, cơ hội càng đáng chú ý.
Khoa học đã đi theo hướng này: Co-Scientist mở rộng vòng sinh → phê bình → so sánh → phát triển giả thuyết.[7]
Vì vậy, mỗi lần model mới ra có thể xem như săn kho báu:
“Phần nào của vòng nghiên cứu con người từng cực kỳ tẻ nhạt vừa trở thành thứ có thể chạy ở quy mô máy?”
Tóm tắt:
Con người vẽ bản đồ đầu tiên. AI đào vượt khỏi bản đồ. Thống kê hỏi thứ lấp lánh có thật là vàng không.
AI càng mạnh, càng cần một bên luôn hoài nghi.
Bên hoài nghi đó cũng có thể là một AI khác.
- Halbert White — A Reality Check for Data Snooping, Econometrica 68(5), 2000 onlinelibrary.wiley.com
- Robert Novy-Marx — Backtesting Strategies Based on Multiple Signals, NBER Working Paper 21329, 2015 nber.org
- ARC Prize — OpenAI's GPT-6 Astra on ARC-AGI-3 (2026-09-03) arcprize.org
- ARC Prize — Announcing ARC-AGI-3 / ARC-AGI-3 documentation https://docs.arcprize.org/ arcprize.org
- OpenAI — How two settings tripled our ARC-AGI-3 scores (GPT-5.6 Sol) openai.com
- OpenAI — GPT-6 Astra: A new generation of intelligence openai.com
- Juraj Gottweis et al. — Accelerating scientific discovery with Co-Scientist, Nature, 2026 nature.com
- David H. Bailey & Marcos López de Prado — The Deflated Sharpe Ratio: Correcting for Selection Bias, Backtest Overfitting, and Non-Normality, 2014 doi.org
- David H. Bailey, Jonathan Borwein, Marcos López de Prado & Qiji Jim Zhu — The Probability of Backtest Overfitting, 2015 papers.ssrn.com
- Peter Reinhard Hansen — A Test for Superior Predictive Ability, Journal of Business & Economic Statistics 23(4), 2005 tandfonline.com
