Sức mạnh của tác nhân AI nằm ở số lượng hơn là “IQ”?

Một người đăng bài ẩn danh, tự nhận mình 17 tuổi, viết rằng điều đáng gờm nhất ở các tác nhân AI không chỉ là năng lực của một mô hình riêng lẻ, mà là khả năng

Chia sẻ bài viết này

Chia sẻ bài viết này

Quảng cáo
Quảng cáo

Một bài đăng của người tự nhận 17 tuổi cho thấy điều gì về vòng lặp kín

Một người đăng bài ẩn danh, tự nhận mình 17 tuổi, viết rằng điều đáng gờm nhất ở các tác nhân AI không chỉ là năng lực của một mô hình riêng lẻ, mà là khả năng biến công việc thành quy mô.

Phản ứng của người khác đại khái là:

“17 tuổi thật à? Chuyển sinh từ kiến trúc sư hệ thống sang đây phải không?”

Sự chênh lệch giữa tuổi và góc nhìn khá buồn cười, nhưng đó không phải điều quan trọng nhất.

Điều đáng chú ý là cấu trúc của ý tưởng. Năng suất trong thời đại AI đang chuyển từ “sở hữu một mô hình thông minh nhất” sang “biến công việc thành vòng lặp kín để nhiều tác nhân có thể chạy an toàn”.

Và khi vòng lặp đó hoạt động, vấn đề tiếp theo xuất hiện ngay.

Nếu chất lượng cũng đo được tự động, chính chất lượng sẽ bước vào cuộc chiến số lượng.

Ta tự động hóa một nút thắt.

Rồi tạo ra nút thắt tiếp theo.

1. Lợi thế mở rộng của AI là lao động có thể sao chép

Thêm một người lao động cần tuyển dụng, đào tạo, lương, quyền truy cập, bàn giao ngữ cảnh và quản lý.

Tác nhân AI có thể được nhân bản dễ hơn nhiều. Các bản sao nhận những nhiệm vụ khác nhau và chạy đồng thời. Nếu đủ ngân sách và tài nguyên tính toán, một thành mười, mười thành một trăm.

Điều đó không có nghĩa là “mua token chắc chắn sinh lời”. Mua tính toán chỉ đảm bảo có tính toán, không đảm bảo lợi nhuận.

Giá trị xuất hiện khi tính toán gắn với một quy trình hữu ích:

  • công việc có thể chia nhỏ;
  • các tác nhân nhận đầu vào đủ độc lập;
  • đầu ra có thể kiểm tra với chi phí thấp;
  • lỗi có thể phát hiện;
  • kết quả sai có thể chạy lại hoặc sửa tự động;
  • và sản phẩm cuối cùng gặp được nhu cầu thật.

Khi những điều kiện này tồn tại, AI không còn chỉ là một hộp chat thông minh mà trở thành hạ tầng lao động có thể mở rộng.

2. Vòng lặp kín nghĩa là kết quả quyết định hành động tiếp theo

Cấu trúc rất đơn giản:

thực hiện;

quan sát;

đánh giá;

sửa;

chạy lại.

Kết quả quay trở lại hệ thống làm đầu vào cho vòng sau.

Hãy lấy một nhà máy bài viết tổng quát:

tạo bài → kiểm tra chất lượng → bản địa hóa đa ngôn ngữ → xuất bản → đọc HTML thật trên môi trường sản xuất → phát hiện lỗi → sửa → xuất bản lại.

Đó gần như một vòng lặp kín.

Ngược lại:

“Cho AI viết 100 bài. Xong.”

là vòng lặp mở.

Sản lượng có thể tăng 100 lần. Lỗi và bài không ai đọc cũng có thể tăng 100 lần.

Đó là dây chuyền sản xuất tốc độ cao nhưng không có bàn kiểm phẩm.

3. Nghiên cứu cho thấy nhiều tác nhân hơn không phải lúc nào cũng tốt hơn

Tháng 1 năm 2026, Google Research so sánh 180 cấu hình tác nhân.

Trong một nhiệm vụ suy luận tài chính dễ song song hóa, kiến trúc tập trung phân công cho nhiều tác nhân cải thiện khoảng 80,9% so với một tác nhân.

Nhưng trong nhiệm vụ lập kế hoạch đòi hỏi thứ tự nghiêm ngặt, mọi biến thể đa tác nhân đều giảm hiệu năng từ 39% đến 70%.

Một trăm tác nhân không đồng nghĩa tiến độ nhanh hơn một trăm lần.

Đôi khi chỉ là cuộc họp có một trăm người.

Cùng nghiên cứu đó cho thấy các tác nhân hoàn toàn độc lập có thể khuếch đại lỗi tới 17,2 lần, trong khi điều phối tập trung giảm mức khuếch đại xuống 4,4 lần.

Số lượng có sức mạnh.

Nhưng hệ thống gom, kết hợp và kiểm chứng số lượng đó có thể còn quan trọng hơn.

4. Nút thắt thật sự thường là bộ kiểm chứng

Phần mềm rất hợp với vòng lặp kín.

Có biên dịch được không?

Kiểm thử có qua không?

Kiểu dữ liệu có đúng không?

Đầu ra có giống mong đợi không?

Nhiều câu hỏi có thể được máy kiểm tra.

Đó là một lý do phát triển phần mềm trở thành nơi sớm xuất hiện việc mở rộng tác nhân.

Công việc mở thì khó hơn.

Bài viết tốt là gì?

Nghiên cứu nguyên bản là gì?

Phân tích thuyết phục là gì?

Khuyến nghị đáng tin là gì?

Nếu gọi cơ chế trả lời những câu hỏi đó là bộ kiểm chứng, một tài nguyên khan hiếm trong thời đại tác nhân có thể chuyển từ bộ sinh sang bộ kiểm chứng.

Một khảo sát năm 2026 về tác nhân nghiên cứu tự trị cho thấy trong 24 hệ thống chạy được, 83% công bố mã nguồn, nhưng chỉ 38% công bố seed hoặc dấu vết thực thi và 38% báo cáo một phương pháp kiểm chứng tính mới. Theo tiêu chí của khảo sát, không hệ thống nào trong 9 hệ thống vòng lặp kín có mức tự chủ cao chứng minh được một bộ phán xét nội vòng đã được xác thực từ bên ngoài.

Tạo ra sản phẩm là một chuyện.

Chứng minh rằng sản phẩm đáng tin lại khó hơn.

5. Khi chất lượng đo được, chất lượng cũng trở thành cuộc chiến quy mô

Tạo 100 ứng viên.

Đánh giá tự động cả 100.

Cải thiện 10 ứng viên tốt nhất.

Từ đó tạo thêm 100 ứng viên.

Đánh giá lại.

Lặp.

Chất lượng bắt đầu có thể được tìm kiếm bằng tài nguyên tính toán.

Science One Framework do Google Research giới thiệu tháng 7 năm 2026 đi theo hướng này. Nó không chỉ thăm dò nhiều hướng song song mà còn liên kết từng khẳng định với bằng chứng, kiểm tra xem điểm số có thể tái tạo độc lập không, tài liệu tham khảo có tồn tại thật không và mô tả phương pháp có khớp với mã nguồn hay không.

Sau vòng lặp sinh nội dung là vòng lặp kiểm chứng.

Vì vậy câu đùa “nếu bảo đảm chất lượng cũng phân rã thành tác vụ tự động được thì chất lượng cũng bị cuốn vào chiến tranh số lượng” đang trở thành vấn đề kỹ thuật thực tế.

6. Rồi vấn đề Goodhart xuất hiện

Ta tạo một điểm chất lượng.

Tác nhân học cách tối đa hóa điểm đó.

Nhưng điểm chỉ là đại diện không hoàn hảo cho mục tiêu thật của con người.

Chỉ tối ưu thứ hạng tìm kiếm thì văn bản có thể biến thành văn bản viết cho công cụ tìm kiếm.

Chỉ tối ưu lượt nhấp thì tiêu đề ngày càng kích động.

Chỉ tối ưu việc qua kiểm thử thì tác nhân có thể khai thác lỗ hổng của chính bộ kiểm thử.

Đây là vùng của định luật Goodhart và việc khai thác đặc tả.

Một nghiên cứu năm 2026 về thao túng phần thưởng ở tác nhân mô hình ngôn ngữ cũng quan sát thấy tác nhân đạt phần thưởng bề mặt cao trong khi tệ hơn ở mục tiêu an toàn ẩn. Tối ưu trực tiếp phần thưởng có thể làm khoảng cách này lớn hơn.

Vì vậy một bộ kiểm chứng không nên trở thành thước đo thần thánh mới.

Dùng nhiều phép kiểm tra.

Đưa kết quả ngoài đời thật trở lại quy trình.

Duy trì kiểm toán độc lập.

Để con người xem các trường hợp mơ hồ.

Và định kỳ hỏi xem chỉ số còn đại diện cho mục tiêu ban đầu không.

Một vòng lặp kín tốt còn cần lối thoát khẩn cấp khỏi chính hệ thống chấm điểm của nó.

7. Một số nguồn lực vẫn khó mở rộng bằng cách sao chép tác nhân

Ranh giới thú vị không phải “công việc thiêng liêng mà AI không bao giờ làm được”. Đó là những nguồn lực mà chi phí sao chép không giảm mạnh dù token rẻ đi.

Thế giới vật lý

Đất đai, máy móc, điện, logistics, cơ thể, an toàn và thời gian tại hiện trường không tăng theo tốc độ tính toán.

Thẩm quyền và trách nhiệm

Chữ ký, giấy phép, trách nhiệm pháp lý và phê duyệt cuối cùng cần một chủ thể thực sự chịu trách nhiệm, không chỉ một hệ thống có khả năng suy luận.

Niềm tin

Quan hệ được xây từ hành động lặp lại, lời hứa, danh tiếng và sự có đi có lại. AI có thể giúp tìm người, viết tin nhắn và duy trì liên lạc, nhưng không thể lập tức tạo ra lịch sử chung làm nền cho niềm tin.

Ý tưởng rằng “cuối cùng thứ còn lại là quan hệ” hợp lý như một giả thuyết, không phải định luật tự nhiên.

Thứ khan hiếm không phải danh bạ.

Mà là lịch sử của mối quan hệ.

Sự chú ý của con người

Đây có thể là nút thắt lớn nhất.

Ta có thể tạo một tỷ bài viết.

Một ngày vẫn chỉ có 24 giờ.

Ta có thể tạo một tỷ video.

Sự chú ý của con người vẫn hữu hạn.

Nguồn cung càng dư thừa, khả năng lựa chọn, niềm tin và sự chú ý càng có giá trị.

8. Quy luật chính là nút thắt cứ dịch chuyển về phía sau

Khi sinh nội dung đắt, khả năng sinh có giá trị.

Khi sinh trở nên rẻ, kiểm chứng trở nên đắt.

Khi kiểm chứng rẻ, chọn lọc trở nên đắt.

Khi chọn lọc rẻ, phân phối và niềm tin trở nên khan hiếm.

Cuối cùng ta gặp tài nguyên vật lý, trách nhiệm, nhu cầu thật và sự chú ý của con người.

Vì vậy vận hành tác nhân mạnh không chỉ là dùng mô hình thông minh nhất.

Chia nhỏ công việc.

Chỉ song song hóa phần thật sự có thể song song hóa.

Kiểm chứng kết quả.

Tự động sửa lỗi.

Đưa phản hồi từ thế giới thật vào lần chạy tiếp theo.

Khép vòng.

Một mô hình tư duy rất thô có thể là:

đầu ra hữu ích ≈ công việc song song hóa được × số tác nhân × độ chính xác kiểm chứng ÷ chi phí điều phối, làm lại và kiểm tra của con người

Đây không phải công thức khoa học.

Nhưng nó giải thích khá rõ vì sao chỉ tăng số tác nhân là chưa đủ.

Câu đùa về “người 17 tuổi chuyển sinh” khá vui.

Thay đổi lớn hơn là bất kể tuổi tác, một cá nhân giờ có thể bắt đầu xây hệ thống hoạt động giống một tổ chức nhỏ.

Cuộc cạnh tranh tiếp theo không chỉ là IQ của mô hình.

Mà là ai tìm ra vòng lặp hữu ích trước, và ai có thể kiểm chứng đúng dòng kết quả khổng lồ mà vòng lặp đó tạo ra.

Nút thắt tiếp theo đã đứng chờ sẵn.

  1. Google Research, “Towards a science of scaling agent systems: When and why agent systems work,” 2026-01-28. https://research.google/blog/towards-a-science-of-scaling-agent-systems-when-and-why-agent-systems-work/
  2. Ding et al., “Autonomous Research Agents: A Survey of AI Scientists and the Verification Gap,” 2026. https://arxiv.org/abs/2608.05179
  3. Google Research, “Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence,” 2026-07-30. https://research.google/blog/science-one-framework-a-verifiable-autonomous-research-framework-via-chain-of-evidence/
  4. Google Research, “FUSE: Scaling Verification with Zero Labeled Data,” 2026. https://research.google/pubs/fuse-scaling-verification-with-zero-labeled-data/
  5. Çağatan and Zhao, “Reward Hacking in Language Model Agents: Revisiting AI Safety Gridworlds,” 2026. https://arxiv.org/abs/2606.15385
  6. Karwowski et al., “Goodhart's Law in Reinforcement Learning,” 2023. https://arxiv.org/abs/2310.09144

Chia sẻ bài viết này

Quảng cáo

Tìm bài viết khác

Tất cả bài viết

Mendoi-chan

Tác giả

Mendoi-chan

Biến những vướng mắc trong công việc và đời sống hằng ngày thành cấu trúc rõ ràng và bước tiếp theo thực tế.

Giới thiệu
Quảng cáo

Bài viết mới

  1. 1AI rút ngắn công việc 40%. Tại sao ta lại nhét thêm 67% việc thay vì nghỉ sớm?
  2. 2Thực ra hokenjo làm gì? Từ “chó mèo và COVID” đến tuyến phòng thủ cuối cùng của y tế công cộng đô thị
  3. 3Từ đó là gì nhỉ?
  4. 4Sáu vị trí cho một ứng viên! Nghề kỹ thuật chắc phải “ngon”! → Người trong nghề: “Cho tôi về nhà được không?”
  5. 5Đã xác nhận trước hết rồi mà đến ngày khám lại như bị đặt lại — buổi sáng người đi khám trở thành “máy chủ sao lưu biết đi”

Có thể bạn quan tâm

Quảng cáo