從一位自稱17歲的發文者,看懂「閉環」到底是什麼
一位匿名發文者自稱17歲,並提出:AI代理真正驚人的地方,不只是單一模型有多強,而是工作可以被轉換成「數量」。
其他人的第一反應大概是:
「17歲?你是轉生來的系統架構師嗎?」
年齡與視野的反差確實很好笑,但真正值得注意的不是年齡。
更重要的是背後的結構。
AI時代的生產力,正在從「擁有一個最聰明的模型」移向「把工作做成閉環,再讓許多代理安全地反覆運行」。
而當閉環真的建立起來,下一個問題立刻出現。
如果品質也能自動衡量,品質本身也會被捲進數量戰。
恭喜,舊瓶頸自動化完成。
新的瓶頸已經在門口排隊。
1. AI真正容易擴張的是「可以複製的勞動力」
增加一名人類工作者,需要招聘、訓練、薪資、權限、交接與管理。
AI代理不同。
同一套設計可以複製多份,交給不同任務,同時運行。只要運算資源與預算允許,一個可以變十個,十個可以變一百個。
但這不代表「買Token就一定賺錢」。買到的是計算,不是保證獲利。
真正產生價值,需要幾個條件:
- 工作可以拆分;
- 不同代理可以取得相對獨立的輸入;
- 輸出能低成本檢查;
- 系統能發現失敗;
- 錯誤結果可以自動重試或修復;
- 最終成果能連到真實需求。
條件成立後,AI就不再只是聰明的聊天工具,而會變成能擴容的處理基礎設施。
2. 閉環就是讓結果回到下一步行動
閉環的結構很簡單:
執行。
觀察。
判斷。
修復。
再執行。
結果不會被丟到系統外,而會回到下一輪。
用一般化的文章工廠來看:
生成文章 → 品質檢查 → 多語本地化 → 發布 → 讀取真實線上HTML → 偵測異常 → 修復 → 再發布。
這已經相當接近閉環。
相反,
「讓AI寫100篇文章。完成。」
是開環。
產量可能增加100倍,錯誤與沒人看的文章也可能一起增加100倍。
這就是高速生產線沒有品檢台。
3. 研究也顯示:代理不是越多越好
Google Research在2026年1月比較了180種代理配置。
在適合平行處理的金融推理任務中,由中央協調者把工作分給多個代理的架構,比單一代理基準高約80.9%。
但在必須嚴格按照順序進行的規劃任務中,多代理架構反而下降39%到70%。
所以,一百個代理不等於一百倍進度。
有時只是把會議人數增加到一百人。
同一研究還指出,完全獨立工作的代理會讓錯誤最多放大17.2倍;中央協調架構則把這個數值壓到4.4倍。
數量很強。
但能吸收、整合、驗證數量的系統可能更重要。
4. 真正的瓶頸常常不是生成器,而是驗證器
軟體非常適合做閉環。
能不能編譯?
測試有沒有通過?
型別是否正確?
輸出是否符合預期?
很多答案都能機械判斷。
這也是軟體開發較早出現大量代理運作的原因之一。
開放式工作就困難得多。
什麼是好文章?
什麼是原創研究?
什麼是有說服力的分析?
什麼是值得信任的建議?
如果把負責這些判斷的機制叫做驗證器,那麼AI時代的稀缺資源很可能從生成器轉到驗證器。
2026年的自主研究代理綜述發現,在24個可執行系統中,83%公開程式碼,但只有38%公開亂數種子或執行軌跡,38%報告任何新穎性驗證方法。按照該研究的編碼規則,9個高度自主的閉環系統中,沒有一個展示經外部驗證的環內判定器。
系統會產出。
困難的是證明那些產出值得相信。
5. 一旦品質可以測量,品質本身也會變成數量戰
生成100個候選。
自動評估100個。
改進前10個。
再從這10個分支出新的100個。
再次評估。
反覆進行。
如此一來,品質也能靠計算量搜索。
Google Research在2026年7月介紹的Science One Framework正朝這個方向發展。它除了平行探索研究方案,還建立主張與證據之間的鏈結,檢查報告分數能否獨立重現、參考文獻是否真的存在,以及論文描述的方法是否與實際程式碼一致。
生成閉環之後,開始出現驗證閉環。
所以「如果品質保證也能拆成自動任務,那品質也會加入數量戰」這句自爆式玩笑,已經非常接近真正的工程問題。
6. 然後Goodhart問題出場
先做一個品質分數。
AI開始最大化這個分數。
但分數只是人類真正目標的代理值,不是目標本身。
只優化搜尋排名,文章可能越來越像寫給搜尋引擎。
只優化點擊率,標題可能越來越刺激。
只優化測試通過,代理可能鑽測試漏洞。
這就是Goodhart法則與規格投機一類的問題。
2026年針對語言模型代理的獎勵駭取研究也觀察到,代理可以取得較高的表面獎勵,卻在隱藏的安全目標上表現更差;直接最佳化獎勵甚至可能擴大差距。
因此,不能創造一個驗證器,再把它變成新的神諭。
要有多種檢查。
要把現實結果餵回去。
要有獨立稽核。
模糊案例仍然要讓人看。
還要定期確認:這個分數還代表原本的目標嗎?
好的閉環,甚至需要一個逃離自己評分制度的緊急出口。
7. 還是有一些資源不容易被數量化
與其尋找「AI永遠做不到的神聖工作」,不如尋找即使Token變便宜,複製成本也不會大幅下降的資源。
物理世界
土地、設備、電力、物流、人體、安全流程與現場時間,都不會用Token的速度增加。
權限與責任
合約簽署、執照、法律責任與最終批准,都需要明確的責任主體,不只是推理能力。
信任
關係由長期行為、承諾、聲譽與互惠累積而成。AI可以幫忙找人、寫訊息、維護聯絡,但不能瞬間複製共同歷史。
「最後剩下的是人脈」作為假說有道理,但不是自然定律。
真正稀缺的不是聯絡人清單。
是關係的歷史。
人類注意力
這可能是最大的瓶頸。
文章可以生成十億篇,人類一天還是24小時。
影片可以生成十億支,人的注意力仍然有限。
供給越接近無限,選擇、信任與注意力就越值錢。
8. 真正的規律是:瓶頸一直往後移
生成昂貴時,生成能力有價值。
生成變便宜後,驗證變昂貴。
驗證變便宜後,篩選變昂貴。
篩選也變便宜後,分發與信任變昂貴。
最後撞上物理資源、責任、真實需求與人類注意力。
所以強大的AI運作,不只是挑最聰明的模型。
拆分工作。
只平行真正能平行的部分。
驗證結果。
自動修復失敗。
把現實反應送回下一輪。
把環閉起來。
可以用一個很粗略的思考模型理解:
有效產出 ≒ 可平行工作量 × 代理數量 × 驗證準確度 ÷ 協調成本、返工成本與人工審核成本
這不是科學公式。
但它很好地說明,為什麼只增加代理數量不夠。
「17歲是不是轉生者」這個玩笑很好笑。
更大的變化是,不論年齡,個人現在都可能建立出像小型組織一樣運作的系統。
下一場競爭不只是模型IQ。
而是誰先找到有效的閉環,以及誰能正確驗證閉環大量吐出的結果。
下一個瓶頸,已經在後面等著了。
參考資料
- Google Research, “Towards a science of scaling agent systems: When and why agent systems work,” 2026-01-28. https://research.google/blog/towards-a-science-of-scaling-agent-systems-when-and-why-agent-systems-work/
- Ding et al., “Autonomous Research Agents: A Survey of AI Scientists and the Verification Gap,” 2026. https://arxiv.org/abs/2608.05179
- Google Research, “Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence,” 2026-07-30. https://research.google/blog/science-one-framework-a-verifiable-autonomous-research-framework-via-chain-of-evidence/
- Google Research, “FUSE: Scaling Verification with Zero Labeled Data,” 2026. https://research.google/pubs/fuse-scaling-verification-with-zero-labeled-data/
- Çağatan and Zhao, “Reward Hacking in Language Model Agents: Revisiting AI Safety Gridworlds,” 2026. https://arxiv.org/abs/2606.15385
- Karwowski et al., “Goodhart's Law in Reinforcement Learning,” 2023. https://arxiv.org/abs/2310.09144
