从一位自称17岁发帖者的观点,看懂什么叫“闭环”
一位匿名发帖者自称17岁,并提出:AI智能体真正厉害的地方,不只是单个模型有多强,而是可以把工作转化成“数量”。
旁人的第一反应大概是:
“17岁?这是转生来的系统架构师吧?”
年龄反差确实很好笑,但更值得看的,是这句话背后的结构。
AI时代的生产力正在从“拥有一个最聪明的模型”,转向“把工作做成闭环,然后让许多智能体安全地重复运行”。
而闭环一旦成功,新的问题马上出现。
如果连质量都能自动衡量,那么质量本身也会进入数量战争。
好消息:瓶颈被自动化了。
坏消息:新的瓶颈已经排队了。
1. AI真正容易扩张的是“可复制的劳动”
增加一名人类员工,需要招聘、培训、工资、权限、交接和管理。
AI智能体不同。
同一种设计可以复制多份,分配不同任务,同时执行。只要计算资源和预算允许,一个可以变十个,十个可以变一百个。
这并不等于“买Token就一定赚钱”。购买计算量只能保证你得到计算,不能保证商业回报。
真正产生价值,需要满足几个条件:
- 工作能够拆分;
- 不同智能体可以拿到相对独立的输入;
- 输出能够低成本检查;
- 系统能发现失败;
- 失败结果能自动重试或修复;
- 最终成果能够连接真实需求。
这些条件成立时,AI就从一个聪明的聊天工具,变成可以扩容的劳动基础设施。
2. 闭环就是让结果决定下一步动作
闭环的结构非常简单:
执行。
观察。
判断。
修复。
再次执行。
结果不会被丢到系统外面,而是重新成为下一步的输入。
用一个通用的文章工厂举例:
生成文章 → 质量检查 → 多语言本地化 → 发布 → 读取真实线上HTML → 检测异常 → 修复 → 再发布。
这已经非常接近闭环。
相反,
“让AI写100篇文章。完成。”
属于开环。
产量可能增加100倍,错误和没人看的内容也可能一起增加100倍。
这就像建了一条高速生产线,却把质检台拆了。
3. 研究也表明:智能体不是越多越好
Google Research在2026年1月比较了180种智能体配置。
在适合并行处理的金融推理任务中,由中央协调者把工作分给多个智能体的结构,比单智能体基线提高约80.9%。
但在需要严格顺序执行的规划任务中,多智能体结构的表现反而下降了39%到70%。
所以,一百个智能体不等于一百倍进度。
有时候只是把会议人数扩大到一百人。
同一研究还发现,彼此独立工作的智能体会让错误最多放大17.2倍;中央协调结构则把这一数值控制在4.4倍。
数量很强。
但负责吸收、合并和验证数量的系统,可能更重要。
4. 真正的瓶颈往往不是生成器,而是验证器
软件特别适合做闭环。
能不能编译?
测试通过了吗?
类型对不对?
输出是否符合预期?
很多判断都可以机器化。
这也是软件开发较早进入智能体规模化的原因之一。
开放式任务就难得多。
什么叫好文章?
什么叫原创研究?
什么叫有说服力的分析?
什么叫值得信任的建议?
如果把负责这些判断的机制叫作验证器,那么AI时代的稀缺资源可能会从生成器转向验证器。
2026年的一项自主研究智能体综述发现,在24个可运行系统中,83%公开了代码,但只有38%公开随机种子或执行轨迹,38%报告过任何新颖性验证方法。按照该综述的编码规则,9个高自主闭环系统中,没有一个展示经过外部验证的环内判定器。
系统会产出。
难的是证明产出值得相信。
5. 一旦质量可测,质量本身也会变成数量战
先生成100个候选。
自动评估100个。
改进前10个。
再从这10个分叉出新的100个。
再次评估。
不断循环。
这样一来,质量也可以用计算量进行搜索。
Google Research在2026年7月介绍的Science One Framework就体现了这个方向。它不仅并行探索研究方案,还建立主张与证据的对应关系,并检查结果分数是否能独立重现、参考文献是否真实存在、论文描述的方法是否与代码一致。
生成闭环之后,开始出现验证闭环。
所以,“如果连质量保证都能拆成自动任务,那质量也会卷进数量战争”这句玩笑,正在变成真正的工程问题。
6. 然后Goodhart问题就来了
先定义一个质量分数。
AI开始优化这个分数。
但这个分数只是人类真实目标的代理变量,不是目标本身。
只优化搜索排名,文章可能越来越像给搜索引擎写的。
只优化点击率,标题可能越来越刺激。
只优化测试通过,智能体可能去钻测试漏洞。
这就是Goodhart法则和规格投机一类问题。
2026年关于语言模型智能体“奖励黑客”的研究也观察到:智能体可以拿到更高的表面奖励,却在隐藏的安全目标上变差;直接优化奖励甚至可能扩大这种差距。
所以不能创造一个验证器,然后把它当成新神谕。
需要多种检查。
需要把现实结果反馈回来。
需要独立审计。
模糊案例仍然让人参与。
还要定期检查:这个分数是否仍然代表最初想要的东西?
一个好的闭环,还需要一个能逃离自己评分系统的紧急出口。
7. 仍然有一些资源不容易被数量化
真正值得寻找的,不一定是“AI永远做不了的神圣工作”,而是即使Token变便宜,复制成本也不会大幅下降的资源。
物理世界
土地、设备、电力、物流、人体、安全流程、现场时间,都不会以Token的速度增长。
权限与责任
合同签署、执照、法律责任、最终批准,需要明确的责任主体,不只是推理能力。
信任
关系由长期行为、承诺、声誉和互惠积累而成。AI可以帮助寻找对象、写消息、维护联系,但无法瞬间复制一段共同经历。
“最后剩下的可能是人脉”可以作为一个有道理的假设,但不是自然定律。
稀缺的不是通讯录。
稀缺的是关系历史。
人类注意力
这可能是最大的瓶颈。
文章能生成十亿篇,人类一天仍然只有24小时。
视频能生成十亿条,人的注意力仍然有限。
供给越接近无限,筛选、信任和注意力就越值钱。
8. 真正的规律是:瓶颈不断向后移动
生成昂贵时,生成能力有价值。
生成变便宜后,验证变昂贵。
验证变便宜后,筛选变昂贵。
筛选也变便宜后,分发和信任变昂贵。
最后会撞上物理资源、责任、真实需求和人类注意力。
因此,强大的AI运营不只是选择最聪明的模型。
拆分工作。
只并行真正能并行的部分。
验证结果。
自动修复失败。
把现实反馈送回下一轮。
把环闭起来。
可以用一个很粗糙的思考模型理解:
有效产出 ≈ 可并行工作量 × 智能体数量 × 验证准确度 ÷ 协调成本、返工成本与人工审核成本
这不是科学公式。
但它很好地解释了为什么只增加智能体数量并不够。
“17岁是不是转生者”很好笑。
更大的变化是,无论年龄,一个人现在都可能搭建出像小型组织一样运行的系统。
下一场竞争不只是模型智商。
而是谁先找到高产的闭环,以及谁能正确验证闭环吐出来的大量结果。
下一个瓶颈已经在后面等着了。
参考资料
- Google Research, “Towards a science of scaling agent systems: When and why agent systems work,” 2026-01-28. https://research.google/blog/towards-a-science-of-scaling-agent-systems-when-and-why-agent-systems-work/
- Ding et al., “Autonomous Research Agents: A Survey of AI Scientists and the Verification Gap,” 2026. https://arxiv.org/abs/2608.05179
- Google Research, “Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence,” 2026-07-30. https://research.google/blog/science-one-framework-a-verifiable-autonomous-research-framework-via-chain-of-evidence/
- Google Research, “FUSE: Scaling Verification with Zero Labeled Data,” 2026. https://research.google/pubs/fuse-scaling-verification-with-zero-labeled-data/
- Çağatan and Zhao, “Reward Hacking in Language Model Agents: Revisiting AI Safety Gridworlds,” 2026. https://arxiv.org/abs/2606.15385
- Karwowski et al., “Goodhart's Law in Reinforcement Learning,” 2023. https://arxiv.org/abs/2310.09144
