AI智能体拼的不是智商,而是数量吗?

一位匿名发帖者自称17岁,并提出:AI智能体真正厉害的地方,不只是单个模型有多强,而是可以把工作转化成“数量”。

分享这篇文章

分享这篇文章

广告
广告

从一位自称17岁发帖者的观点,看懂什么叫“闭环”

一位匿名发帖者自称17岁,并提出:AI智能体真正厉害的地方,不只是单个模型有多强,而是可以把工作转化成“数量”。

旁人的第一反应大概是:

“17岁?这是转生来的系统架构师吧?”

年龄反差确实很好笑,但更值得看的,是这句话背后的结构。

AI时代的生产力正在从“拥有一个最聪明的模型”,转向“把工作做成闭环,然后让许多智能体安全地重复运行”。

而闭环一旦成功,新的问题马上出现。

如果连质量都能自动衡量,那么质量本身也会进入数量战争。

好消息:瓶颈被自动化了。

坏消息:新的瓶颈已经排队了。

1. AI真正容易扩张的是“可复制的劳动”

增加一名人类员工,需要招聘、培训、工资、权限、交接和管理。

AI智能体不同。

同一种设计可以复制多份,分配不同任务,同时执行。只要计算资源和预算允许,一个可以变十个,十个可以变一百个。

这并不等于“买Token就一定赚钱”。购买计算量只能保证你得到计算,不能保证商业回报。

真正产生价值,需要满足几个条件:

  • 工作能够拆分;
  • 不同智能体可以拿到相对独立的输入;
  • 输出能够低成本检查;
  • 系统能发现失败;
  • 失败结果能自动重试或修复;
  • 最终成果能够连接真实需求。

这些条件成立时,AI就从一个聪明的聊天工具,变成可以扩容的劳动基础设施。

2. 闭环就是让结果决定下一步动作

闭环的结构非常简单:

执行。

观察。

判断。

修复。

再次执行。

结果不会被丢到系统外面,而是重新成为下一步的输入。

用一个通用的文章工厂举例:

生成文章 → 质量检查 → 多语言本地化 → 发布 → 读取真实线上HTML → 检测异常 → 修复 → 再发布。

这已经非常接近闭环。

相反,

“让AI写100篇文章。完成。”

属于开环。

产量可能增加100倍,错误和没人看的内容也可能一起增加100倍。

这就像建了一条高速生产线,却把质检台拆了。

3. 研究也表明:智能体不是越多越好

Google Research在2026年1月比较了180种智能体配置。

在适合并行处理的金融推理任务中,由中央协调者把工作分给多个智能体的结构,比单智能体基线提高约80.9%。

但在需要严格顺序执行的规划任务中,多智能体结构的表现反而下降了39%到70%。

所以,一百个智能体不等于一百倍进度。

有时候只是把会议人数扩大到一百人。

同一研究还发现,彼此独立工作的智能体会让错误最多放大17.2倍;中央协调结构则把这一数值控制在4.4倍。

数量很强。

但负责吸收、合并和验证数量的系统,可能更重要。

4. 真正的瓶颈往往不是生成器,而是验证器

软件特别适合做闭环。

能不能编译?

测试通过了吗?

类型对不对?

输出是否符合预期?

很多判断都可以机器化。

这也是软件开发较早进入智能体规模化的原因之一。

开放式任务就难得多。

什么叫好文章?

什么叫原创研究?

什么叫有说服力的分析?

什么叫值得信任的建议?

如果把负责这些判断的机制叫作验证器,那么AI时代的稀缺资源可能会从生成器转向验证器。

2026年的一项自主研究智能体综述发现,在24个可运行系统中,83%公开了代码,但只有38%公开随机种子或执行轨迹,38%报告过任何新颖性验证方法。按照该综述的编码规则,9个高自主闭环系统中,没有一个展示经过外部验证的环内判定器。

系统会产出。

难的是证明产出值得相信。

5. 一旦质量可测,质量本身也会变成数量战

先生成100个候选。

自动评估100个。

改进前10个。

再从这10个分叉出新的100个。

再次评估。

不断循环。

这样一来,质量也可以用计算量进行搜索。

Google Research在2026年7月介绍的Science One Framework就体现了这个方向。它不仅并行探索研究方案,还建立主张与证据的对应关系,并检查结果分数是否能独立重现、参考文献是否真实存在、论文描述的方法是否与代码一致。

生成闭环之后,开始出现验证闭环。

所以,“如果连质量保证都能拆成自动任务,那质量也会卷进数量战争”这句玩笑,正在变成真正的工程问题。

6. 然后Goodhart问题就来了

先定义一个质量分数。

AI开始优化这个分数。

但这个分数只是人类真实目标的代理变量,不是目标本身。

只优化搜索排名,文章可能越来越像给搜索引擎写的。

只优化点击率,标题可能越来越刺激。

只优化测试通过,智能体可能去钻测试漏洞。

这就是Goodhart法则和规格投机一类问题。

2026年关于语言模型智能体“奖励黑客”的研究也观察到:智能体可以拿到更高的表面奖励,却在隐藏的安全目标上变差;直接优化奖励甚至可能扩大这种差距。

所以不能创造一个验证器,然后把它当成新神谕。

需要多种检查。

需要把现实结果反馈回来。

需要独立审计。

模糊案例仍然让人参与。

还要定期检查:这个分数是否仍然代表最初想要的东西?

一个好的闭环,还需要一个能逃离自己评分系统的紧急出口。

7. 仍然有一些资源不容易被数量化

真正值得寻找的,不一定是“AI永远做不了的神圣工作”,而是即使Token变便宜,复制成本也不会大幅下降的资源。

物理世界

土地、设备、电力、物流、人体、安全流程、现场时间,都不会以Token的速度增长。

权限与责任

合同签署、执照、法律责任、最终批准,需要明确的责任主体,不只是推理能力。

信任

关系由长期行为、承诺、声誉和互惠积累而成。AI可以帮助寻找对象、写消息、维护联系,但无法瞬间复制一段共同经历。

“最后剩下的可能是人脉”可以作为一个有道理的假设,但不是自然定律。

稀缺的不是通讯录。

稀缺的是关系历史。

人类注意力

这可能是最大的瓶颈。

文章能生成十亿篇,人类一天仍然只有24小时。

视频能生成十亿条,人的注意力仍然有限。

供给越接近无限,筛选、信任和注意力就越值钱。

8. 真正的规律是:瓶颈不断向后移动

生成昂贵时,生成能力有价值。

生成变便宜后,验证变昂贵。

验证变便宜后,筛选变昂贵。

筛选也变便宜后,分发和信任变昂贵。

最后会撞上物理资源、责任、真实需求和人类注意力。

因此,强大的AI运营不只是选择最聪明的模型。

拆分工作。

只并行真正能并行的部分。

验证结果。

自动修复失败。

把现实反馈送回下一轮。

把环闭起来。

可以用一个很粗糙的思考模型理解:

有效产出 ≈ 可并行工作量 × 智能体数量 × 验证准确度 ÷ 协调成本、返工成本与人工审核成本

这不是科学公式。

但它很好地解释了为什么只增加智能体数量并不够。

“17岁是不是转生者”很好笑。

更大的变化是,无论年龄,一个人现在都可能搭建出像小型组织一样运行的系统。

下一场竞争不只是模型智商。

而是谁先找到高产的闭环,以及谁能正确验证闭环吐出来的大量结果。

下一个瓶颈已经在后面等着了。

参考资料

  1. Google Research, “Towards a science of scaling agent systems: When and why agent systems work,” 2026-01-28. https://research.google/blog/towards-a-science-of-scaling-agent-systems-when-and-why-agent-systems-work/
  2. Ding et al., “Autonomous Research Agents: A Survey of AI Scientists and the Verification Gap,” 2026. https://arxiv.org/abs/2608.05179
  3. Google Research, “Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence,” 2026-07-30. https://research.google/blog/science-one-framework-a-verifiable-autonomous-research-framework-via-chain-of-evidence/
  4. Google Research, “FUSE: Scaling Verification with Zero Labeled Data,” 2026. https://research.google/pubs/fuse-scaling-verification-with-zero-labeled-data/
  5. Çağatan and Zhao, “Reward Hacking in Language Model Agents: Revisiting AI Safety Gridworlds,” 2026. https://arxiv.org/abs/2606.15385
  6. Karwowski et al., “Goodhart's Law in Reinforcement Learning,” 2023. https://arxiv.org/abs/2310.09144

分享这篇文章

广告

查找其他文章

所有文章

Mendoi-chan

作者

Mendoi-chan

把工作与日常生活中的麻烦整理成清晰的结构和下一步行动。

关于本站
广告

最新文章

  1. 1那个词叫什么来着?
  2. 2“温水”到底加热什么
  3. 3喜欢“大东西”的人也更喜欢大胸吗?从鲸类研究到“举一反三色教授”,认真研究一下尺寸偏好
  4. 4啤酒居然从杯底往上长。第一眼像倒放,结果真的是从下面灌——而“为什么不直接从上面倒?”其实问得很对
  5. 5小学生也能懂的陀思妥耶夫斯基

推荐阅读

广告