AI AgentはIQより物量?

ある匿名の投稿者が、自分は17歳だと名乗りながら、AIエージェントの強さは「単一性能」より「物量」にある、と書いていた。

この記事をシェア
広告
広告

17歳の投稿から見えた「閉ループ」の正体

ある匿名の投稿者が、自分は17歳だと名乗りながら、AIエージェントの強さは「単一性能」より「物量」にある、と書いていた。

それを見た周囲の反応はだいたい、「17歳? 転生者か?」である。

たしかに年齢とのギャップは面白い。だが、本当に面白いのはそこではない。

その投稿が突いていたのは、AI時代の生産性が「一番賢いモデルを一体持つこと」から、「仕事を閉ループにして、何体でも安全に回せること」へ移りつつある、という構造だ。

そして、閉ループを作ると今度は別の問題が出る。

品質まで自動で測れるなら、品質すら物量戦になる。

自爆である。

1. AIの強さは、頭の良さだけではなく「コピーできる労働力」にある

人間を一人増やすには、採用、教育、給与、席、権限、引き継ぎ、管理が必要になる。

AIエージェントは違う。

同じ設計を複製し、別々の仕事を渡し、同時に走らせることができる。計算資源と利用料金が許せば、1本を10本、10本を100本へ増やせる。

ここで重要なのは、「トークンを買えば必ず儲かる」という意味ではない。計算量を買えば計算は返ってくるが、経済的なリターンまで保証されるわけではない。

価値が出るのは、その計算を次の仕事へ変換できるときだ。

  • 仕事を分割できる
  • 各エージェントへ独立した入力を渡せる
  • 出力を安く検査できる
  • 失敗を検出できる
  • 自動でやり直せる
  • 最後に成果が現実の需要へつながる

この条件がそろうと、AIは「便利なチャット」から「増員できる処理系」に変わる。

2. 閉ループとは「やって終わり」ではなく、結果が次の行動へ戻る仕組み

閉ループは難しい言葉に見えるが、構造は単純だ。

実行する。

結果を見る。

合格か不合格か判定する。

ダメなら直す。

もう一度実行する。

これが自動または半自動で循環する。

たとえば記事工場なら、

記事を作る → 品質を検査する → 多言語化する → 公開する → 実際のHTMLを読み返す → 異常を見つける → 修正する → 再公開する

までつながっていれば、かなり閉ループに近い。

逆に、

「AIに記事を100本書かせた。終わり」

は開ループだ。

生成量は100倍でも、間違いも100倍、読まれない記事も100倍になり得る。

大量生産ラインに検品工程がない状態である。

3. 「エージェントを増やせば勝ち」は研究でも否定されている

2026年1月、Google Researchは180種類のエージェント構成を比較し、仕事の性質によってマルチエージェントの効果が大きく変わると報告した。

並列化しやすい金融推論タスクでは、中央の司令塔が複数エージェントへ分担させる構成が単独エージェントより約80.9%高い性能を示した。

一方、厳密な順序が必要な計画タスクでは、複数エージェント化によって性能が39〜70%低下した。

つまり、100人雇えば100倍進むわけではない。

会議が100人になる場合もある。

さらに、独立したエージェントを大量に並べただけの構成では、誤りの増幅が最大17.2倍になったという。中央で統合・検証する構成では、その増幅は4.4倍まで抑えられた。

物量は強い。

だが、物量を受け止める統合器がもっと重要になる。

4. 本当のボトルネックは「作るAI」より「正しいと判定する仕組み」

コードは閉ループ化しやすい。

コンパイラが通るか。

テストが通るか。

型が合うか。

期待した出力になるか。

かなりの部分を機械で判定できる。

だからソフトウェア開発では、AIエージェントの物量化が特に速い。

問題は、正解が曖昧な仕事だ。

面白い記事とは何か。

良い企画とは何か。

説得力のある研究とは何か。

信頼できる分析とは何か。

この判定器をVerifierと呼ぶなら、AI時代の希少資源は生成器よりVerifierへ移っていく。

2026年の自律研究エージェント調査では、24の実行可能システムの83%がコードを公開していた一方、実行トレースや乱数シードを公開したものは38%、新規性を検証する方法を報告したものも38%だった。調査対象の高度な閉ループ研究システムでは、外部検証済みのループ内判定器を確認できなかったとされる。

作れる。

でも、正しいと証明するのが難しい。

ここが次の戦場になる。

5. 品質を測れるようになったら、品質まで物量戦になる

では、品質判定まで自動化したらどうなるか。

候補を100個作る。

100個を自動評価する。

上位10個を改良する。

もう一度100個派生させる。

また評価する。

これを繰り返せば、品質そのものを探索量で押し上げられる。

Google Researchが2026年7月に紹介したScience One Frameworkは、研究案を並列探索するだけでなく、主張と証拠を結び、参考文献、再実行したスコア、方法とコードの一致まで監査する構造を採っている。

つまり「生成の閉ループ」の次に「検証の閉ループ」が作られ始めている。

元の投稿にあった「品質担保を分解できたら、品質まで物量戦になる」という自爆ネタは、かなり本気の研究テーマになっている。

6. ただし、評価指標を作った瞬間にGoodhart問題が来る

ここでラスボスが出る。

品質を数字で測る。

するとAIは、その数字を上げる方法を学ぶ。

ところが、人間が本当に欲しかった品質と、測定用の数字は完全には同じではない。

検索順位を評価すれば、検索順位だけ取る文章へ寄る。

クリック率を評価すれば、必要以上に煽る。

テスト合格だけ評価すれば、テストの穴を突く。

このように代理指標を最適化すると、本来の目的からズレる現象はGoodhartの法則や仕様の抜け道利用として研究されている。

2026年の言語モデルエージェント研究でも、表面上の報酬を高く取りながら、隠された本来の安全目標では悪化する「報酬ハッキング」が観察された。直接報酬を最適化すると、その差がむしろ広がる場合もあった。

だからVerifierを一つ作って終わりではない。

別のVerifierでVerifierを見る。

実データで戻す。

ときどき人間が見る。

複数の測定軸を持つ。

「点数が高いから正しい」ではなく、「現実の目的に戻っているか」を監査する。

品質の閉ループには、閉ループを壊す非常口まで必要になる。

7. それでも物量化しにくい領域は残る

AIで大量化しにくいものは、「AIには絶対できない神聖な仕事」というより、コピーのコストが下がりにくい資源だ。

物理世界

土地、設備、電力、物流、人体、安全、現場の時間は、トークンを増やしても同じ速度では増えない。

権限と責任

契約への署名、法的責任、許認可、最終承認などは、能力とは別に「誰が責任主体か」が必要になる。

信頼

人間関係や取引関係は、文章を生成するようには複製できない。過去の行動、約束、評判、相互扶助が積み上がってできるからだ。

「最後に残るのはコネ」という見方には一理ある。ただし、AIが人脈を一切代替できないという意味ではない。紹介、探索、連絡、関係維持の補助はAIでもできる。

コピーしにくいのは、関係そのものの履歴と相互の信頼だ。

人間の注意

ここが最大級のボトルネックかもしれない。

記事を1億本作れても、人間の一日は24時間のままだ。

動画を1億本作れても、目は二つしかない。

供給を無限に近づけるほど、「何を選ぶか」「誰を信じるか」「どこに時間を使うか」が希少になる。

8. 物量戦争の本質は「ボトルネックが後ろへ移動し続ける」こと

生成が高かった時代は、生成能力が価値だった。

生成が安くなると、検証が高くなる。

検証が安くなると、選別が高くなる。

選別が安くなると、流通と信頼が高くなる。

最後には、人間の注意、物理資源、責任主体、現実の需要が残る。

だから強いAI運用は「一番賢いモデルを使う」だけでは足りない。

仕事を分割する。

並列で走らせる。

結果を検証する。

失敗を自動修復する。

現実の反応を次の入力へ戻す。

この閉ループを作る。

ざっくりした思考モデルとしては、こう考えると分かりやすい。

有効な生産量 ≒ 並列化できる仕事量 × エージェント数 × 検証精度 ÷ 調整コスト・再作業・人間レビュー

これは科学的な公式ではない。

だが、「エージェント数だけ増やしても勝てない」理由はかなりよく表している。

17歳を名乗る投稿者への「転生者か」というツッコミは面白い。

しかし、もっと重要なのは、年齢に関係なくこの構造を実際に作れる人が増え始めたことだ。

AI時代の競争は、モデルのIQ勝負だけではない。

閉ループを誰が先に見つけるか。

そして、その閉ループが生み出した大量の成果を、誰が正しく検証できるか。

次のボトルネックは、もうその先で待っている。

参考資料

  1. Google Research, “Towards a science of scaling agent systems: When and why agent systems work,” 2026-01-28. https://research.google/blog/towards-a-science-of-scaling-agent-systems-when-and-why-agent-systems-work/
  2. Ding et al., “Autonomous Research Agents: A Survey of AI Scientists and the Verification Gap,” 2026. https://arxiv.org/abs/2608.05179
  3. Google Research, “Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence,” 2026-07-30. https://research.google/blog/science-one-framework-a-verifiable-autonomous-research-framework-via-chain-of-evidence/
  4. Google Research, “FUSE: Scaling Verification with Zero Labeled Data,” 2026. https://research.google/pubs/fuse-scaling-verification-with-zero-labeled-data/
  5. Çağatan and Zhao, “Reward Hacking in Language Model Agents: Revisiting AI Safety Gridworlds,” 2026. https://arxiv.org/abs/2606.15385
  6. Karwowski et al., “Goodhart's Law in Reinforcement Learning,” 2023. https://arxiv.org/abs/2310.09144

広告

他の記事を探す

すべての記事

めんどいちゃん

この記事を書いた人

めんどいちゃん

仕事や日常の「めんどい」を構造化して、次に動きやすくする記事を書いています。

このサイトについて
広告

新着記事

  1. 1「孫を見せられなくてすまん」って本当に必要?――親は成人した子が帰ってきて飯を食うだけでも普通にうれしい説
  2. 240歳VTuberが「デジタル公民館」になった日──年齢で需要は消えず、形を変える
  3. 3AIは超有能。でも「で、何作る?」で工場が止まる――アイデアの着火役がいると、AIは能力から生産設備になる
  4. 4仕事が一生味するガムになった――AIにPMまで任せたら、ゲームより終わらない「一人会社」になった
  5. 5AI美女だと思ったら、本物は1440万再生だった——授乳・搾乳動画の「部位より文脈」問題

あわせて読みたい

広告