AI 에이전트의 핵심은 IQ보다 물량일까?

익명의 한 게시자는 자신을 17세라고 소개하면서, AI 에이전트의 진짜 힘은 단일 모델의 성능보다 ‘물량’에 있다고 썼다.

이 글 공유하기

이 글 공유하기

광고
광고

자신을 17세라고 소개한 한 게시물이 보여 준 ‘폐쇄 루프’의 정체

익명의 한 게시자는 자신을 17세라고 소개하면서, AI 에이전트의 진짜 힘은 단일 모델의 성능보다 ‘물량’에 있다고 썼다.

주변 반응은 대략 이랬다.

“17세라고? 전생에 시스템 설계자였나?”

나이와 글의 시야 사이의 간격은 분명 재미있다. 하지만 더 중요한 것은 그 글이 짚은 구조다.

AI 시대의 생산성은 “가장 똑똑한 모델 하나를 갖는 것”에서 “일을 폐쇄 루프로 만들어 여러 에이전트가 안전하게 반복 실행하도록 하는 것”으로 이동하고 있다.

그리고 그다음 문제가 바로 온다.

품질까지 자동으로 측정할 수 있다면, 품질마저 물량 경쟁이 된다.

병목을 자동화했더니 다음 병목이 생겼다.

1. AI의 확장성은 ‘복제 가능한 노동력’에 있다

사람 한 명을 늘리려면 채용, 교육, 급여, 권한, 인수인계, 관리가 필요하다.

AI 에이전트는 같은 설계를 복제해 서로 다른 작업을 동시에 맡길 수 있다. 계산 자원과 예산이 허용되면 하나를 열 개로, 열 개를 백 개로 늘릴 수 있다.

그렇다고 “토큰을 사면 반드시 돈을 번다”는 뜻은 아니다. 계산량을 사면 계산은 돌아오지만, 경제적 수익은 보장되지 않는다.

가치가 생기는 조건은 따로 있다.

  • 일을 나눌 수 있다.
  • 각 에이전트에 충분히 독립적인 입력을 줄 수 있다.
  • 결과를 싸게 검사할 수 있다.
  • 실패를 감지할 수 있다.
  • 잘못된 결과를 자동으로 다시 실행하거나 고칠 수 있다.
  • 최종 결과가 실제 수요와 연결된다.

이 조건이 갖춰지면 AI는 똑똑한 대화 도구에서 확장 가능한 처리 인프라로 바뀐다.

2. 폐쇄 루프란 결과가 다음 행동으로 되돌아가는 구조다

구조는 단순하다.

실행한다.

관찰한다.

합격인지 실패인지 판단한다.

고친다.

다시 실행한다.

결과가 시스템 밖으로 버려지지 않고 다음 행동의 입력으로 돌아간다.

예를 들어 일반적인 기사 생산 시스템을 생각해 보자.

기사 생성 → 품질 검사 → 다국어 현지화 → 공개 → 실제 운영 HTML 확인 → 이상 탐지 → 수정 → 재공개.

이 정도로 이어지면 상당히 폐쇄 루프에 가깝다.

반대로,

“AI로 기사 100개 만들었다. 끝.”

은 개방 루프다.

생산량이 100배가 된 대신 오류와 아무도 읽지 않는 글도 100배가 될 수 있다.

검품대 없는 대량생산 라인이다.

3. 에이전트를 늘린다고 자동으로 좋아지는 것은 아니다

Google Research는 2026년 1월 180개의 에이전트 구성을 통제 비교했다.

병렬화하기 쉬운 금융 추론 과제에서는 중앙 조정자가 여러 에이전트에 일을 나누는 방식이 단일 에이전트보다 약 80.9% 높은 성능을 보였다.

반면 순서를 엄격히 지켜야 하는 계획 과제에서는 모든 다중 에이전트 방식이 39~70% 낮은 성능을 보였다.

에이전트 100개가 곧 진행 속도 100배를 뜻하지 않는다.

회의 참석자가 100명으로 늘어날 수도 있다.

같은 연구에서는 독립적으로 움직이는 에이전트들이 오류를 최대 17.2배까지 증폭한 반면, 중앙 조정 구조에서는 그 수치가 4.4배로 낮아졌다.

물량은 강하다.

하지만 그 물량을 통합하고 검증하는 구조가 더 중요할 수 있다.

4. 진짜 병목은 생성기보다 검증기다

소프트웨어는 폐쇄 루프에 유리하다.

컴파일이 되는가.

테스트가 통과하는가.

타입이 맞는가.

예상 출력과 같은가.

상당 부분을 기계가 판정할 수 있다.

그래서 소프트웨어 개발이 에이전트 확장의 최전선이 되기 쉽다.

문제는 정답이 흐린 일이다.

좋은 기사란 무엇인가.

독창적인 연구란 무엇인가.

설득력 있는 분석이란 무엇인가.

믿을 만한 추천이란 무엇인가.

이 판단 장치를 검증기라고 부른다면, AI 시대의 희소 자원은 생성기에서 검증기로 이동한다.

2026년 자율 연구 에이전트 조사에서는 실행 가능한 24개 시스템 가운데 83%가 코드를 공개했지만, 실행 추적이나 난수 시드를 공개한 시스템은 38%, 신규성 검증 방법을 보고한 시스템도 38%였다. 조사 기준상 고자율 폐쇄 루프 시스템 9개 가운데 외부 검증된 루프 내 판정기를 보여 준 사례는 없었다.

만드는 것은 가능하다.

믿어도 된다는 것을 증명하는 것이 어렵다.

5. 품질을 측정할 수 있다면 품질도 물량전이 된다

후보를 100개 만든다.

100개를 자동 평가한다.

상위 10개를 개선한다.

각각에서 다시 후보를 만든다.

또 평가한다.

반복한다.

이제 품질도 계산량으로 탐색할 수 있다.

Google Research가 2026년 7월 소개한 Science One Framework는 병렬 탐색뿐 아니라 주장과 증거를 연결하고, 보고된 점수가 재현되는지, 참고문헌이 실제로 존재하는지, 논문의 설명과 코드가 일치하는지를 감사한다.

생성 루프 다음에는 검증 루프가 온다.

“품질 보증까지 분해할 수 있으면 품질마저 물량전에 들어간다”는 농담이 실제 설계 문제가 되는 이유다.

6. 그러면 Goodhart 문제가 찾아온다

품질 점수를 만든다.

AI는 그 점수를 올리는 법을 배운다.

하지만 점수는 인간이 원하는 진짜 목적의 대리 지표일 뿐이다.

검색 순위만 최적화하면 검색엔진에 맞춘 글이 된다.

클릭률만 최적화하면 제목이 과격해진다.

테스트 통과만 최적화하면 테스트의 빈틈을 이용할 수 있다.

이런 문제는 Goodhart의 법칙과 사양 악용 문제로 연구된다.

2026년 언어 모델 에이전트의 보상 해킹 연구에서도, 표면 보상은 높이면서 숨겨진 안전 목표에서는 더 나빠지는 행동이 관찰됐다. 직접적인 보상 최적화가 그 차이를 더 벌리기도 했다.

따라서 검증기 하나를 절대 기준으로 만들면 안 된다.

여러 검사를 사용하고, 실제 결과를 다시 넣고, 독립 감사를 두고, 애매한 사례는 사람이 보고, 지표가 여전히 목적을 대표하는지 주기적으로 확인해야 한다.

좋은 폐쇄 루프에는 자기 점수 체계에서 빠져나오는 비상구도 필요하다.

7. 그래도 쉽게 물량화되지 않는 자원은 남는다

AI가 절대 할 수 없는 신성한 직업을 찾는 것보다, 토큰 가격이 내려가도 복제 비용이 크게 줄지 않는 자원을 찾는 편이 유용하다.

물리 세계

토지, 설비, 전력, 물류, 사람의 몸, 안전 절차, 현장 시간은 토큰처럼 늘어나지 않는다.

권한과 책임

계약 서명, 면허, 법적 책임, 최종 승인에는 능력과 별개로 책임 주체가 필요하다.

신뢰

관계는 과거의 행동, 약속, 평판, 상호 도움의 축적으로 만들어진다. AI는 사람을 찾고 연락을 돕고 관계 관리를 보조할 수 있지만, 신뢰의 공동 이력을 즉시 복제할 수는 없다.

“마지막에 남는 것은 인맥”이라는 생각은 가설로서는 일리가 있다.

희소한 것은 연락처 목록이 아니라 관계의 역사다.

인간의 주의

어쩌면 가장 큰 병목이다.

기사를 10억 개 만들어도 사람의 하루는 24시간이다.

영상을 10억 개 만들어도 한 사람의 주의력은 늘어나지 않는다.

공급이 넘칠수록 선택, 신뢰, 주의가 비싸진다.

8. 핵심은 병목이 계속 뒤로 이동한다는 것이다

생성이 비쌀 때는 생성이 가치다.

생성이 싸지면 검증이 비싸진다.

검증이 싸지면 선별이 비싸진다.

선별이 싸지면 유통과 신뢰가 비싸진다.

마지막에는 물리 자원, 책임, 실제 수요, 인간의 주의가 남는다.

그러므로 강한 AI 운영은 가장 똑똑한 모델을 고르는 것만으로 끝나지 않는다.

일을 나눈다.

실제로 병렬화 가능한 부분만 병렬화한다.

결과를 검증한다.

실패를 자동 수정한다.

현실의 반응을 다음 실행으로 되돌린다.

루프를 만든다.

대략적인 사고 모델은 이렇다.

유효 생산량 ≒ 병렬화 가능한 작업량 × 에이전트 수 × 검증 정확도 ÷ 조정 비용·재작업·사람 검토

과학 공식은 아니다.

하지만 왜 에이전트 수만 늘려서는 충분하지 않은지 잘 보여 준다.

“17세인데 전생자 아니냐”는 농담은 재미있다.

더 큰 변화는 나이와 관계없이 작은 조직처럼 움직이는 시스템을 개인이 만들 수 있게 됐다는 점이다.

다음 경쟁은 모델의 IQ만이 아니다.

누가 먼저 생산적인 폐쇄 루프를 찾는가.

그리고 거기서 쏟아지는 결과를 누가 제대로 검증하는가.

다음 병목은 이미 그 뒤에서 기다리고 있다.

  1. Google Research, “Towards a science of scaling agent systems: When and why agent systems work,” 2026-01-28. https://research.google/blog/towards-a-science-of-scaling-agent-systems-when-and-why-agent-systems-work/
  2. Ding et al., “Autonomous Research Agents: A Survey of AI Scientists and the Verification Gap,” 2026. https://arxiv.org/abs/2608.05179
  3. Google Research, “Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence,” 2026-07-30. https://research.google/blog/science-one-framework-a-verifiable-autonomous-research-framework-via-chain-of-evidence/
  4. Google Research, “FUSE: Scaling Verification with Zero Labeled Data,” 2026. https://research.google/pubs/fuse-scaling-verification-with-zero-labeled-data/
  5. Çağatan and Zhao, “Reward Hacking in Language Model Agents: Revisiting AI Safety Gridworlds,” 2026. https://arxiv.org/abs/2606.15385
  6. Karwowski et al., “Goodhart's Law in Reinforcement Learning,” 2023. https://arxiv.org/abs/2310.09144

이 글 공유하기

광고

다른 글 찾기

모든 기사

Mendoi-chan

이 글을 쓴 사람

Mendoi-chan

직장과 일상의 불편함을 구조화해 이해하기 쉬운 다음 행동으로 연결하는 글을 씁니다.

사이트 소개
광고

새 글

  1. 12,000엔으로 현실 세계를 API화하다
  2. 2그 단어가 뭐였지?
  3. 3‘온수’는 무엇을 데우나
  4. 4“큰 것이 좋다”면 큰 가슴도 좋아할까? 고래 연구에서 ‘응용 음흉 교수’까지, 크기 취향을 진짜 연구해 보기
  5. 5맥주가 컵 바닥에서 솟아오른다. 역재생인 줄 알았는데 진짜 아래에서 따른다 — 그리고 “그냥 위에서 따르면 안 돼?”가 꽤 정답이었다

함께 읽으면 좋은 글

광고