Was ein Beitrag einer Person, die sich als 17 Jahre alt bezeichnet, über geschlossene Kreisläufe zeigt
Eine anonyme Person, die sich selbst als 17 Jahre alt bezeichnet, schrieb, dass die eigentliche Stärke von KI-Agenten nicht nur in der Leistung eines einzelnen Modells liege, sondern darin, Arbeit in skalierbare Menge zu verwandeln.
Die Reaktion anderer lautete ungefähr:
„Siebzehn? Bist du als Systemarchitekt wiedergeboren worden?“
Der Alterskontrast ist lustig, aber nicht der wichtigste Punkt.
Entscheidend ist die Struktur der Idee. KI-Produktivität verschiebt sich von „das intelligenteste einzelne Modell besitzen“ zu „Arbeit in einen geschlossenen Kreislauf verwandeln, den viele Agenten sicher ausführen können“.
Und sobald dieser Kreislauf funktioniert, taucht das nächste Problem auf.
Wenn sich auch Qualität automatisiert messen lässt, wird selbst Qualität Teil des Mengenwettbewerbs.
Wir automatisieren einen Engpass.
Und erzeugen den nächsten.
1. Der eigentliche Skalierungsvorteil ist kopierbare Arbeit
Eine zusätzliche menschliche Arbeitskraft erfordert Recruiting, Einarbeitung, Gehalt, Berechtigungen, Kontextübergabe und Management.
Ein KI-Agent lässt sich viel leichter vervielfältigen. Kopien können unterschiedliche Aufgaben erhalten und gleichzeitig arbeiten. Wenn Budget und Rechenleistung reichen, kann aus einem Agenten zehn werden und aus zehn hundert.
Das bedeutet nicht: „Wer Tokens kauft, macht sicher Gewinn.“ Gekaufte Rechenleistung garantiert Rechenleistung, keinen wirtschaftlichen Ertrag.
Wert entsteht, wenn die Rechenleistung in einen brauchbaren Prozess eingebettet ist:
- die Arbeit lässt sich zerlegen;
- Agenten erhalten ausreichend unabhängige Eingaben;
- Ergebnisse lassen sich günstig prüfen;
- Fehler werden erkannt;
- schlechte Ergebnisse können erneut ausgeführt oder repariert werden;
- und das Endprodukt trifft auf reale Nachfrage.
Unter diesen Bedingungen wird KI von einem schlauen Chatwerkzeug zu skalierbarer Arbeitsinfrastruktur.
2. Ein geschlossener Kreislauf lässt das Ergebnis die nächste Aktion bestimmen
Die Struktur ist einfach:
ausführen;
beobachten;
bewerten;
reparieren;
erneut ausführen.
Das Ergebnis wird wieder zum Eingang der nächsten Runde.
Nehmen wir eine allgemeine Artikelfabrik:
Artikel erzeugen → Qualität prüfen → in mehrere Sprachen lokalisieren → veröffentlichen → echtes Produktions-HTML lesen → Fehler erkennen → reparieren → erneut veröffentlichen.
Das ist bereits nahe an einem geschlossenen Kreislauf.
Dagegen ist:
„Lass die KI hundert Artikel schreiben. Fertig.“
ein offener Kreislauf.
Die Menge kann sich verhundertfachen. Fehler und ungelesene Texte können sich ebenfalls verhundertfachen.
Das ist eine schnelle Produktionslinie ohne Qualitätskontrolle.
3. Forschung zeigt: Mehr Agenten sind nicht automatisch besser
Google Research verglich im Januar 2026 180 Agentenkonfigurationen.
Bei einer gut parallelisierbaren Finanzaufgabe steigerte eine zentralisierte Architektur, die Arbeit auf mehrere Agenten verteilte, die Leistung gegenüber einem Einzelagenten um rund 80,9 Prozent.
Bei einer Planungsaufgabe, die eine strenge Reihenfolge erforderte, verschlechterten sich dagegen alle Multi-Agenten-Varianten um 39 bis 70 Prozent.
Hundert Agenten bedeuten also nicht hundertmal mehr Fortschritt.
Manchmal bedeuten sie nur eine Besprechung mit hundert Teilnehmern.
Dieselbe Studie berichtete, dass vollständig unabhängige Agenten Fehler bis um den Faktor 17,2 verstärken konnten, während zentrale Koordination diese Verstärkung auf 4,4 begrenzte.
Menge ist mächtig.
Das System, das diese Menge zusammenführt und prüft, kann noch wichtiger sein.
4. Der eigentliche Engpass ist oft der Verifizierer
Software eignet sich besonders gut für geschlossene Kreisläufe.
Kompiliert der Code?
Bestehen die Tests?
Stimmen die Typen?
Entspricht die Ausgabe dem Erwartungswert?
Viele Antworten lassen sich mechanisch prüfen.
Deshalb gehört Softwareentwicklung zu den ersten Bereichen, in denen Agentenskalierung sichtbar wird.
Offene Aufgaben sind schwieriger.
Was ist ein guter Artikel?
Was ist originelle Forschung?
Was ist eine überzeugende Analyse?
Was ist eine vertrauenswürdige Empfehlung?
Wenn wir den Mechanismus, der solche Fragen beantwortet, Verifizierer nennen, kann sich eine wichtige knappe Ressource des Agentenzeitalters von Generatoren zu Verifizierern verschieben.
Eine Untersuchung autonomer Forschungsagenten aus dem Jahr 2026 fand unter 24 ausführbaren Systemen 83 Prozent mit veröffentlichtem Code, aber nur 38 Prozent mit Seeds oder Ausführungsspuren und 38 Prozent mit irgendeiner Methode zur Neuheitsprüfung. Nach den Kodierregeln der Studie zeigte keines der neun hochautonomen geschlossenen Systeme einen extern validierten Prüfer innerhalb der Schleife.
Erzeugen ist möglich.
Zu beweisen, dass das Ergebnis vertrauenswürdig ist, ist schwieriger.
5. Sobald Qualität messbar wird, wird auch Qualität zum Mengenwettbewerb
Hundert Kandidaten erzeugen.
Alle automatisch bewerten.
Die zehn besten verbessern.
Daraus weitere hundert Varianten bilden.
Wieder bewerten.
Wiederholen.
Qualität lässt sich nun mit Rechenleistung durchsuchen.
Das von Google Research im Juli 2026 vorgestellte Science One Framework weist in diese Richtung. Es erkundet nicht nur Lösungen parallel, sondern verbindet Behauptungen mit Belegen und prüft, ob Ergebnisse reproduzierbar sind, Quellen tatsächlich existieren und die beschriebene Methode zum ausgeführten Code passt.
Nach der Generierungsschleife entsteht die Verifizierungsschleife.
Der Witz „wenn sich Qualitätssicherung zerlegen lässt, gerät auch Qualität in den Mengenkrieg“ wird damit zu einem echten Ingenieursproblem.
6. Dann kommt Goodhart
Wir definieren einen Qualitätswert.
Der Agent lernt, ihn zu maximieren.
Doch dieser Wert ist nur ein unvollkommener Ersatz für das eigentliche menschliche Ziel.
Wer nur Suchrankings optimiert, erhält möglicherweise Texte für Suchmaschinen.
Wer nur Klicks optimiert, erhält immer aggressivere Überschriften.
Wer nur Testbestehen optimiert, kann Agenten dazu bringen, Lücken in den Tests auszunutzen.
Das ist das Gebiet von Goodharts Gesetz und dem Ausnutzen unvollständiger Spezifikationen.
Eine Studie von 2026 zu Reward Hacking bei Sprachmodell-Agenten beobachtete hohe sichtbare Belohnungen bei gleichzeitig schlechterer Leistung auf verborgenen Sicherheitszielen. Direkte Belohnungsoptimierung konnte diese Lücke sogar vergrößern.
Ein Verifizierer darf also nicht zur neuen göttlichen Metrik werden.
Mehrere Prüfungen verwenden.
Reale Ergebnisse zurück in den Prozess geben.
Unabhängige Audits erhalten.
Unklare Fälle von Menschen prüfen lassen.
Und regelmäßig fragen, ob die Kennzahl noch das ursprüngliche Ziel abbildet.
Ein guter geschlossener Kreislauf braucht auch einen Notausgang aus dem eigenen Bewertungssystem.
7. Manche Ressourcen lassen sich weiterhin nur schwer durch Agentenkopien skalieren
Die interessante Grenze sind nicht „heilige Berufe, die KI niemals ausüben kann“. Es sind Ressourcen, deren Replikationskosten nicht zusammenbrechen, nur weil Tokens billiger werden.
Physische Welt
Land, Maschinen, Strom, Logistik, Körper, Sicherheit und Zeit vor Ort wachsen nicht im Tempo von Rechenleistung.
Autorität und Verantwortung
Unterschriften, Lizenzen, rechtliche Haftung und endgültige Freigaben brauchen einen verantwortlichen Akteur, nicht nur Denkfähigkeit.
Vertrauen
Beziehungen entstehen aus wiederholtem Verhalten, Zusagen, Ruf und Gegenseitigkeit. KI kann Menschen finden, Nachrichten formulieren und Kontakte pflegen, aber sie kann keine gemeinsame Vertrauensgeschichte sofort herstellen.
Die Idee, dass „am Ende Kontakte übrig bleiben“, ist als Hypothese plausibel, aber kein Naturgesetz.
Knapp ist nicht die Kontaktliste.
Knapp ist die Beziehungsgeschichte.
Menschliche Aufmerksamkeit
Sie könnte der größte Engpass sein.
Wir können eine Milliarde Artikel erzeugen.
Ein menschlicher Tag hat weiterhin 24 Stunden.
Wir können eine Milliarde Videos erzeugen.
Aufmerksamkeit bleibt begrenzt.
Je reichlicher das Angebot, desto wertvoller werden Auswahl, Vertrauen und Aufmerksamkeit.
8. Das zentrale Muster: Der Engpass wandert immer weiter nach hinten
Wenn Erzeugung teuer ist, ist Erzeugung wertvoll.
Wenn Erzeugung billig wird, wird Verifizierung teuer.
Wenn Verifizierung billig wird, wird Auswahl teuer.
Wenn Auswahl billig wird, werden Distribution und Vertrauen knapp.
Am Ende stoßen wir auf physische Ressourcen, Verantwortung, reale Nachfrage und menschliche Aufmerksamkeit.
Starke Agentenoperationen bestehen deshalb nicht nur darin, das intelligenteste Modell zu wählen.
Arbeit zerlegen.
Nur das parallelisieren, was wirklich parallelisierbar ist.
Ergebnisse prüfen.
Fehler automatisch reparieren.
Reaktionen aus der realen Welt in den nächsten Lauf zurückführen.
Den Kreislauf schließen.
Als grobes Denkmodell:
nutzbare Produktion ≈ parallelisierbare Arbeit × Anzahl der Agenten × Verifizierungsgenauigkeit ÷ Koordinations-, Nacharbeits- und menschliche Prüfkosten
Das ist keine wissenschaftliche Formel.
Sie erinnert aber gut daran, warum die Zahl der Agenten allein nicht reicht.
Der Witz vom „wiedergeborenen 17-Jährigen“ ist unterhaltsam.
Die tiefere Veränderung ist, dass eine einzelne Person unabhängig vom Alter heute Systeme bauen kann, die sich wie kleine Organisationen verhalten.
Der nächste Wettbewerb dreht sich nicht nur um den IQ des Modells.
Er dreht sich darum, wer zuerst produktive geschlossene Kreisläufe findet und wer den daraus entstehenden Ergebnisstrom zuverlässig prüfen kann.
Der nächste Engpass wartet bereits.
Quellen
- Google Research, “Towards a science of scaling agent systems: When and why agent systems work,” 2026-01-28. https://research.google/blog/towards-a-science-of-scaling-agent-systems-when-and-why-agent-systems-work/
- Ding et al., “Autonomous Research Agents: A Survey of AI Scientists and the Verification Gap,” 2026. https://arxiv.org/abs/2608.05179
- Google Research, “Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence,” 2026-07-30. https://research.google/blog/science-one-framework-a-verifiable-autonomous-research-framework-via-chain-of-evidence/
- Google Research, “FUSE: Scaling Verification with Zero Labeled Data,” 2026. https://research.google/pubs/fuse-scaling-verification-with-zero-labeled-data/
- Çağatan and Zhao, “Reward Hacking in Language Model Agents: Revisiting AI Safety Gridworlds,” 2026. https://arxiv.org/abs/2606.15385
- Karwowski et al., “Goodhart's Law in Reinforcement Learning,” 2023. https://arxiv.org/abs/2310.09144
