Ich gebe KI kaum detaillierte Anweisungen. Ich sage nur „Ich will gewinnen“ und „Ich will weniger Arbeit“ – und am Ende wurde sogar die Kontrolle automatisiert

Als ich mir neulich angesehen habe, wie ich KI eigentlich benutze, ist mir etwas ziemlich Lustiges aufgefallen.

Kurzfassung

Als ich mir neulich angesehen habe, wie ich KI eigentlich benutze, ist mir etwas ziemlich Lustiges aufgefallen.

Ich beschreibe fast nie jeden Arbeitsschritt im Detail.

Meine Anweisungen sind eher: „Ich will gewinnen“, „reduziere meine Arbeit“, „hör nicht mittendrin auf“, „prüf, ob es wirklich fertig ist“.

Sehr grob. Wirklich sehr grob.

Wenn ein System solche groben Ziele aber ernsthaft erfüllen soll, muss die KI die Bedingungen selbst zerlegen, definieren, was „fertig“ bedeutet, Prüfverfahren entwerfen und an bereits gescheiterten Stellen Schutzregeln ergänzen.

Dadurch hat sich der Ablauf langsam von „ein Mensch prüft jedes Mal alles“ zu folgendem Modell verschoben: KI erzeugt, KI prüft, externe Belege werden abgeglichen und der Mensch bekommt nur noch Abweichungen gemeldet.

Bei der Recherche dazu habe ich festgestellt, dass das ziemlich nah an dem liegt, was OpenAI 2026 als „Harness Engineering“ veröffentlicht hat.

Der Mensch bestimmt Absicht und Grenzen. KI-Agenten führen aus.

Für persönliche Projekte ist das extrem stark. In einem Unternehmen wird es plötzlich deutlich schwieriger.

Ein persönliches Projekt ist eine Diktatur ohne Politik.

Im Unternehmen eröffnet dagegen das Parlament die Sitzung.


Der Ausgangspunkt besteht nur aus zwei Zielen: mehr gewinnen und weniger arbeiten

Die übergeordneten Ziele sind erstaunlich simpel.

Bei einem Kartenspiel: Ich will gewinnen.

Bei Artikeln oder Automatisierung: Ich will meine eigene Arbeit reduzieren.

Diese beiden Ziele sind stark, gerade weil sie einfach bleiben, auch wenn die Technik darunter immer komplizierter wird.

Ich kann einen Simulator bauen, Tausende Partien laufen lassen und Suchalgorithmen einbauen.

Am Ende bleibt die Frage: „Ist die Gewinnquote dadurch gestiegen?“

Ich kann Artikel automatisieren, mehrere Sprachen, Qualitätssicherung, Warteschlangen, Prüfsummen und Wiederholungsversuche hinzufügen.

Am Ende bleibt die Frage: „Habe ich dadurch weniger Arbeit?“

Die Implementierung darf komplex werden, ohne dass das Ziel ebenfalls komplex werden muss.

Und weil das Ziel stabil bleibt, kann ich der KI bei den konkreten Mitteln viel Freiheit geben.


Ich schreibe nicht jeden Schritt vor. Wenn nötig, lasse ich die KI sogar den Soll-Zustand ableiten

Ein Mensch muss nicht jedes Mal alle Abschlusskriterien von null an selbst entwerfen.

Man kann mit einem Ziel beginnen wie:

„Bring den neuesten Artikel korrekt und ohne menschlichen Eingriff bis zur tatsächlichen Veröffentlichung.“

Von dort aus kann die KI selbst Fragen ableiten:

  • was genau „neuester“ bedeutet
  • was „korrekt“ bedeutet
  • ob eine Übersetzung noch zur aktuellen Ausgangsversion gehört
  • ob ein Auftrag mit 50 Elementen nach nur einem erfolgreichen Element als erledigt gelten darf
  • ob ein Hochladen nach GitHub bereits „veröffentlicht“ bedeutet
  • ob auch die tatsächlich ausgelieferte Website geprüft werden muss

Der Mensch hält also vor allem Ziel und unverletzbare Bedingungen fest. Feinere Akzeptanzkriterien kann die KI daraus entwickeln.

Natürlich kann die KI auch diese Kriterien falsch entwerfen.

Deshalb folgt als nächster Block die Verifikation.


Ich nutze sehr viel KI, aber „die KI sagt, sie ist fertig“ ist kein Beweis

Von außen kann es so aussehen, als würde ich einfach alles an KI delegieren.

Und teilweise stimmt das auch: Die Ausführung geht an die KI, die Kontrolle ebenfalls.

Idealerweise möchte ich nicht einmal die Protokolle lesen.

Der perfekte Ablauf wäre:

ausführen → automatisch prüfen → wenn alles normal ist, kurz berichten → bei Problemen nur Ursache und Lösungsvorschlag zurückbringen.

Entscheidend ist, die Selbstaussage der KI nicht zum Abschlusskriterium zu machen.

„Fertig“ reicht nicht. Man braucht von außen beobachtbare Dinge: verarbeitete Stückzahl, Testergebnisse, Prüfsummen, die echte Datei auf GitHub, die echte URL oder das HTML, das in der Produktionsumgebung tatsächlich ausgeliefert wird.

Wenn man demselben Modell im selben Kontext einfach sagt „prüf deine eigene Arbeit“, kann es denselben Denkfehler zweimal hintereinander bestätigen.

Eine robustere Struktur trennt deshalb Erzeugung, Prüfung und externe Belege.

Der Mensch muss nicht alles selbst lesen.

Aber er sollte auch kein bloßes „geprüft“ akzeptieren.

In der groben Version:

„Ich schaue es mir nicht an. Du prüfst es. Aber bring Belege mit.“


Jeder Stolperpunkt ist eine Stelle, an der noch menschliche Arbeit übrig ist

Wenn das echte Ziel lautet, Arbeit zu reduzieren, werden plötzlich all die kleinen manuellen Schritte störend, die vorher noch akzeptabel wirkten.

Hier muss jedes Mal jemand klicken.

Diese Ausnahme kann nur ein Mensch entscheiden.

Wenn etwas scheitert, muss jemand die Protokolle öffnen.

Nach der Veröffentlichung muss jemand manuell kontrollieren.

Die normale Reaktion lautet: „Ach, dieser kleine Teil bleibt eben manuell.“

Wenn das Ziel aber weniger Arbeit ist, bedeutet das schlicht: Das Design ist noch nicht fertig.

Wenn ein Prozess nur funktioniert, weil ein Mensch an einer bestimmten Stelle zusätzlichen Aufwand leisten muss, ist diese Stelle noch Design-Schuld.

Mit dieser Sichtweise ist ein Fehler nicht mehr nur ein Vorfall.

Wenn ein Auftrag 50 Elemente verarbeiten sollte, aber nach einem Element Erfolg meldet, reicht es nicht, die restlichen 49 nachzuschieben.

Die eigentliche Frage lautet: „Warum war es überhaupt möglich, nach einem Element Erfolg zu melden?“

Wenn eine alte Übersetzung als aktuelle Version durchgeht, reicht es nicht, nur diese Übersetzung zu korrigieren.

Das System muss so geändert werden, dass eine veraltete Übersetzung künftig nicht mehr als gültig durchkommen kann.

Jeder Fehler, der zu einer neuen Regel wird, entfernt ein kleines Stück menschlicher Arbeit aus der Zukunft.


Ein Chef, der sagt „Ich verstehe das nicht“, ist noch reparierbar. Gefährlich ist eine Prüfung, die die Realität umschreibt

Im August 2026 erschien auf Zenn ein Artikel über ein Team, dessen Produktivität durch KI auf das Dreifache stieg und das dabei gleichzeitig einen Teil des Teams zurückließ.

Eine besonders typische Szene ist die Reaktion eines Vorgesetzten, sinngemäß: „Ich verstehe es noch nicht vollständig, aber ich glaube, dass das, was Sie sagen, richtig ist.“

Als fachliche Prüfung ist das schwach.

Aber im Management gibt es einen deutlich gefährlicheren Zustand.

Etwas nicht verstehen und anschließend Fakten oder Kriterien nachträglich ändern, um die eigene übergeordnete Position zu erhalten.

Vorher gab es keinen Standard, nachher heißt es plötzlich: „Das ist doch selbstverständlich.“

Fragt man nach, kommt „Denk selbst nach“; entscheidet man selbst, kommt „Mach nichts eigenmächtig“.

In so einer Umgebung gibt es kein Spiel mehr, in dem man sich einer richtigen Antwort annähern kann, weil die „richtige Antwort“ selbst ständig verschoben wird.

Wenn jemand dagegen zugeben kann „Ich kann das aktuell nicht fachlich prüfen“, lässt sich das System noch reparieren: Experten hinzunehmen, Prüfungen automatisieren, Begründungen und offene Punkte verpflichtend ausgeben lassen.

Fehlendes Wissen kann ergänzt werden.

Nachträglich wandernde Bewertungskriterien zerstören dagegen den Qualitätssicherungsmechanismus selbst.


Jetzt verstehe ich besser, warum ritualisierte Qualitätskontrolle so nervig war

Die ursprüngliche Idee von QC Circles besteht darin, dass kleine Gruppen an der Front Qualität und Arbeit kontinuierlich verbessern.

Auch die Union of Japanese Scientists and Engineers beschreibt QC Circles als fortlaufende Kontroll- und Verbesserungsaktivität von Mitarbeitenden an der Frontlinie.

Das Problem ist nicht Qualitätskontrolle an sich.

Das Problem beginnt, sobald „wirklich verbessern“ durch „die Form vervollständigen, die beweist, dass wir Qualitätskontrolle gemacht haben“ ersetzt wird.

Thema wählen.

Diagramme bauen.

In die QC Story pressen.

Präsentation erstellen.

Bewerten lassen.

Applaus.

Fertig.

Das ist keine kontinuierliche Verbesserung mehr. Das ist eine Cosplay-Meisterschaft für kontinuierliche Verbesserung.

Die Schleife mit KI-Agenten ist deutlich weniger glamourös.

Es scheitert.

Ursache suchen.

Reproduktionsbedingungen finden.

Abschlusskriterium oder Prüfung ändern.

Noch einmal ausführen.

Sicherstellen, dass derselbe Fehler nicht mehr als „Erfolg“ durchrutschen kann.

Keine schöne Präsentation.

Aber beim nächsten Mal gibt es tatsächlich weniger menschliche Arbeit.

Ironischerweise ist das näher an der ursprünglichen Idee kontinuierlicher Verbesserung.


Ohne es bewusst zu planen, bin ich ziemlich nah an OpenAIs Harness Engineering gelandet

Im Februar 2026 veröffentlichte OpenAI „Harness Engineering“ und beschrieb darin eine auf KI-Agenten und Codex ausgerichtete Entwicklungsweise.

In diesem internen Experiment galt die Vorgabe von null manuell geschriebenen Codezeilen. OpenAI schätzte, dass das Produkt ungefähr in einem Zehntel der Zeit entstanden sei, die handgeschriebene Entwicklung benötigt hätte.

Spannender als die Geschwindigkeit ist aber der Rollenwechsel.

Die Hauptarbeit des Menschen verschiebt sich vom Codieren zu Umgebung gestalten, Absicht spezifizieren und Rückkopplungsschleifen bauen.

OpenAI beschreibt außerdem, dass zentrale Anforderungen wie Grenzen, Korrektheit und Reproduzierbarkeit zentral erzwungen werden sollten, während KI-Agenten innerhalb dieser Grenzen viel Autonomie erhalten.

Das ist diesem Stil sehr ähnlich.

Man muss nicht jedes „Wie“ bis ins Kleinste steuern.

Man muss aber klar sagen, „was niemals kaputtgehen darf“.

Wenn etwas scheitert, wird der Fehler für die nächste Runde zu Dokumentation, Test, Lint-Prüfung oder Werkzeugregel.

Die ursprüngliche Motivation kann einfach nur „Details sind lästig, ich will sie nicht ansehen“ sein. Das Ergebnis ist trotzdem eine Umgebung, in der KI-Agenten selbstständig weiterarbeiten können.

Ich bin also nicht von der Theorie zur Praxis gegangen.

Ich habe den Weg der Faulheit genommen und bin auf demselben Berg gelandet.

Das ist schon etwas lustig.


Persönliche Projekte sind Diktaturen ohne Politik. In Unternehmen eröffnet das Parlament die Sitzung

Für ein persönliches Projekt ist dieses Modell extrem stark.

Der Verantwortliche bin ich.

Der Nutzer bin ich.

Der Prüfer bin ich.

Und auch die Definition von Erfolg kommt von mir.

Wenn ich in einem Kartenspiel gewinnen will, prüfe ich, ob ich häufiger gewinne.

Wenn ich weniger arbeiten will, prüfe ich, ob menschliche Eingriffe abnehmen.

Weil die Zielfunktion fast nur aus einer Linie besteht, lässt sich jedes noch so komplizierte KI-System am Ende auf zwei sehr einfache Fragen zurückführen:

Gewinne ich damit öfter?

Habe ich damit weniger Arbeit?

Ein persönliches Projekt ist eine Diktatur ohne Politik.

Und weil der Diktator auch noch faul ist, automatisiert die KI-Bürokratie immer weiter.

Im Unternehmen erscheinen sofort weitere Ziele.

„Arbeitsaufwand reduzieren“ trifft auf bestehende Abläufe, Prüfpflichten, Freigaberechte, Altsysteme, Verantwortung, Leistungsbewertung und sogar auf die Existenzberechtigung einzelner Abteilungen.

Harvard Business Review fasste 2025 viele Hürden bei der KI-Einführung in Unternehmen als „people, processes, and politics“ – also Menschen, Prozesse und Politik – zusammen, nicht bloß als Technologieproblem.

Im persönlichen Projekt definiert man den Soll-Zustand und lässt die KI optimieren.

Im Unternehmen ist bereits die Definition des Soll-Zustands eine Verhandlung.

Und nicht jede Politik ist Unsinn.

Eine menschliche Freigabe aus Prüf- oder Verantwortungsgründen beizubehalten kann völlig vernünftig sein.

Sie nur beizubehalten, weil jemand keine Freigabemacht verlieren will, ist etwas anderes.

Für die KI sehen beide Fälle gleich aus: „menschliche Freigabe erforderlich“.

Ob diese Einschränkung tatsächlich nötig ist, bleibt am Ende eine Frage menschlicher Gesellschaft.


Am Ende muss der Mensch vielleicht nur zwei Dinge festhalten: Ziel und Realität

Im KI-Zeitalter ist es nicht mehr selbstverständlich, dass ein Mensch jeden Schritt selbst entwerfen, alles implementieren und anschließend alles persönlich kontrollieren muss.

Ziel festlegen.

KI den Soll-Zustand und die Kriterien ableiten lassen.

KI implementieren lassen.

KI prüfen lassen.

Mit externen Belegen abgleichen.

Wenn etwas scheitert, den Fehler zur Regel für die nächste Runde machen.

Wenn noch menschliche Arbeit übrig bleibt, genau diese Stelle zum nächsten Verbesserungsziel machen.

Wenn diese Schleife stabil funktioniert, sinkt der Bedarf, dass ein Mensch jedes Implementierungsdetail kennt, deutlich.

Zwei Fragen lassen sich aber nur schwer vollständig delegieren:

Was wollen wir eigentlich erreichen?

Passt dieses Ziel zur Realität?

Vielleicht nähert sich die Rollenverteilung deshalb immer mehr diesem Bild:

Mensch: entscheidet über das Ziel und betrachtet die Realität.

KI: füllt alles dazwischen aus.

Im persönlichen Projekt ist das sehr angenehm.

Im Unternehmen eröffnet das Parlament die Sitzung.

Die Politik bleibt ungeschlagen.


Gemeinsame Quellen / Faktenprüfung

Die folgenden Sachquellen gelten gemeinsam für alle 12 Sprachversionen. Die Beispiele zum Arbeitsablauf in der Ich-Perspektive sind anonymisiert und lassen Namen, Arbeitgeber, Orte, Kontokennungen und andere persönliche Angaben bewusst weg.

  1. OpenAI, „Harness engineering: leveraging Codex in an agent-first world“, 2026-02-11
    https://openai.com/index/harness-engineering/
    Verwendet für: das Experiment mit null manuell geschriebenen Codezeilen, die Schätzung von ungefähr einem Zehntel der sonst benötigten Entwicklungszeit, „Humans steer. Agents execute.“, die Verschiebung hin zur Gestaltung von Umgebungen, Spezifikation der Absicht und Rückkopplungsschleifen sowie die zentrale Durchsetzung wichtiger Grenzen.

  2. Zenn / 現場と一緒に作るDX, 「AIで生産性が3倍になった私たちが、チームを置き去りにした話」, 2026-08-19
    https://zenn.dev/factory_dx_eng/articles/ai-productivity-team-divide
    Verwendet für: den Fall, in dem die KI-Einführung die Arbeitsweise schneller veränderte, als Management und fachliche Prüfung mithalten konnten, einschließlich des vom Autor beschriebenen Prüfproblems „理解できないが正しいと思う“.

  3. Union of Japanese Scientists and Engineers (JUSE), QC Circle / QCサークル活動
    https://www.juse.or.jp/english/qc/index.html
    https://www.juse.or.jp/business/qc/index.html
    Verwendet für: die ursprüngliche Einordnung von QC Circles als kleine Gruppen von Mitarbeitenden an der Frontlinie, die Qualität von Arbeit, Produkten und Dienstleistungen fortlaufend kontrollieren und verbessern.

  4. Harvard Business Review, Jin Li, Feng Zhu, Pascal Hua, „Overcoming the Organizational Barriers to AI Adoption“, 2025-11-11
    https://hbr.org/2025/11/overcoming-the-organizational-barriers-to-ai-adoption
    Verwendet für: die Einordnung, dass Hindernisse bei der KI-Einführung in Unternehmen häufig Menschen, Prozesse und Politik betreffen und nicht nur die Technologie.

Mendoi-chan

Verfasst von

Mendoi-chan

Sie macht Reibungen im Beruf und Alltag als klare Struktur und konkrete nächste Schritte verständlich.

Über diese Website