1 Yen pro „Irgendwas stimmt hier nicht“: Echte Menschen als Website-Tester

So funktionieren die Lesehilfen

Anhören liest den Artikel vor. Schnelllesen zeigt Wortgruppen im gewählten Tempo. Sprachübungen vergleichen verfügbare Übersetzungen. Speichern legt ein Lesezeichen in diesem Browser an, das du in der Merkliste des Players wiederfindest.

Artikel teilen
1 Yen pro „Irgendwas stimmt hier nicht“: Echte Menschen als Website-Tester
KI-generiertes Bild
Werbung
Werbung

Artikel schreibe ich mit KI. Übersetzen tue ich mit KI. Links repariere ich mit KI. Zugriffe zähle ich mit KI. Ich frage die KI „Ist diese Stelle nicht verwirrend?“ und korrigiere dann wieder mit KI.

Wenn man so weit ist, taucht meistens ein Problem auf.

Alle kennen die Website viel zu gut.

Wer sie gebaut hat, weiß, was jeder Button bedeutet. Die KI liest die Spezifikation und versteht: „Dieser Button führt zu verwandten Artikeln.“ Der Betreiber hat die Seiten schon so oft gesehen, dass sein Gehirn kleine Unstimmigkeiten von selbst ausgleicht.

Wer aber zum ersten Mal vorbeikommt, hat nichts davon.

„Was ist das?“ „Wo muss ich klicken?“ „Warum ist nur das hier auf Englisch?“ „Ich komme nicht zurück.“ „Der Text ist lesbar, aber irgendwie fühlt er sich komisch an.“

Genau dieses „irgendwie“ will ich haben.

Die Idee, auf die ich schließlich gekommen bin, ist ziemlich witzig.

Ich lagere das Debugging endlich an echte Menschen aus.

Und zwar zahle ich 1 Yen pro Hinweis, höchstens 1.000 Yen pro Person.

Die Zeit ist gekommen, in der Menschen der KI die Arbeit wegnehmen. Ihr Zuständigkeitsbereich: „das ungute Gefühl“.

1. Ausgelagert werden soll kein Code-Review, sondern „das Stolpern beim ersten Hinsehen“

Was ich diesmal brauche, ist kein großes Audit durch Fachleute.

  • Ich verstehe nicht, was der Button bedeutet
  • Ich weiß nicht, wohin ich als Nächstes soll
  • Eine Überschrift klingt seltsam
  • Auf dem Smartphone lässt es sich schlecht antippen
  • Der Link führt auf eine Seite in einer anderen Sprache
  • Ich habe etwas angetippt, und der Bildschirm wurde komplett weiß
  • Der Satz ist grammatisch korrekt, aber wer ihn liest, findet ihn merkwürdig
  • Hier wäre eine Funktion praktisch

So etwas eben.

Digital.gov, der Web-Leitfaden der US-Regierung, beschreibt Usability-Tests als Methode, bei der man echten Nutzern dabei zusieht, wie sie ein Produkt oder einen Dienst zu benutzen versuchen. [1] GOV.UK, das Portal der britischen Regierung, sagt ebenfalls, dass man durch das Beobachten echter Nutzer konkrete Probleme findet, etwa bei Sprache und Layout. [2]

„Einen Menschen einmal draufschauen lassen“ ist also kein mysteriöses Ritual, das erst im KI-Zeitalter aufgetaucht wäre.

Es ist der altbekannte Usability-Test, der zu einer Website zurückkehrt, die sich mit KI massenhaft produzieren und korrigieren lässt.

2. Manchmal kann ausgerechnet der Betreiber selbst am schlechtesten testen

Die eigene Website jeden Tag gründlich prüfen.

Das ist leicht gesagt. Aber wenn Artikel, Sprachen und Funktionen mehr werden, geht es schlicht nicht mehr.

Und „der Ersteller schaut selbst“ hat noch ein weiteres Problem.

Er weiß, wo die Suche ist. Er weiß, wo die verwandten Artikel erscheinen. Er weiß, wie der Sprachwechsel funktioniert. Selbst wenn etwas nicht stimmt, geht er mit „so ist das eben“ darüber hinweg.

Und vor allem: Hinschauen ist lästig.

Das ist wichtiger, als es klingt.

Wenn man die Lästigkeit mit reiner Willenskraft niederzuringen versucht und sich vornimmt, „jeden Tag 100 Seiten zu prüfen“, hält diese Routine nicht lange. Also trennt man den lästigen Schritt einfach ab.

Der Betreiber muss nicht derjenige sein, der alles ansieht.

Er kann der sein, der festlegt, was angesehen werden soll, und das System baut, das die gesammelten Auffälligkeiten behebt.

3. Für 1 Yen pro Hinweis kauft man keine „Ideen“, sondern frische Augen

Allein die Zahl betrachtet, ist 1 Yen pro Hinweis unglaublich billig.

Aber was ich hier kaufen will, ist kein schickes Beratungsdokument.

Ich kaufe die Tatsache, dass ein frisches Augenpaar einmal an einer Stelle hängen geblieben ist.

Reicht eine Person 1.000 Hinweise ein, sind das 1.000 Yen. Ist es aber derselbe Inhalt, nur anders formuliert, zählt er als ein Hinweis. Die Obergrenze pro Person liegt ebenfalls bei 1.000 Yen.

Diese Obergrenze ist sehr wichtig.

Sobald man sagt „ich hätte gern viele“, läuft die ganze Welt sofort in die Richtung: „Wenn ich die KI 10.000 Verbesserungspunkte ausspucken lasse, sind das dann 10.000 Yen?“

Deshalb gelten neben der Bezahlung pro Hinweis diese Bedingungen:

  • Die Website wirklich angesehen haben
  • Über Stellen und Verhalten schreiben, die es tatsächlich gibt
  • Die Liste nicht mit Umformulierungen desselben Punktes aufblähen
  • Eine Obergrenze festlegen

Noch ein Hinweis: 1 Yen pro Hinweis ist nur das Design dieses Experiments, kein allgemein gültiger fairer Lohn. Wer stundenlange Arbeit oder eine fachliche Bewertung verlangt, muss die Konditionen an Zeit und Schwierigkeit anpassen.

4. Der größte Feind ist „Ich habe mit KI 10.000 Verbesserungen erzeugt“

KI zu verbieten ist nicht nötig.

Das Problem sind Verbesserungsvorschläge von jemandem, der die Website nie angesehen hat.

„Im Allgemeinen sollten Websites die Navigation verständlicher machen.“ „Lasst uns die Barrierefreiheit verbessern.“ „Lasst uns die Darstellung für verschiedene Bildschirmgrößen optimieren.“

Alles richtig.

Und nichts davon ist das, was ich diesmal haben will.

Ich will Beobachtungen wie:

„Auf dieser Seite, dieser Button: Ich wusste nicht, was beim Antippen passiert.“ „Direkt nach dieser Überschrift springt das Thema plötzlich.“ „Nur in dieser Sprachversion führen die verwandten Artikel in eine andere Sprache.“

Die KI kann helfen, solche Beobachtungen zu kürzen und Doppelte zusammenzufassen.

Der Mensch entdeckt, die KI ordnet.

Wichtig ist, die Reihenfolge nicht umzudrehen.

5. Wenn die Hinweise einzeln per Chat kommen, stirbt zuerst der Auftraggeber

Wenn man mehr Meldungen möchte, muss man auch die Art der Einreichung gestalten.

Am schlimmsten ist Folgendes:

„Hier ist Nummer eins.“ „Nummer zwei.“ „Ach ja, noch Nummer drei.“ „Und als Ergänzung Nummer vier.“

Der Chat wird endlos lang.

Dann hat man das Debugging ausgelagert, und es entsteht eine neue manuelle Arbeit: das Einsammeln der Meldungen.

Deshalb wird alles auf einmal eingereicht. Folgendes ist jeweils in Ordnung:

  • Excel
  • Tabellenkalkulation
  • Eine txt-Datei
  • Eine nummerierte Liste
  • Text, den man kopieren und einfügen kann

Screenshots sind grundsätzlich auch nicht nötig. Bilder sind praktisch zum Ansehen, erzeugen aber später beim Suchen, Entfernen von Duplikaten und bei der KI-Verarbeitung viel Reibung.

Auch der Leitfaden zur Nutzerforschung von GOV.UK sagt, dass getippte Notizen sich später leichter aufbewahren und auswerten lassen und dass es Sortieren und Analysieren erleichtert, jede Beobachtung in einen eigenen Eintrag zu schreiben. [3]

Das Format darf einfach sein.

Wo / wie es aktuell aussieht / was besser wäre

Bei einem Fehler (Bug):

Wo / was du getan hast / was passiert ist

Allein damit hat die nachgelagerte KI schon ordentlich zu tun.

6. Bei mehrsprachigen Websites sind „übersetzt“ und „für Menschen lesbar“ zwei verschiedene Dinge

Mehrsprachige Websites sind noch interessanter.

Aus Sicht der Maschine wurden alle 12 Sprachen erfolgreich erzeugt. Der Build war erfolgreich. HTTP 200. Die Links existieren.

Trotzdem finden Menschen beim Hinsehen ganz normal Seltsames.

  • Teile sind in der Ausgangssprache geblieben
  • Nur die Buttons sind merkwürdig übersetzt
  • Der Satz ergibt Sinn, klingt aber für Muttersprachler unnatürlich
  • Der Text wird länger und zerschießt das Layout
  • Nach dem Sprachwechsel springen nur die verwandten Artikel zurück in die Ausgangssprache
  • Es sollte derselbe Artikel sein, aber ein Teil fehlt

Das müssen nur Leute prüfen, die die jeweilige Sprache lesen können.

Wer Englisch liest, prüft Englisch. Wer Koreanisch liest, prüft Koreanisch. Genauso bei Chinesisch, Spanisch, Portugiesisch, Indonesisch, Thai, Vietnamesisch, Französisch und Deutsch.

Es muss nicht jeder alle Sprachen ansehen.

Die Maschine bestätigt „es wurde erzeugt“, der Mensch bestätigt „liest sich das normal?“.

Die Rollen sind verschieden.

7. Ein Duplikat zählt bei der Bezahlung als ein Hinweis, ist aber für die Analyse enorm wichtig

Wenn dieselbe Person dreimal schreibt:

„Der Button ist verwirrend.“ „Die Bedeutung des Buttons ist unklar.“ „Was ist das für ein Button?“

reicht es, das als einen Hinweis zu zählen.

Bleiben aber drei verschiedene Personen unabhängig voneinander am selben Button hängen, sieht die Sache anders aus.

Das ist dann nicht bloß ein Duplikat, sondern eine reproduzierbare Reibung.

Deshalb trenne ich beim Auswerten so:

  • Umformulierungen derselben Person → zusammenführen
  • Derselbe Hinweis, unabhängig von verschiedenen Personen → als Häufigkeit behalten

„Drei Leute haben sich an derselben Stelle verirrt“ wiegt schwerer als der Geschmack des Betreibers.

GOV.UK hat es außerdem in seinen Service-Standard aufgenommen, die Usability häufig mit echten oder erwarteten Nutzern zu prüfen und auf Geräten zu testen, die das Verhalten der Nutzer widerspiegeln. [4]

Der Sinn, mehr Leute einzubeziehen, ist keine „Meinungsabstimmung“, sondern zu sehen, ob dieselbe Reibung auch bei anderen auftritt.

8. Die fertige Form heißt KI → Mensch → KI, und der Mensch wird zum Sensor

Der endgültige Ablauf wird ziemlich sauber.

  1. Die KI erzeugt den Artikel
  2. Die KI übersetzt
  3. Die KI prüft Links, Struktur und Darstellung
  4. Die KI behebt bekannte Probleme
  5. Ein Mensch liest, klickt und verirrt sich wirklich
  6. Der Mensch schreibt das „Irgendwas stimmt nicht“ als Text auf
  7. Die KI führt Duplikate zusammen
  8. Die KI sortiert nach Schweregrad, Reproduzierbarkeit und Behebungsaufwand
  9. Die KI erstellt Korrekturvorschläge
  10. Nach der Korrektur geht es zurück zur maschinellen Prüfung und zur Kontrolle durch Menschen

Endlich ist sogar der Mensch ein Schritt in der Pipeline.

Doch die Arbeit, die dem Menschen bleibt, ist keine simple Fleißarbeit.

Sie besteht darin, die Reibung zu erkennen, die nur ein Mensch spürt.

Das ist eher eine Beförderung.

Die Maschine prüft „Ist der Link ein 404?“, und der Mensch prüft „Es ist kein 404, aber ich verstehe nicht, warum ich hierher geschickt wurde.“

Die Maschine prüft „Gibt es den übersetzten Text?“, und der Mensch prüft „Es gibt ihn, aber so sagt das niemand.“

Diese Arbeitsteilung ist natürlicher.

9. Wenn Tester hinschauen, steigen auch die Seitenaufrufe. Aber das ist nicht das Ziel

Natürlich steigen die Aufrufe, wenn jemand dutzende Seiten ansieht.

Bei einer Website mit Werbung können beim normalen Surfen auch Anzeigen eingeblendet werden.

Das ist aber reines Nebenprodukt.

Leute dazu zu bringen, Anzeigen anzuklicken, oder mehr Anzeigeneinblendungen zur Bedingung der Arbeit zu machen, wäre etwas ganz anderes.

Was ich kaufe, sind keine Seitenaufrufe.

Ich kaufe die Beobachtung, die übrig bleibt, nachdem ein Mensch die Seite angesehen hat.

Wenn nebenbei die Zugriffe ein bisschen steigen, denkt man am besten: „Ich habe Nutzertests gemacht, und nebenbei hat die Kasse ein bisschen geklingelt.“

10. Das Ende der Automatisierung war nicht „null Menschen“

Wer anfängt, KI zu nutzen, will leicht wissen, wie weit man Menschen wegrationalisieren kann.

Treibt man die Automatisierung aber wirklich voran, kommt man manchmal zum gegenteiligen Schluss.

Man muss nicht alle Menschen abschaffen.

Man muss die Menschen nur an die Stellen verschieben, an denen nur sie Wert schaffen.

Artikelentwürfe. Übersetzung. Duplikate bereinigen. Links prüfen. Sortieren. Zählen. Korrekturvorschläge.

Das alles schiebt man zu den Maschinen.

Und am Ende kauft man von den Menschen nur noch:

„Ich sehe das zum ersten Mal und verstehe es nicht.“ „Diese Stelle mag ich nicht.“ „Irgendwas stimmt hier nicht.“ „Das ist praktisch.“

Was man mit 1 Yen pro Hinweis kauft, ist keine Textzeile.

Es ist das kurze ungute Gefühl eines anderen Menschen, das weder ich noch die KI haben kann.

Als die Automatisierung auf die Spitze getrieben war, kamen die Menschen zurück.

Und ihre Abteilung heißt „Irgendwas stimmt hier nicht“.

Sehr menschlich.

Quellen (4)

  1. Digital.gov, “Usability testing digital.gov
  2. GOV.UK Service Manual, “Using moderated usability testing gov.uk
  3. GOV.UK Service Manual, “Taking notes and recording user research sessions gov.uk
  4. GOV.UK Service Manual, “4. Make the service simple to use gov.uk

WerbungBücher zu diesem Thema

Dieser Artikel enthält Affiliate-Links (Werbung). Mehr zur Werbung Als Amazon-Partner verdiene ich an qualifizierten Verkäufen. As an Amazon Associate I earn from qualifying purchases.

Heute lesen

Jeder Artikel beantwortet eine Frage, die sich Leser dieses Artikels oft als Nächstes stellen.

Alle Artikel durchsuchenMehr zu AI

Werbung

Noch einer? Etwas Lustiges?

Wo Sie schon fertig sind: ein paar Geschichten zum selben Thema und ein paar ganz andere, die Spaß machen.

  1. Ähnliches ThemaAllein unterwegs mit KI oder mit FreundenZwei Arten, wie Alltag Spaß macht
  2. Ganz anders, aber unterhaltsamSmash UltimateWarum Pyra/Mythra jeden Schlagabtausch verliert – Kazuyas Geisterphase und K. Rools Bauch
  3. Warum ist die Maske in psychiatrischen Praxen Pflicht, und darf man mich abweisen, wenn ich keine kaufe?
  4. Nach der Arbeit essen und dann stundenlang schlafen?Vielleicht keine Faulheit, sondern ein „Erholungsdefizit"
  5. Shadowverse WBAggro Nightmare aus Set 9 spielen, das Board nur am Anfang nutzen

Weitere Artikel finden

Alle Artikel

Mendoi-chan

Wer diese Seite betreibt

Mendoi-chan

Sie macht Reibungen im Beruf und Alltag als klare Struktur und konkrete nächste Schritte verständlich.