J'écris mes articles avec l'IA. Je traduis avec l'IA. Je répare les liens avec l'IA. Je compte les visites avec l'IA. Je demande à l'IA « ce passage n'est pas confus ? », puis je corrige encore avec l'IA.
Quand on en arrive là, un problème surgit presque toujours.
Tout le monde connaît beaucoup trop bien le site.
Celui qui l'a construit sait ce que veut dire chaque bouton. L'IA lit le cahier des charges et comprend que « ce bouton sert aux articles liés ». Le responsable du site l'a vu tant de fois que, même si quelque chose cloche un peu, son cerveau comble les trous tout seul.
Mais quelqu'un qui arrive pour la première fois n'a rien de tout ça.
« C'est quoi, ça ? » « Où faut-il cliquer ? » « Pourquoi y a-t-il de l'anglais seulement ici ? » « Je n'arrive pas à revenir en arrière. » « Le texte se lit, mais quelque chose me gêne sans que je sache dire quoi. »
C'est précisément ce « quelque chose » que je veux.
Alors l'idée à laquelle je suis arrivé est assez drôle.
Je vais enfin sous-traiter le débogage à de vraies personnes.
Et je paie 1 yen par remarque, avec un plafond de 1 000 yens par personne.
L'ère où les humains volent le travail de l'IA est arrivée. Leur rayon : « le sentiment que quelque chose cloche ».
1. Ce que je veux sous-traiter, ce n'est pas une revue de code, c'est « l'accroc du premier regard »
Je ne cherche pas un grand audit réalisé par des experts.
- Je ne comprends pas ce que veut dire ce bouton
- Je ne sais pas où aller ensuite
- Un titre est bizarre
- C'est difficile à toucher sur mobile
- Le lien mène à une page dans une autre langue
- J'ai touché quelque chose et l'écran est devenu tout blanc
- La phrase est correcte, mais une personne qui la lit la trouve étrange
- Une fonction ici serait pratique
Des choses comme ça.
Digital.gov, le guide web du gouvernement américain, décrit le test d'utilisabilité comme une façon d'observer de vrais utilisateurs qui essaient d'utiliser un produit ou un service. [1] GOV.UK, le portail du gouvernement britannique, affirme aussi qu'observer de vrais utilisateurs permet de repérer des problèmes concrets, par exemple de langue ou de mise en page. [2]
Autrement dit, « laisser une personne y toucher une fois » n'est pas un rituel mystérieux apparu soudain à l'ère de l'IA.
C'est le bon vieux test d'utilisabilité, qui revient vers un site que l'IA permet de produire et de corriger en masse.
2. Parfois, le responsable du site est la personne la moins bien placée pour le tester
Vérifier soigneusement son propre site tous les jours.
C'est facile à dire. Mais quand les articles, les langues et les fonctions se multiplient, c'est tout simplement impossible.
Et puis, « c'est celui qui l'a fait qui regarde » pose un autre problème.
Il sait où se trouve la recherche. Il sait où s'affichent les articles liés. Il sait comment fonctionne le changement de langue. Même si quelque chose cloche un peu, il passe en se disant « c'est comme ça ».
Et surtout, regarder, c'est pénible.
C'est plus important qu'il n'y paraît.
Si on essaie de vaincre la corvée à coups de volonté, en se fixant « 100 pages vérifiées par jour », cette routine ne tiendra pas. Alors autant détacher l'étape pénible du reste.
Le responsable du site n'a pas à être celui qui regarde tout.
Il peut être celui qui décide quoi regarder et qui construit le système pour corriger les anomalies remontées.
3. Avec 1 yen par remarque, on n'achète pas des « idées », on achète des yeux neufs
Rien qu'à voir le chiffre, 1 yen par remarque, c'est dérisoire.
Mais ce que je veux acheter ici, ce n'est pas un beau rapport de consultant.
C'est le fait que des yeux neufs ont buté une fois sur quelque chose.
Si une personne en envoie 1 000, cela fait 1 000 yens. Mais si c'est la même remarque reformulée, elle ne compte que pour une. Et le plafond de rémunération par personne est de 1 000 yens.
Ce plafond est très important.
Dès qu'on dit « je veux en recevoir beaucoup », le monde entier se met à penser : « et si je fais pondre 10 000 pistes d'amélioration à l'IA, ça fait 10 000 yens ? »
Alors, en plus du paiement au nombre de remarques, j'ajoute ces conditions :
- Avoir réellement regardé le site
- Écrire sur des endroits et des comportements qui existent vraiment
- Ne pas gonfler la liste en reformulant le même point
- Fixer un plafond
Précision : 1 yen par remarque est simplement le dispositif de cette expérience, pas un tarif juste valable partout. Si l'on demande de longues heures de travail ou une évaluation spécialisée, il faut des conditions à la mesure du temps et de la difficulté.
4. Le pire ennemi, c'est « j'ai fait sortir 10 000 améliorations par l'IA »
Inutile d'interdire l'IA.
Le problème, ce sont les propositions d'amélioration faites sans avoir jamais regardé le site.
« En général, un site web devrait rendre sa navigation plus claire. » « Améliorons l'accessibilité. » « Optimisons l'affichage pour les différentes tailles d'écran. »
Tout cela est juste.
Et rien de tout cela n'est ce que je cherche.
Ce que je veux, ce sont des observations comme :
« Sur cette page, ce bouton : je n'ai pas compris ce qui allait se passer en cliquant. » « Juste après ce titre, le sujet a soudain sauté. » « Dans cette version linguistique seulement, les articles liés renvoient vers une autre langue. »
L'IA peut servir à raccourcir ces observations et à regrouper les doublons.
L'humain découvre, l'IA met en ordre.
L'essentiel est de ne pas inverser l'ordre.
5. Si les remarques arrivent une par une dans le chat, c'est le demandeur qui meurt le premier
Si l'on veut plus de retours, il faut aussi concevoir la façon de les envoyer.
Le pire, c'est ceci :
« Voici la première. » « La deuxième. » « Ah, et la troisième. » « Encore une, la quatrième. »
Le chat s'allonge à l'infini.
On a sous-traité le débogage, et voilà qu'apparaît une nouvelle tâche manuelle : collecter les retours.
L'envoi se fait donc en une seule fois. N'importe lequel de ces formats convient :
- Excel
- Tableur
- Fichier txt
- Liste numérotée
- Texte que l'on peut copier-coller
Les captures d'écran ne sont pas nécessaires non plus, en principe. Elles sont pratiques à regarder, mais créent beaucoup de frictions ensuite pour chercher, dédoublonner ou traiter avec l'IA.
Le guide de recherche utilisateur de GOV.UK dit aussi que les notes tapées sont plus faciles à conserver et à analyser par la suite, et que séparer chaque observation en un élément facilite le tri et l'analyse. [3]
Le format peut rester simple.
Où / comment c'est actuellement / ce qui serait mieux
Pour un bug :
Où / ce que vous avez fait / ce qui s'est passé
Avec ça seulement, l'IA qui vient ensuite a déjà largement de quoi travailler.
6. Sur un site multilingue, « c'est traduit » et « un humain peut le lire » sont deux choses différentes
Les sites multilingues sont encore plus intéressants.
Pour la machine, les 12 langues ont toutes été générées avec succès. La compilation a réussi. HTTP 200. Les liens existent.
Et pourtant, un humain y trouve très souvent des choses bizarres.
- Il reste des bouts dans la langue d'origine
- Seuls les boutons sont mal traduits
- La phrase a du sens, mais sonne peu naturelle à un locuteur natif
- Le texte s'allonge et casse la mise en page
- Après avoir changé de langue, seuls les articles liés repassent dans la langue d'origine
- Ce devrait être le même article, mais il en manque une partie
Cela ne doit être vérifié que par ceux qui lisent la langue concernée.
Ceux qui lisent l'anglais regardent l'anglais. Ceux qui lisent le coréen regardent le coréen. Idem pour le chinois, l'espagnol, le portugais, l'indonésien, le thaï, le vietnamien, le français et l'allemand.
Inutile que tout le monde voie toutes les langues.
La machine confirme que « c'est généré », l'humain confirme que « ça se lit normalement ».
Les rôles sont différents.
7. Un doublon compte pour une seule remarque côté paiement, mais il est capital pour l'analyse
Si la même personne écrit :
« Le bouton est confus. » « Je ne comprends pas le sens du bouton. » « C'est quoi, ce bouton ? »
cela compte pour une seule remarque.
Mais si trois personnes différentes butent chacune de leur côté sur le même bouton, c'est une autre histoire.
Ce n'est plus un simple doublon, c'est une friction reproductible.
Donc, au moment de compter, je sépare ainsi :
- Reformulations d'une même personne : on fusionne
- Même remarque faite indépendamment par des personnes différentes : on la garde comme fréquence
« Trois personnes se sont perdues au même endroit » pèse plus lourd que les goûts du responsable du site.
GOV.UK inscrit aussi dans son standard de service le fait de vérifier fréquemment l'utilisabilité auprès d'utilisateurs réels ou prévus, et de tester sur des appareils qui reflètent le comportement des utilisateurs. [4]
Augmenter le nombre de personnes ne sert pas à « voter sur des opinions », mais à voir si la même friction se produit aussi chez d'autres.
8. La forme finale, c'est IA → humain → IA, et l'humain devient un capteur
Le processus final devient plutôt propre.
- L'IA génère l'article
- L'IA le traduit
- L'IA vérifie les liens, la structure et l'affichage
- L'IA corrige les problèmes connus
- Un humain lit, clique et se perd pour de vrai
- L'humain écrit ce « truc bizarre » sous forme de texte
- L'IA fusionne les doublons
- L'IA les classe par gravité, reproductibilité et coût de correction
- L'IA prépare des pistes de correction
- Après correction, retour à la vérification automatique et à la vérification humaine
Enfin, même l'humain est devenu une étape de la chaîne.
Mais ce qu'il reste à faire à l'humain n'est pas du travail à la chaîne.
C'est détecter la friction que seul un humain ressent.
C'est même plutôt une promotion.
La machine vérifie « le lien renvoie-t-il une 404 ? », et l'humain vérifie « ce n'est pas une 404, mais je ne comprends pas pourquoi on m'a amené ici ».
La machine vérifie « le texte traduit existe-t-il ? », et l'humain vérifie « il existe, mais personne ne le dit comme ça ».
Cette répartition du travail est plus naturelle.
9. Quand les testeurs regardent, les pages vues augmentent aussi. Mais ce n'est pas le but
Évidemment, si l'on fait regarder des dizaines de pages, le nombre de vues grimpe.
Sur un site avec des publicités, des annonces peuvent aussi s'afficher au fil d'une navigation normale.
Mais ce n'est qu'un sous-produit.
Demander de cliquer sur les pubs, ou faire de l'augmentation des affichages publicitaires une condition du travail, serait tout autre chose.
Ce que j'achète, ce ne sont pas des pages vues.
J'achète l'observation qui reste après qu'un humain a regardé la page.
Si, au passage, la fréquentation monte un peu, autant se dire : « je faisais des tests utilisateurs, et la caisse a un peu sonné au passage ».
10. Le point d'arrivée de l'automatisation n'était pas « zéro humain »
Quand on commence à utiliser l'IA, on a vite envie de savoir jusqu'où l'on peut éliminer les humains.
Mais quand on pousse vraiment l'automatisation, on arrive parfois à la conclusion inverse.
Il n'est pas nécessaire d'éliminer tous les humains.
Il suffit de déplacer les humains vers les endroits où eux seuls apportent de la valeur.
Brouillons d'articles. Traduction. Fusion des doublons. Vérification des liens. Classement. Comptage. Propositions de correction.
Tout cela, on le confie aux machines.
Et à la fin, on n'achète aux humains que des choses comme :
« C'est la première fois que je vois ça et je ne comprends pas. » « Je n'aime pas cet endroit. » « Il y a un truc bizarre. » « C'est pratique, ça. »
Ce que l'on achète avec 1 yen par remarque, ce n'est pas une ligne de texte.
C'est l'instant de malaise d'une autre personne, quelque chose que ni moi ni l'IA ne pouvons avoir.
En poussant l'automatisation jusqu'au bout, les humains sont revenus.
Et leur service, c'est « il y a un truc bizarre ».
Très humain.
Références (4)
- Digital.gov, “Usability testing digital.gov
- GOV.UK Service Manual, “Using moderated usability testing gov.uk
- GOV.UK Service Manual, “Taking notes and recording user research sessions gov.uk
- GOV.UK Service Manual, “4. Make the service simple to use gov.uk



