Récemment, un ami m’a parlé des outils modernes de traduction de jeux vidéo.
On sélectionne une zone de l’écran, le logiciel lit le texte qui y apparaît puis affiche la traduction dans une fenêtre semi-transparente. Il peut y avoir un peu de latence, mais si la phase de traduction utilise un LLM, le résultat ne se limite pas à remplacer mécaniquement des mots : il peut reformuler le dialogue de manière naturelle selon le contexte.
Ma première réaction a été simple :
« Attends, on en est déjà au point où l’on peut jouer à un jeu étranger sans attendre un patch de traduction ? »
Puis la recherche a complètement déraillé.
L’OCR lit l’écran.
Le modèle de traduction interprète le sens.
L’overlay remet le résultat sur l’interface d’origine.
Cette architecture n’est pas utile uniquement pour les jeux.
Si l’on possède déjà un système éditorial capable de produire des versions de haute qualité en 12 langues, pourquoi ne pas conserver ces 12 langues comme noyau premium et utiliser un modèle local pour diffuser uniquement les articles populaires vers beaucoup d’autres langues de longue traîne, presque sans augmenter les dépenses d’API ?
Nous sommes partis de sous-titres de jeux.
Nous avons fini dans une réunion d’architecture de diffusion mondiale.
1. La traduction de jeux en temps réel repose en réalité sur quatre composants
Un overlay de traduction en temps réel ressemble à de la magie.
Une fois démonté, il devient encore plus intéressant.
Le pipeline de base est simple :
- Capturer une zone déterminée de l’écran du jeu.
- Utiliser l’OCR pour transformer le texte de l’image en texte exploitable.
- Traduire avec un moteur de traduction, un système NMT ou un LLM.
- Redessiner le texte traduit au-dessus du jeu avec un overlay semi-transparent.
Des projets Windows publics utilisent déjà cette architecture. OverlayTranslate applique l’OCR à une zone de l’écran et place la traduction sur l’emplacement d’origine. SubLens surveille continuellement une zone du jeu, détecte le nouveau texte, le traduit puis l’affiche dans un overlay transparent.[1][2]
Autrefois, il fallait « faire une capture, ouvrir un site de traduction, coller, lire, revenir au jeu ».
Aujourd’hui, c’est plutôt « indiquez à l’interprète où regarder et laissez-le installé à côté du jeu ».
L’humanité a apparemment décidé d’invoquer un interprète permanent à côté de chaque RPG non localisé.
2. Google Lens est utile, mais ce n’est pas un overlay de jeu persistant
Google Lens peut reconnaître des objets et du texte dans une image, sélectionner du texte et le traduire.[3]
Google Translate permet aussi de traduire des images. Sur ordinateur, on peut envoyer une image et traduire le texte qu’elle contient ; sur téléphone, la traduction via caméra est disponible. Google prévient lui-même que les petits caractères, le texte flou ou les polices très stylisées peuvent réduire la précision.[4]
Lens ressemble donc beaucoup aux « yeux » du système.
Mais l’outil décrit par mon ami va un cran plus loin.
Lens signifie essentiellement « lis cette image ».
Un overlay de jeu signifie « continue à surveiller cette zone et traite automatiquement chaque nouveau dialogue ».
La différence ne tient pas uniquement à la qualité de traduction.
Capture continue, détection de changements, cache, contrôle du focus de la fenêtre et redessin au bon endroit sont des détails d’ingénierie peu spectaculaires qui rendent pourtant l’expérience agréable.
L’IA obtient le titre.
La plomberie permet de finir le jeu.
3. « Google Translate n’est pas un LLM, non ? » est devenue une question plus compliquée en 2026
Si l’on pense à l’ancien Google Translate, il était raisonnable de le distinguer de systèmes comme ChatGPT.
Pendant longtemps, Google Translate s’est fortement appuyé sur de la traduction automatique neuronale spécialisée.
Mais en décembre 2025, Google a annoncé l’intégration des capacités de traduction de Gemini dans la traduction de texte de Google Translate, avec un meilleur traitement des idiomes, de l’argot et des expressions dépendantes du contexte.[5]
En février 2026, Translate a reçu des variantes et explications supplémentaires grâce aux capacités multilingues de Gemini.[6]
Pour la voix, Google a ensuite annoncé Gemini 3.5 Live Translate, capable de traduction parole-à-parole presque en temps réel dans plus de 70 langues.[7]
En 2026, affirmer simplement « Google Translate n’est pas un LLM » devient donc trop simpliste.
L’affirmation inverse le serait aussi. Rien ne permet de supposer que chaque requête Translate passe littéralement par une session générale de chat Gemini.
Google a rendu publique l’intégration de capacités de Gemini, pas toute son architecture interne de routage.
La frontière devient floue.
4. Google Translate gratuit pour le grand public et une API d’automatisation ne sont pas la même chose
À ce stade, une idée paraît évidente :
« Alors traduisons tous les articles gratuitement avec Google Translate. »
C’est tentant.
Mais le fait qu’une interface grand public ne facture pas chaque caractère ne signifie pas qu’il existe une API officielle, gratuite et illimitée pour une automatisation massive.
Le NMT standard de Cloud Translation inclut actuellement un crédit mensuel pour les 500 000 premiers caractères, puis un tarif standard affiché de 20 dollars par million de caractères.[8]
Prenons un article de 5 000 caractères.
Vers 50 langues, cela représente 250 000 caractères.
Deux articles atteignent 500 000.
Dix articles populaires par mois vers 50 langues représentent 2,5 millions de caractères. Après la partie gratuite, deux millions de caractères facturables coûteraient environ 40 dollars au tarif standard.
C’est peu.
Mais ce n’est pas zéro.
Google Cloud affiche aussi des tarifs séparés pour les caractères d’entrée et de sortie de son Translation LLM.[8]
Si l’absence totale de facture API récurrente est une exigence, la solution la plus propre n’est pas d’agrandir indéfiniment la traduction cloud. C’est d’ajouter une voie locale.
5. Les modèles locaux sont la voie naturelle pour une traduction sans coût API
C’est là que les modèles locaux deviennent intéressants.
MADLAD-400-3B-MT de Google est publié sur Hugging Face avec 419 langues indiquées et une licence Apache 2.0.[9]
Exécuté sur sa propre machine, il n’entraîne pas une facture API à chaque traduction.
Cela ne veut pas dire que le coût réel est littéralement nul.
Il consomme du CPU ou du GPU.
De l’électricité.
Du temps.
Mais le modèle économique change : ajouter des caractères ne signifie plus automatiquement payer davantage à un fournisseur cloud.
Il faut surtout éviter de lire « 419 langues prises en charge » comme « qualité humaine dans les 419 ».
Les langues disposant de peu de données peuvent présenter des écarts de qualité considérables.
La traduction locale ne doit donc pas remplacer les 12 langues premium.
Elle doit devenir une couche expérimentale peu coûteuse pour tester des langues auparavant trop chères à explorer.
6. C’est ici que le sujet passe des jeux à l’usine d’articles : on garde les 12 langues de qualité
Si un système éditorial produit déjà des versions de haute qualité dans 12 langues avec un LLM, aucune raison de les dégrader vers une traduction bon marché.
Ces 12 langues sont le vaisseau-mère.
Imaginons le japonais, l’anglais, le coréen, le chinois simplifié, le chinois traditionnel, l’espagnol, le portugais brésilien, l’indonésien, le thaï, le vietnamien, le français et l’allemand.
Si ces versions ont déjà subi restructuration du contexte, localisation naturelle, ajustement des titres et contrôle qualité, elles ne sont pas simplement 12 traductions.
Ce sont 12 représentations sémantiques déjà nettoyées.
Pour créer une langue supplémentaire, il n’est pas toujours nécessaire de repartir directement du japonais.
Pour certaines cibles, l’anglais, l’espagnol ou l’indonésien peuvent constituer de meilleurs pivots.
Mais les chaînes de traduction peuvent accumuler les erreurs.
Il faut donc tester plusieurs langues sources sur un petit benchmark et fixer, pour chaque cible, la route qui conserve le mieux les nombres, noms propres, négations, nuances et sens global.
7. Ne faites pas « tous les articles × toutes les langues ». La popularité sert de filtre
C’est la partie la plus séduisante.
Posséder 5 000 articles n’oblige pas à traduire 5 000 articles en 100 langues.
Commencez par les plus populaires.
Par exemple, avec les vues des 30 derniers jours :
- Top 10 : 50 langues supplémentaires.
- Rangs 11 à 50 : 20 langues supplémentaires.
- Le reste : uniquement les 12 langues premium.
Ou encore plus simple : chaque jour, prendre les 20 articles les plus vus et ne traduire que les combinaisons article-langue manquantes.
Une traduction créée reste un actif.
Ainsi, la carte du monde se remplit progressivement, à partir de contenus qui ont déjà prouvé leur demande.
Ce n’est pas « construire une infrastructure complète partout dès le premier jour ».
C’est « envoyer des éclaireurs presque gratuits puis déployer les moyens sérieux uniquement là où il y a une réponse ».
Plus intelligent.
Et beaucoup moins cher.
8. Trois niveaux de langue permettent à la demande de décider où investir la qualité
Les langues supplémentaires peuvent être séparées en trois niveaux.
Core : les 12 langues actuelles de haute qualité. Localisation LLM, QC strict, tous les articles.
Growth : les langues supplémentaires qui génèrent déjà du trafic réel. La traduction locale reste la base, mais la couverture augmente.
Experimental : les langues de longue traîne dont la demande est inconnue. Elles ne reçoivent que les articles populaires et leur indexation peut être limitée au départ.
La promotion dépend ensuite des visites, du taux de lecture complète, des clics vers l’article suivant et des retours.
Si personne ne lit une langue Experimental, elle reste telle quelle.
Si le polonais commence à fonctionner, il passe en Growth.
Si le turc progresse durablement et que le comportement des lecteurs est bon, il devient candidat au Core.
Cela réduit le besoin de réunions pour deviner « quelle langue va exploser ensuite ? »
La traduction elle-même devient une étude de marché.
9. Pour rester gratuit, le premier QC doit fonctionner sans LLM
Si chaque nouvelle traduction est envoyée à ChatGPT avec la question « est-ce correct ? », la stratégie gratuite cesse rapidement de l’être.
La première couche de QC devrait être déterministe.
Beaucoup de choses sont vérifiables automatiquement :
- nombres, pourcentages, devises et dates préservés ;
- URLs inchangées ;
- nombre de titres cohérent ;
- Markdown ou HTML valide ;
- titres et descriptions non vides ;
- absence d’un gros résidu de langue source ;
- compatibilité approximative avec l’écriture attendue ;
- suspicion de perte de négation ;
- noms propres anormalement déformés ;
- longueur aberrante.
Si nécessaire, le modèle local peut retraduire vers l’anglais et signaler uniquement les écarts sémantiques importants.
Ce n’est pas une évaluation parfaite.
Mais c’est très utile pour éviter une publication massive de traductions cassées.
L’intelligence coûteuse du LLM doit servir à réexaminer les cas suspects, pas à inspecter chaque sortie.
10. « 100 langues » compte moins que le fait d’éviter 100 tas de déchets
Il reste un dernier piège.
Créer 100 versions linguistiques ne multiplie pas automatiquement le trafic de recherche par 100.
Google Search Central recommande des URLs distinctes pour chaque version linguistique et des annotations hreflang pour les relier. Il recommande aussi que la langue visible de chaque page soit claire, dans le contenu comme dans la navigation.[10]
Google cite également la génération massive de pages à faible valeur via des transformations automatiques, traduction comprise, comme exemple de scaled content abuse lorsque le but principal est de manipuler les classements plutôt que d’aider les utilisateurs.[11]
Il n’est donc pas nécessaire d’indexer chaque page Experimental dès sa création.
On peut commencer en noindex.
Observer la qualité et la demande.
N’indexer ensuite que les langues qui passent le contrôle.
Le lecteur doit pouvoir réellement utiliser la page.
L’interface doit aussi être localisée.
Les URLs linguistiques et hreflang doivent être corrects.
Le sens doit être préservé.
Et l’article source doit avoir une vraie valeur.
C’est à cette condition que « davantage de langues » devient un actif au lieu d’une machine à multiplier les déchets.
Tout a commencé avec un ami qui parlait de jeux vidéo.
« On peut maintenant lire une zone de l’écran, traduire naturellement avec un LLM et superposer le résultat dans une fenêtre transparente. »
Cela a mené à Google Lens, puis à la frontière de plus en plus floue entre Google Translate et les LLM, aux tarifs d’API, puis aux modèles locaux.
L’architecture finale est étonnamment simple :
conserver les 12 langues premium intactes ;
diffuser uniquement les articles populaires vers des langues supplémentaires avec de la traduction locale et un coût marginal d’API presque nul ;
et n’investir en qualité supérieure que là où une demande réelle apparaît.
Nous avons commencé par superposer un sous-titre traduit à un jeu.
Nous avons fini par superposer de nouvelles couches linguistiques à tout un système éditorial.
La réutilisation technologique commence souvent par ce genre de détour parfaitement rationnel.
Références (11)
- OverlayTranslate — Windows overlay translation tool using OCR and multiple translation engines github.com
- SubLens — real-time OCR-powered game dialog translator with continuous scan and transparent overlay github.com
- Google Search Help — Google Lens can select text and translate supported text through Google Translate support.google.com
- Google Translate Help — image translation on desktop and mobile; Google notes lower accuracy for small, unclear, or stylized text support.google.com
- Google, 2025-12-12 — Bringing state-of-the-art Gemini translation capabilities to Google Translate blog.google
- Google, 2026-02-26 — AI-powered context and translation alternatives in Google Translate using Gemini capabilities blog.google
- Google, 2026-06-09 — Gemini 3.5 Live Translate, near-real-time speech-to-speech translation in more than 70 languages blog.google
- Google Cloud Translation pricing — NMT first 500,000 characters per month covered by free credit, then standard per-character pricing; Translation LLM priced separately cloud.google.com
- Google MADLAD-400-3B-MT on Hugging Face — 419 languages listed, Apache 2.0 huggingface.co
- Google Search Central — Managing multi-regional and multilingual sites; separate URLs and hreflang guidance developers.google.com
- Google Search Central — Spam policies; scaled content abuse includes low-value pages generated through automated transformations such as translating when created primarily to manipulate rankings developers.google.com
