Vor Kurzem erzählte mir ein Freund von modernen Übersetzungswerkzeugen für Spiele.
Man markiert einen Bereich des Bildschirms, die Software liest den dort erscheinenden Text und zeigt die Übersetzung in einem halbtransparenten Fenster an. Es gibt etwas Verzögerung, aber wenn die Übersetzungsstufe ein LLM nutzt, werden nicht nur Wörter mechanisch ersetzt. Dialoge können kontextabhängig natürlicher umformuliert werden.
Meine erste Reaktion war simpel:
„Moment. Sind wir schon an dem Punkt, an dem man fremdsprachige Spiele spielen kann, ohne auf einen Übersetzungspatch zu warten?“
Dann geriet die Recherche komplett vom Thema ab.
OCR liest den Bildschirm.
Ein Übersetzungsmodell interpretiert die Bedeutung.
Ein Overlay legt das Ergebnis wieder über die ursprüngliche Oberfläche.
Diese Architektur ist offensichtlich nicht nur für Spiele nützlich.
Wenn bereits ein Artikelsystem existiert, das hochwertige Versionen in 12 Sprachen erzeugt, warum sollte man diese 12 nicht als Premium-Kern behalten und nur populäre Artikel mit einem lokalen Übersetzungsmodell in viele zusätzliche Long-Tail-Sprachen verteilen — fast ohne zusätzliche API-Kosten?
Wir begannen mit Spieluntertiteln.
Am Ende saßen wir gedanklich in einer Besprechung über globale Publishing-Architektur.
1. Echtzeit-Spielübersetzung besteht im Grunde aus vier Bausteinen
Ein Übersetzungs-Overlay wirkt wie Magie.
In Einzelteile zerlegt wird es noch interessanter.
Der Grundablauf:
- Einen bestimmten Bereich des Spielbildschirms erfassen.
- Mit OCR den Text im Bild in maschinenlesbaren Text umwandeln.
- Mit Übersetzungs-Engine, NMT oder LLM übersetzen.
- Den übersetzten Text als halbtransparentes Overlay wieder über dem Spiel darstellen.
Öffentliche Windows-Projekte verwenden diese Architektur bereits. OverlayTranslate liest einen Bildschirmbereich per OCR und legt die Übersetzung über die ursprüngliche Position. SubLens überwacht kontinuierlich einen Bereich des Spiels, erkennt neuen Text, übersetzt ihn und zeigt das Ergebnis in einem transparenten Overlay.[1][2]
Früher hieß der Ablauf: „Screenshot machen, Übersetzungsseite öffnen, einfügen, lesen, zurück zum Spiel.“
Heute ist es eher: „Sag dem Dolmetscher, wohin er schauen soll, und lass ihn neben dem Spiel sitzen.“
Die Menschheit hat offenbar beschlossen, jedem nicht lokalisierten RPG einen dauerhaft anwesenden Dolmetscher zu beschwören.
2. Google Lens ist praktisch, aber nicht dasselbe wie ein permanentes Spiel-Overlay
Google Lens kann Objekte und Text in Bildern erkennen, Text auswählen und übersetzen.[3]
Auch Google Translate unterstützt Bildübersetzung. Auf dem PC kann man ein Bild hochladen und den darin enthaltenen Text übersetzen; auf Smartphones gibt es kamerabasierte Übersetzung. Google weist selbst darauf hin, dass kleine, unscharfe oder stark stilisierte Schrift die Genauigkeit verringern kann.[4]
Lens kommt den „Augen“ des Systems also sehr nahe.
Das von meinem Freund beschriebene Werkzeug geht aber einen Schritt weiter.
Lens bedeutet: „Lies dieses Bild.“
Ein Spiel-Overlay bedeutet: „Beobachte diesen Bereich dauerhaft und verarbeite jeden neuen Dialog automatisch.“
Der Unterschied liegt nicht nur in der Übersetzungsqualität.
Kontinuierliche Erfassung, Änderungserkennung, Cache, Fensterfokus und das erneute Zeichnen des Textes an der richtigen Position sind unspektakuläre technische Details, die das Ganze im Spiel erst angenehm machen.
Die KI bekommt die Schlagzeile.
Die Rohrleitungen bringen dich durch das Spiel.
3. „Google Translate ist doch kein LLM, oder?“ wurde 2026 komplizierter
Wenn man an das frühere Google Translate denkt, war die Trennung von Systemen wie ChatGPT sinnvoll.
Lange Zeit setzte Google Translate stark auf spezialisierte neuronale maschinelle Übersetzung.
Im Dezember 2025 kündigte Google jedoch an, Gemini-Übersetzungsfähigkeiten in die Textübersetzung von Google Translate zu integrieren, insbesondere für natürlichere Behandlung von Redewendungen, Slang und kontextabhängigen Ausdrücken.[5]
Im Februar 2026 kamen zusätzliche Alternativen und Erklärungen auf Basis der mehrsprachigen Gemini-Fähigkeiten hinzu.[6]
Für Sprache kündigte Google später Gemini 3.5 Live Translate an, mit nahezu Echtzeit-Sprachübersetzung in über 70 Sprachen.[7]
Darum ist die pauschale Aussage „Google Translate ist kein LLM“ im Jahr 2026 zu grob.
Die Gegenbehauptung wäre ebenfalls zu grob. Wir sollten nicht annehmen, dass jede Translate-Anfrage wörtlich in einer allgemeinen Gemini-Chat-Sitzung landet.
Google hat die Integration von Gemini-Fähigkeiten veröffentlicht, nicht die gesamte interne Routing-Architektur.
Die Grenze wird unschärfer.
4. Kostenloses Google Translate für Nutzer und eine Automatisierungs-API sind zwei verschiedene Dinge
An diesem Punkt liegt ein Gedanke nahe:
„Dann übersetzen wir einfach alle Artikel kostenlos mit Google Translate.“
Verlockend.
Aber eine Consumer-Oberfläche ohne Abrechnung pro Zeichen bedeutet nicht, dass es eine offizielle, unbegrenzt kostenlose API für Massenautomatisierung gibt.
Cloud Translation NMT bietet derzeit monatlich Guthaben für die ersten 500.000 Zeichen; danach liegt der angegebene Standardpreis bei 20 US-Dollar pro Million Zeichen.[8]
Nehmen wir einen Artikel mit 5.000 Zeichen.
In 50 Sprachen sind das 250.000 Zeichen.
Zwei Artikel ergeben 500.000.
Zehn populäre Artikel pro Monat in 50 Sprachen ergeben 2,5 Millionen Zeichen. Nach dem kostenlosen Anteil blieben zwei Millionen abrechenbare Zeichen, also etwa 40 US-Dollar zum Standardpreis.
Günstig.
Aber nicht null.
Google Cloud weist für sein Translation LLM zudem getrennte Preise für Ein- und Ausgabe aus.[8]
Wenn „keine laufende API-Rechnung“ eine harte Vorgabe ist, besteht die sauberere Architektur nicht in unbegrenzt wachsender Cloud-Übersetzung, sondern in einer eigenen lokalen Übersetzungsspur.
5. Lokale Übersetzungsmodelle sind der natürliche Weg für eine API-kostenfreie Spur
Hier werden lokale Modelle interessant.
Googles MADLAD-400-3B-MT ist auf Hugging Face mit 419 angegebenen Sprachen und Apache-2.0-Lizenz veröffentlicht.[9]
Auf eigener Hardware gibt es keine API-Rechnung pro Übersetzung.
Das bedeutet natürlich nicht, dass die realen Kosten buchstäblich null sind.
CPU oder GPU werden genutzt.
Strom wird verbraucht.
Zeit wird verbraucht.
Aber das Skalierungsmodell verändert sich: Mehr Zeichen bedeuten nicht automatisch mehr Geld für einen Cloud-Anbieter.
Die wichtigste Einschränkung lautet: „419 unterstützte Sprachen“ bedeutet nicht „menschliche Qualität in allen 419 Sprachen“.
Gerade bei ressourcenarmen Sprachen kann die Qualität stark schwanken.
Lokale Übersetzung sollte daher die Premium-12 nicht ersetzen.
Sie sollte die günstige Experimentierschicht für Sprachen sein, die sich früher wirtschaftlich kaum testen ließen.
6. Hier springt das Thema vom Spiel zur Artikel-Fabrik: Die hochwertigen 12 bleiben
Wenn ein Publishing-System bereits hochwertige Versionen in 12 Sprachen mit LLM erzeugt, gibt es keinen Grund, diese auf billige maschinelle Übersetzung herunterzustufen.
Diese 12 sind das Mutterschiff.
Nehmen wir Japanisch, Englisch, Koreanisch, vereinfachtes Chinesisch, traditionelles Chinesisch, Spanisch, brasilianisches Portugiesisch, Indonesisch, Thai, Vietnamesisch, Französisch und Deutsch.
Wenn diese Versionen bereits Kontextbereinigung, natürliche Lokalisierung, Anpassung von Überschriften und Qualitätskontrollen durchlaufen haben, sind sie nicht nur 12 Übersetzungen.
Sie sind 12 bereits bereinigte semantische Darstellungen.
Für eine zusätzliche Sprache muss nicht immer direkt aus dem Japanischen übersetzt werden.
Für manche Ziele könnten Englisch, Spanisch oder Indonesisch bessere Pivot-Sprachen sein.
Übersetzungsketten können jedoch Fehler ansammeln.
Darum sollte die Quellsprache nicht nur nach Bauchgefühl gewählt werden. Mehrere Quellen sollten auf einem kleinen Benchmark verglichen und pro Zielsprache die Route festgelegt werden, die Zahlen, Eigennamen, Verneinungen, Einschränkungen und Gesamtbedeutung am besten erhält.
7. Nicht „alle Artikel × alle Sprachen“. Popularität ist der Filter
Das ist der attraktivste Teil.
5.000 Artikel bedeuten nicht, dass 5.000 Artikel in 100 Sprachen übersetzt werden müssen.
Man beginnt bei den beliebten Artikeln.
Zum Beispiel anhand der letzten 30 Tage:
- Top 10: 50 zusätzliche Sprachen.
- Plätze 11–50: 20 zusätzliche Sprachen.
- Rest: nur die hochwertigen 12.
Oder noch einfacher: Jeden Tag die 20 beliebtesten Artikel nehmen und nur fehlende Artikel-Sprache-Kombinationen übersetzen.
Einmal erzeugte Übersetzungen bleiben als Vermögenswert erhalten.
So färbt sich die Weltkarte Tag für Tag weiter ein, beginnend mit Inhalten, deren Nachfrage bereits bewiesen ist.
Das ist nicht „am ersten Tag weltweit vollständige Infrastruktur aufbauen“.
Es ist „fast kostenlose Späher aussenden und die Hauptressourcen nur dort einsetzen, wo Reaktion entsteht“.
Intelligenter.
Und deutlich billiger.
8. Drei Sprachstufen lassen die Nachfrage über Qualitätsinvestitionen entscheiden
Zusätzliche Sprachen lassen sich in drei Stufen einteilen.
Core: die bestehenden hochwertigen 12. LLM-Lokalisierung, strenge QC, alle Artikel.
Growth: zusätzliche Sprachen mit echtem Traffic. Lokale Übersetzung bleibt Standard, aber die Abdeckung wächst.
Experimental: Long-Tail-Sprachen mit unbekannter Nachfrage. Nur populäre Artikel werden übersetzt, und die Indexierung kann anfangs begrenzt sein.
Danach wird anhand von Besuchen, Lesefortschritt, Klicks zum nächsten Artikel und Wiederkehr hochgestuft.
Liest niemand eine Experimental-Sprache, bleibt sie dort.
Funktioniert Polnisch, steigt es zu Growth auf.
Wächst Türkisch stabil und ist das Leser-Verhalten gut, wird es Core-Kandidat.
Damit sinkt die Notwendigkeit von Besprechungen mit der Frage: „Welche Sprache wird als Nächstes groß?“
Die Übersetzung selbst wird zur Marktforschung.
9. Wer kostenlos bleiben will, sollte die erste QC-Schicht ohne LLM bauen
Wenn jede neue Übersetzung an ChatGPT mit „Ist das korrekt?“ geschickt wird, ist die kostenlose Strategie schnell nicht mehr kostenlos.
Die erste QC-Schicht sollte deterministischer Code sein.
Vieles lässt sich automatisch prüfen:
- Zahlen, Prozentwerte, Währungen und Daten bleiben erhalten;
- URLs bleiben unverändert;
- die Zahl der Überschriften bricht nicht ein;
- Markdown oder HTML bleibt gültig;
- Titel und description sind nicht leer;
- es bleibt nicht übermäßig viel Quellsprache übrig;
- die Ausgabe passt ungefähr zum erwarteten Schriftsystem;
- Verneinungen scheinen nicht zu verschwinden;
- Eigennamen werden nicht grotesk verändert;
- die Ausgabe ist nicht absurd kurz oder lang.
Falls nötig, kann das lokale Modell zurück ins Englische übersetzen und nur große Bedeutungsabweichungen markieren.
Das ist keine perfekte Qualitätsbewertung.
Aber es hilft sehr, kaputte Übersetzungen nicht massenhaft zu veröffentlichen.
Teure LLM-Intelligenz sollte verdächtige Fälle nachprüfen, nicht alles kontrollieren.
10. „100 Sprachen“ ist weniger wichtig als zu verhindern, dass daraus 100 Müllhaufen werden
Es gibt noch eine letzte Falle.
100 Sprachversionen bedeuten nicht automatisch das Hundertfache an Suchtraffic.
Google Search Central empfiehlt unterschiedliche URLs pro Sprachversion und hreflang-Verknüpfungen. Außerdem sollte die sichtbare Sprache einer Seite sowohl im Inhalt als auch in der Navigation eindeutig sein.[10]
Google nennt auch massenhaft erzeugte Seiten mit geringem Wert durch automatische Transformationen, einschließlich Übersetzungen, als Beispiel für scaled content abuse, wenn das Hauptziel Ranking-Manipulation statt Nutzerhilfe ist.[11]
Darum muss nicht jede Experimental-Seite sofort indexiert werden.
Bei Bedarf mit noindex starten.
Qualität und Nachfrage beobachten.
Nur Sprachen in den Index aufnehmen, die den Qualitäts-Gate bestehen.
Leser müssen die Seite wirklich nutzen können.
Auch die Oberfläche muss lokalisiert sein.
Sprach-URLs und hreflang müssen stimmen.
Die Bedeutung muss erhalten bleiben.
Und der Ausgangsartikel muss echten Wert haben.
Erst dann werden mehr Sprachen zu einem Vermögenswert statt zu einer Müllvervielfältigungsmaschine.
Alles begann mit einem Freund, der von Spielen erzählte.
„Man kann heute einen Bildschirmbereich lesen, mit einem LLM natürlich übersetzen und das Ergebnis halbtransparent darüberlegen.“
Das führte zu Google Lens, zur immer unschärferen Grenze zwischen Google Translate und LLMs, zu API-Preisen und schließlich zu lokalen Übersetzungsmodellen.
Die endgültige Architektur ist überraschend simpel:
Die hochwertigen 12 Sprachen bleiben unverändert.
Nur populäre Artikel werden mit lokaler Übersetzung fast ohne zusätzliche API-Kosten in weitere Sprachen verteilt.
Nur Sprachen mit echter Nachfrage steigen in eine höhere Qualitätsstufe auf.
Wir begannen damit, eine übersetzte Untertitelzeile über ein Spiel zu legen.
Am Ende legten wir neue Sprachschichten über ein gesamtes Publishing-System.
Technologietransfer beginnt oft mit genau dieser Art von vollkommen vernünftigem Abschweifen.
共通参考資料 / Shared Sources
Quellen (11)
- OverlayTranslate — Windows overlay translation tool using OCR and multiple translation engines github.com
- SubLens — real-time OCR-powered game dialog translator with continuous scan and transparent overlay github.com
- Google Search Help — Google Lens can select text and translate supported text through Google Translate support.google.com
- Google Translate Help — image translation on desktop and mobile; Google notes lower accuracy for small, unclear, or stylized text support.google.com
- Google, 2025-12-12 — Bringing state-of-the-art Gemini translation capabilities to Google Translate blog.google
- Google, 2026-02-26 — AI-powered context and translation alternatives in Google Translate using Gemini capabilities blog.google
- Google, 2026-06-09 — Gemini 3.5 Live Translate, near-real-time speech-to-speech translation in more than 70 languages blog.google
- Google Cloud Translation pricing — NMT first 500,000 characters per month covered by free credit, then standard per-character pricing; Translation LLM priced separately cloud.google.com
- Google MADLAD-400-3B-MT on Hugging Face — 419 languages listed, Apache 2.0 huggingface.co
- Google Search Central — Managing multi-regional and multilingual sites; separate URLs and hreflang guidance developers.google.com
- Google Search Central — Spam policies; scaled content abuse includes low-value pages generated through automated transformations such as translating when created primarily to manipulate rankings developers.google.com
