Ich habe Mahjong zu sehr der KI überlassen und wurde zum „KI-Operator“, der selten Letzter wird, aber auch kaum gewinnt — die Domino-Hölle der wenigen Prozentpunkte in einem 25%-Spiel

Beim Vierer-Mahjong liegt die Ausgangswahrscheinlichkeit für Platz eins bei 25 %, wenn alle vier Spieler exakt gleich stark sind. Das ist die erste unangenehme

Artikel teilen
Werbung
Werbung

1. Fazit: Mahjong-KI ist kein Zauberknopf für riesige Siegquoten, sondern eine Maschine zum Stapeln weniger Prozentpunkte

Beim Vierer-Mahjong liegt die Ausgangswahrscheinlichkeit für Platz eins bei 25 %, wenn alle vier Spieler exakt gleich stark sind. Das ist die erste unangenehme Wahrheit.

Auch Elite-Spieler oder starke KIs gewinnen nicht plötzlich die Hälfte aller Partien. Auf hohem Niveau zeigt sich Stärke in kleinen, dauerhaften Unterschieden: ein paar Prozentpunkte mehr erste Plätze, einige letzte Plätze weniger, eine etwas niedrigere Deal-in-Rate und Entscheidungen, die sich an Punktestand, Runde, Dealer-Position, Handwert und Risiko anpassen.

Hochklassiges Mahjong ist daher weniger ein Superangriff als ein Job in einer Domino-Fabrik: einen sicheren Stein behalten, ein wertvolles Tenpai mit gutem Wait pushen, einen billigen schlechten Kampf aufgeben und die letzte Hand nach den nötigen Platzierungsbedingungen spielen. Eine Entscheidung wirkt winzig. Nach Hunderten Hanchan erinnert sich das Rating an jede einzelne.

Wissenschaftlich wichtig: Es gibt keine belastbare kausale Zahl wie „KI-Review erhöht die First-Place-Rate eines Menschen garantiert um X Prozentpunkte“. Die Stärke einer KI-Policy und der Lerneffekt beim Menschen sind zwei verschiedene Forschungsfragen.

2. Die brutale 25%-Basis im Vierer-Mahjong

Bei vier symmetrisch starken Spielern beträgt der Durchschnitt für jeden Rang 25 %. Das mentale Modell „wer richtig gut ist, muss die Hälfte gewinnen“ ist also falsch.

Mahjong enthält viele versteckte Informationen, zufällige Ziehungen und drei Gegner. Eine gute Entscheidung kann verlieren; eine schlechte kann eine Hand gewinnen. Können zeigt sich deshalb zuverlässiger in langfristigen Platzierungsverteilungen und in der Entscheidungsqualität als in einer einzelnen Session.

„Heute kein erster Platz, also ist meine Strategie kaputt“ ist ungefähr so sinnvoll, wie aus dem Wetter eines Nachmittags das Weltklima zu diagnostizieren.

3. Suphx: Rund 30 % erste Plätze sind bereits absurd stark

Suphx von Microsoft Research ist ein bedeutendes Mahjong-System auf Basis von Deep Reinforcement Learning, also tiefem bestärkendem Lernen. In der veröffentlichten Evaluation spielte es 5.760 Hanchan im Expertenraum von Tenhou und erreichte einen Stable Rank von 8,74; die Vergleichsgruppe der Top-Menschen lag bei 7,46.

Table 5 des Papers berichtet:

Kennzahl Suphx Top-Menschen Bakuuchi NAGA
1. Platz 29,3 % 28,0 % 28,0 % 25,6 %
4. Platz 18,7 % 20,5 % 22,4 % 21,1 %
Hand-Win-Rate 22,83 % - 23,07 % 22,69 %
Deal-in-Rate 10,06 % - 12,16 % 11,42 %

Interessant ist nicht nur die 29,3. Suphx hatte gleichzeitig die höchste First-Place-Rate, die niedrigste Fourth-Place-Rate und die niedrigste Deal-in-Rate der Vergleichstabelle.

Das zerstört die simple Geschichte „mehr erste Plätze müssen mit mehr letzten Plätzen bezahlt werden“. Eine bessere Policy kann beide Enden gleichzeitig verbessern.

Suphx verwendet außerdem eine Methode, die die endgültige Belohnung des gesamten Spiels vorhersagt, Global Reward Prediction. Dadurch werden lokale Rundenentscheidungen mit dem Endergebnis des ganzen Hanchan verbunden. Die beste Entscheidung für eine einzelne Hand ist nicht zwangsläufig die beste für das gesamte Spiel.

Wichtig: Das sind Tenhou-Daten, keine Mahjong-Soul-Daten. Ranking-System und Spielerpopulation unterscheiden sich; 29,3 % sollte daher nicht als universelles Ziel kopiert werden.

4. Hohe Ränge sind eine Fabrik von Domino-Handwerkern

Auf Anfängerniveau bringt allein bessere Effizienz beim Formen der Hand (Tile Efficiency) einen großen Vorteil. Auf hohen Rängen haben fast alle dieses Gratisgeld bereits eingesammelt.

Übrig bleiben feinere Unterschiede: wann ein sicherer Stein behalten wird, guter Wait gegen mehr Handwert, wie weit gegen Riichi gepusht wird, ob ein Iishanten den Kampf wert ist, wie Dealer-Status das Risiko verändert und wann Platz zwei im South Platz eins jagen oder die Platzierung schützen sollte.

Eine Entscheidung wirkt klein. Fünfhundert Wiederholungen sind nicht klein.

High Rank ist die Fabrik, in der Menschen, die über 0,5 % lachen, langsam unter einem sehr höflichen Haufen Erwartungswert (Expected Value) begraben werden.

5. Zu viel Auslagern kann einen „KI-Operator ohne Regelwissen“ erzeugen

„Was werfe ich ab?“ → KI. „Call?“ → KI. „Was ist mein Wait?“ → KI. „Welches Yaku ist das?“ → Die KI sagt, es geht auf.

Performance kann schneller steigen als Verständnis. Vielleicht lernt man, einen Mahjong-Analyzer zu bedienen, statt Mahjong zu lernen.

In der Psychologie heißt das Nutzen externer Werkzeuge zur Verringerung interner Denkarbeit cognitive offloading, also das Auslagern kognitiver Arbeit. Der Review von Risko und Gilbert beschreibt, dass diese Externalisierung kognitive Belastung reduziert, aber auch kognitive Folgen haben kann.

Eine randomisierte Studie von 2025 mit 120 Studierenden fand außerdem nach 45 Tagen eine geringere Wissensbehaltung in einer Gruppe, die ChatGPT uneingeschränkt als Lernhilfe nutzte, als in einer traditionellen Lerngruppe. Das war keine Mahjong-Studie und beweist daher keinen direkten Effekt. Die allgemeine Warnung passt jedoch: Eine Antwort auszulagern garantiert nicht, dass man den inneren Prozess aufbaut, der diese Antwort selbst erzeugen kann.

Das ist wie ein Walkthrough bis zum Endboss — und dann stellt sich heraus, dass die Prüfung über das Tutorial geht.

6. Was bedeutet „Ich werde kaum Erster, aber auch selten Letzter“?

Allein dieses Muster reicht für keine Diagnose. Mindestens vier Hypothesen passen:

  1. Übermäßige Defensive: profitable Risiken werden vermieden, wodurch Ergebnisse auf Platz zwei/drei komprimieren.
  2. Angriffsqualität: Riichi, Calls, Tempo oder Handwert verwandeln Chancen nicht in erste Plätze.
  3. Placement-Management: im South oder in der letzten Hand wird Platz eins nicht korrekt verfolgt, wenn die Situation es erlaubt.
  4. Varianz: Es hat sich strategisch nichts geändert; die jüngste Stichprobe enthält einfach weniger erste Plätze.

Darum ist „wenige vierte Plätze = zu defensiv“ allein keine wissenschaftliche Diagnose.

7. Forschungslogik: Platzierungsraten allein identifizieren die Ursache nicht

Aggregierte Statistiken haben ein Identifikationsproblem: verschiedene Mechanismen können dasselbe Ergebnis erzeugen.

20 % erste und 15 % vierte Plätze können durch zu viele Folds, Pech bei wertvollen Händen, schwaches Endgame-Management oder schlicht Stichprobenrauschen in etwa 100 Partien entstehen.

Suphx selbst widerspricht der simplen Erzählung „gute Verteidigung senkt die First-Rate“. Es verteidigte extrem stark und hatte trotzdem die höchste First-Place-Rate der Vergleichstabelle.

Für die Diagnose von Over-Defense braucht man Kontext: Zug, Shanten, Wait-Qualität, Handwert, Dealer-Status, aktuelle Platzierung, gegnerisches Riichi und die tatsächliche Push/Fold-Entscheidung.

8. Eine schlechte Phase über 100 Partien kann einfach Rauschen sein

Nehmen wir an, die wahre First-Place-Wahrscheinlichkeit sei 25 %, und behandeln wir sehr grob jedes Hanchan als unabhängigen Bernoulli-Versuch. Dann beträgt die ungefähre 95%-Stichprobenmarge:

Hanchan Ungefähre Marge um 25 %
100 ±8,5 Prozentpunkte
500 ±3,8 Punkte
1.000 ±2,7 Punkte

20 % erste Plätze in 100 Hanchan beweisen also nicht, dass die Strategie kaputt ist.

Echtes Mahjong Soul ist keine perfekte Folge unabhängiger identischer Versuche: Gegner, Rang, Regeln und eigene Spielstärke ändern sich. Die Tabelle ist nur ein grober Maßstab dafür, wie stark kleine Stichproben schwanken können.

Mahjong-Varianz wartet gern genau darauf, dass man sagt „100 Spiele sollten reichen“, bevor sie einem von hinten auf die Schulter tippt.

9. Die KI wieder zum Lehrer machen: Gründe sammeln, nicht nur Antworten

Ein besserer Review-Zyklus:

  1. Eigenen Zug festlegen, bevor man die KI öffnet.
  2. Mit den KI-Kandidaten vergleichen.
  3. Die Begründung in einem einfachen Satz verlangen.
  4. Nach der Umkehrbedingung fragen: „Was müsste sich ändern, damit die gegenteilige Entscheidung korrekt wird?“
  5. Fehler taggen: Effizienz, Defense, Push/Fold, Value, Call, Riichi oder Placement.
  6. Wiederkehrende Fehler wiederholen, statt endlos neue Tipps zu sammeln.

Besonders wertvoll sind Deal-ins, knappe Push/Fold-Spots, Call/No-Call, große Abweichungen von der KI und Placement-Situationen im South beziehungsweise in der letzten Hand.

MAKA in Mahjong Soul kann Logs von Vierer-Rangspielen analysieren und Bewertungen sowie Ratschläge anzeigen. Nach der Partie ist es am nützlichsten als Detektor wiederkehrender Entscheidungsmuster, nicht als bloßes Lösungsblatt.

10. Welche Statistiken man prüfen sollte

Kennzahl Was sie zeigen kann
1./2./3./4. Platz Wo sich Platzierungen sammeln
Hand-Win-Rate Wie oft Hände in Siege umgewandelt werden
Deal-in Defensives Risiko und Verluste
Riichi-Rate Offensive Nutzung geschlossener Tenpai
Call-Rate Tendenz zu Tempo durch offene Hände
Durchschnittlicher Gewinnwert Qualität statt nur Anzahl der Siege
Dealer/non-dealer Nutzung des Dealer-Werts
South/letzte Hand Qualität des Placement-Managements

Noch besser ist es, Push/Fold nach Zug, Shanten, Wait, Handwert, gegnerischem Riichi, Dealer-Status und aktuellem Score zu analysieren.

Erst dann wird „in letzter Zeit werde ich nie Erster“ zu einem analysierbaren Datenproblem.

11. Live-KI-Unterstützung ist ein anderes Thema: KI für Post-Game-Review nutzen

Mit KI zu lernen ist nicht dasselbe, wie während eines Rangspiels ein externes Tool Züge auswählen zu lassen.

Offizielle Hinweise von Mahjong Soul nennen die Nutzung externer Tools und andere Handlungen, die die Fairness beeinträchtigen, als Beispiele verbotenen Verhaltens und weisen auf mögliche Account-Sanktionen hin.

Die saubere Grundregel ist einfach: selbst spielen; danach den Log mit erlaubten Review-Werkzeugen wie MAKA analysieren.

Sonst schaltet man einen seltenen Build frei: hoher Rang, internes Regelwissen null. Yaku? Frag die KI. Punkte? Der Server wird’s wissen.

12. Zusammenfassung: Staple die 2%-Dominos

  • Bei vier gleich starken Spielern liegt die First-Basis bei 25 %.
  • Selbst Suphx liegt ungefähr bei 30 %, nicht bei 50 %.
  • Eine starke Policy kann mehr erste und weniger letzte Plätze gleichzeitig erzeugen.
  • „Wenige erste + wenige letzte“ beweist keine übermäßige Defensive.
  • Kleine Stichproben sind stark verrauscht.
  • Zu viel kognitives Auslagern an KI kann Performance und Verständnis voneinander trennen.
  • Nicht nur „was?“ fragen, sondern „warum?“ und „welche Bedingung würde die Antwort umdrehen?“.

Mahjong auf hohem Niveau ist das Sammeln winziger Vorteile.

Dominos sind langweilig. Die Rating-Tabelle erinnert sich an jeden einzelnen.

  1. Li, J. et al. (2020). Suphx: Mastering Mahjong with Deep Reinforcement Learning. https://arxiv.org/abs/2003.13590
  2. Microsoft Research. Suphx: The World Best Mahjong AI. https://www.microsoft.com/en-us/research/project/suphx-mastering-mahjong-with-deep-reinforcement-learning/
  3. Mahjong Soul. MAKA AI-assisted game-log analysis. https://mahjongsoul.com/news/254
  4. Mahjong Soul. Notice on unfair conduct. https://mahjongsoul.com/news/24
  5. Risko, E. F., & Gilbert, S. J. (2016). Cognitive Offloading. https://doi.org/10.1016/j.tics.2016.07.002
  6. ChatGPT as a cognitive crutch (2025). https://doi.org/10.1016/j.ssaho.2025.102287
Werbung

Weitere Artikel finden

Alle Artikel

Mendoi-chan

Verfasst von

Mendoi-chan

Sie macht Reibungen im Beruf und Alltag als klare Struktur und konkrete nächste Schritte verständlich.

Über diese Website
Werbung

Neueste Artikel

  1. 118 Stunden Schlaf an einem Tag: Erholung oder ein Warnzeichen?
  2. 2Muss man sich wirklich entschuldigen, weil man den Eltern „keine Enkel geschenkt“ hat? Manchmal bedeutet es schon viel, wenn das erwachsene Kind nach Hause kommt und mit ihnen isst
  3. 3Der Tag, an dem eine 40-jährige VTuber zum „digitalen Bürgerhaus“ wurde: Alter zerstört Nachfrage nicht zwangsläufig – manchmal verändert es nur ihre Form
  4. 4Senior-Engineering per Smartphone an einen KI-Agenten delegiert — und der Umzug war früher fertig
  5. 5Wie aus KI-Artikelautomatisierung in etwa einer Woche eine „autonome Fabrik“ wurde: ein Ultra-Schlag, Level 6 und warum Level 7 noch warten kann

Das könnte Sie interessieren

Werbung