1. Conclusion : l’IA de mah-jong n’est pas une magie qui fait exploser le taux de victoire ; c’est une machine à empiler quelques points de pourcentage
Au mah-jong à quatre joueurs, si les quatre ont exactement le même niveau, le point de départ pour finir premier est de 25 %. C’est le premier fait brutal.
Ni un joueur d’élite ni une IA très forte ne se mettent soudain à gagner la moitié des parties. À haut niveau, l’avantage apparaît plutôt comme de petites différences durables : quelques premières places de plus, quelques dernières places de moins, un taux de deal-in légèrement inférieur, et des décisions qui changent selon le score, la manche, la position de dealer, la valeur de la main et le risque.
Le mah-jong de haut niveau ressemble donc moins à un coup spécial qu’à un poste dans une usine de dominos : conserver une tuile sûre, pousser un tenpai précieux avec une bonne attente, abandonner une mauvaise bataille pour peu de points, puis jouer la dernière main selon l’objectif de classement. Une décision paraît minuscule. Après des centaines de hanchan, le rating se souvient de tout.
Précision importante : on ne dispose pas d’une bonne étude causale permettant d’affirmer « étudier avec une IA augmente exactement de X points le taux de première place d’un humain ». La force d’une politique d’IA et l’effet pédagogique de l’IA sont deux questions différentes.
2. Le cruel point de départ à 25 % du mah-jong à quatre
Avec quatre joueurs symétriques, chaque rang vaut en moyenne 25 %. L’idée « un vrai fort devrait gagner une partie sur deux » est donc un mauvais modèle mental.
Le mah-jong contient beaucoup d’information cachée, des tirages aléatoires et trois adversaires. Une bonne décision peut perdre ; une mauvaise peut gagner une main. Le niveau apparaît donc mieux dans la distribution des places et la qualité des décisions à long terme que dans une seule session.
« Je n’ai pas fait premier aujourd’hui, donc ma stratégie est cassée » revient à diagnostiquer le climat mondial à partir de la météo d’un après-midi.
3. Suphx : environ 30 % de premières places, c’est déjà monstrueux
Suphx, développé par Microsoft Research, est un système de mah-jong fondé sur l’apprentissage profond par renforcement (deep reinforcement learning). Dans l’évaluation publiée, il a joué 5 760 hanchan dans la salle experte de Tenhou et atteint un stable rank de 8,74, contre 7,46 pour le groupe humain de haut niveau pris comme référence.
La Table 5 de l’article rapporte :
| Mesure | Suphx | Humains top | Bakuuchi | NAGA |
|---|---|---|---|---|
| 1re place | 29,3 % | 28,0 % | 28,0 % | 25,6 % |
| 4e place | 18,7 % | 20,5 % | 22,4 % | 21,1 % |
| Taux de mains gagnées | 22,83 % | - | 23,07 % | 22,69 % |
| Taux de deal-in | 10,06 % | - | 12,16 % | 11,42 % |
Le point intéressant n’est pas seulement 29,3 %. Suphx a simultanément le meilleur taux de premières places, le plus faible taux de quatrièmes et le plus faible taux de deal-in du tableau.
Cela casse l’histoire simpliste « pour gagner plus souvent, il faut accepter de finir dernier plus souvent ». Une meilleure politique peut améliorer les deux extrémités en même temps.
Suphx utilise aussi une méthode qui prédit la récompense finale de toute la partie, appelée Global Reward Prediction. Elle relie les décisions d’une manche au résultat final du hanchan : la meilleure décision pour une main isolée n’est pas forcément la meilleure pour toute la partie.
Attention cependant : ce sont des résultats Tenhou, pas Mahjong Soul. Le système de classement et la population de joueurs diffèrent ; 29,3 % n’est donc pas un objectif universel à recopier.
4. Les hauts rangs sont une usine d’artisans du domino
Au niveau débutant, apprendre l’efficacité des tuiles suffit déjà à créer un grand avantage. Plus haut, presque tout le monde a déjà ramassé cet argent gratuit.
Il reste des écarts plus fins : quand conserver une tuile sûre, choisir entre une meilleure attente et plus de valeur, jusqu’où pousser contre un riichi, si un iishanten mérite le combat, combien le statut de dealer change le risque, et si une deuxième place au Sud doit chasser la première ou protéger son classement.
Une décision paraît petite. Cinq cents répétitions ne le sont pas.
Le haut niveau est l’usine où ceux qui rient d’un écart de 0,5 % finissent doucement ensevelis sous une pile très polie d’espérance mathématique.
5. Trop déléguer peut créer un « opérateur d’IA qui ne connaît pas les règles »
« Je jette quoi ? » → IA. « Je call ? » → IA. « J’attends quoi ? » → IA. « C’est quel yaku ? » → L’IA dit que ça gagne.
Les performances peuvent progresser avant la compréhension. On peut apprendre à piloter un analyseur de mah-jong plutôt qu’à jouer au mah-jong.
En psychologie, utiliser des outils externes pour diminuer le traitement mental interne s’appelle le cognitive offloading, ou déchargement cognitif. La revue de Risko et Gilbert explique que cette externalisation réduit la charge cognitive mais peut aussi avoir des conséquences sur nos processus cognitifs.
Un essai randomisé de 2025 auprès de 120 étudiants a par ailleurs observé une rétention des connaissances à 45 jours plus faible dans le groupe utilisant ChatGPT sans restriction comme aide à l’étude que dans un groupe d’apprentissage traditionnel. Ce n’était pas une étude sur le mah-jong et cela ne constitue donc pas une preuve directe. Mais le message général est pertinent : externaliser la réponse ne garantit pas que l’on construise le mécanisme mental capable de produire cette réponse.
C’est l’équivalent de suivre un guide jusqu’au boss final, puis de découvrir que l’examen porte sur le tutoriel.
6. Que signifie « je n’arrive plus à finir premier, mais je finis rarement dernier » ?
Ce symptôme seul ne suffit pas. Au moins quatre hypothèses sont possibles :
- Défense excessive : on refuse même des risques rentables et on se concentre en deuxième/troisième place.
- Qualité de l’attaque : riichi, calls, vitesse ou valeur ne transforment pas les occasions en premières places.
- Gestion du classement : au Sud ou dans la dernière main, on ne poursuit pas correctement la première place quand la situation le permet.
- Variance : rien d’important n’a changé ; l’échantillon récent contient simplement moins de premières places.
Donc « peu de quatrièmes = trop défensif » n’est pas, à lui seul, un diagnostic scientifique.
7. Avec une approche de recherche, les taux de classement seuls ne permettent pas d’identifier la cause
Les statistiques agrégées souffrent d’un problème d’identification : des mécanismes différents peuvent produire le même résultat.
Un historique à 20 % de premières et 15 % de quatrièmes peut venir de trop de folds, de malchance sur les mains de forte valeur, d’une mauvaise gestion de fin de partie ou simplement du bruit d’une centaine de matchs.
Suphx lui-même casse le récit « une bonne défense réduit forcément les premières places ». Il défend extrêmement bien tout en affichant le meilleur taux de premières places du tableau comparatif.
Pour diagnostiquer une défense excessive, il faut du contexte : tour, shanten, qualité de l’attente, valeur de la main, statut de dealer, classement actuel, riichi adverse et décision réelle de push/fold.
8. Une mauvaise série de 100 parties peut n’être que du bruit
Supposons que la vraie probabilité de finir premier soit de 25 % et, de manière très approximative, que chaque hanchan soit un essai de Bernoulli indépendant. La marge d’échantillonnage à environ 95 % serait :
| Hanchan | Marge approximative autour de 25 % |
|---|---|
| 100 | ±8,5 points de pourcentage |
| 500 | ±3,8 points |
| 1 000 | ±2,7 points |
Ainsi, 20 % de premières places sur 100 hanchan ne prouve pas que la stratégie est cassée.
Le vrai Mahjong Soul n’est pas une suite parfaite d’essais indépendants : adversaires, rang, règles et propre niveau changent. Ce tableau est seulement une règle grossière pour sentir à quel point un petit échantillon peut bouger.
La variance du mah-jong attend poliment que vous disiez « cent parties, ça devrait suffire » avant de vous tapoter l’épaule par derrière.
9. Transformer à nouveau l’IA en professeur : récupérer des raisons, pas seulement des réponses
Une meilleure boucle de review :
- Choisir son coup avant d’ouvrir l’IA.
- Comparer avec les candidats de l’IA.
- Demander une raison en une phrase simple.
- Demander la condition d’inversion : « qu’est-ce qui devrait changer pour que le choix opposé devienne correct ? »
- Étiqueter l’erreur : efficacité, défense, push/fold, valeur, call, riichi ou classement.
- Revoir les erreurs récurrentes plutôt que collectionner une infinité de nouveaux conseils.
Les mains les plus utiles sont souvent les deal-ins, les décisions proches de push/fold, les call/no-call, les gros désaccords avec l’IA et les situations de Sud ou de dernière main.
MAKA dans Mahjong Soul peut analyser les historiques classés à quatre joueurs et afficher évaluations et conseils. Après la partie, il est plus utile comme détecteur de schémas d’erreurs répétées que comme simple corrigé.
10. Les statistiques qui valent la peine d’être suivies
| Mesure | Ce qu’elle peut révéler |
|---|---|
| 1re/2e/3e/4e | Où les résultats se concentrent |
| Taux de mains gagnées | Fréquence de conversion en victoire |
| Deal-in | Risque défensif et pertes |
| Taux de riichi | Usage offensif du tenpai fermé |
| Taux de calls | Tendance à ouvrir pour gagner de la vitesse |
| Valeur moyenne des gains | Qualité et pas seulement quantité |
| Dealer/non-dealer | Exploitation de la valeur du dealer |
| Sud/dernière main | Qualité de gestion du classement |
Encore mieux : analyser push/fold selon le tour, le shanten, l’attente, la valeur, le riichi adverse, le statut de dealer et le score actuel.
C’est alors seulement que « je ne gagne plus récemment » devient un problème analysable.
11. L’assistance IA en direct est un autre sujet : utiliser l’IA pour l’analyse après la partie
Étudier avec l’IA n’est pas la même chose que laisser un outil externe choisir les coups pendant une partie classée.
Les annonces officielles de Mahjong Soul citent l’usage d’outils externes et d’autres comportements portant atteinte à l’équité parmi les exemples de conduites interdites, pouvant entraîner des sanctions de compte.
La règle propre est simple : jouer soi-même ; analyser ensuite l’historique avec les outils autorisés, dont MAKA.
Sinon on débloque une build rare : haut rang, zéro règle en mémoire. Yaku ? Demandez à l’IA. Score ? Le serveur doit savoir.
12. Résumé : empiler les dominos de 2 %
- À niveau égal, le mah-jong à quatre commence à 25 % de chances de première place.
- Même Suphx tourne autour de 30 %, pas 50 %.
- Une bonne politique peut augmenter les premières places tout en réduisant les dernières.
- « Peu de premières + peu de dernières » ne prouve pas une défense excessive.
- Les petits échantillons sont très bruyants.
- Une délégation excessive à l’IA peut séparer performance et compréhension.
- Ne demandez pas seulement « quoi ? », mais aussi « pourquoi ? » et « quelle condition inverserait la réponse ? ».
Le mah-jong de haut niveau consiste à accumuler de minuscules avantages.
Les dominos sont ennuyeux. Le tableau de rating se souvient de chacun.
13. Références
- Li, J. et al. (2020). Suphx: Mastering Mahjong with Deep Reinforcement Learning. https://arxiv.org/abs/2003.13590
- Microsoft Research. Suphx: The World Best Mahjong AI. https://www.microsoft.com/en-us/research/project/suphx-mastering-mahjong-with-deep-reinforcement-learning/
- Mahjong Soul. MAKA AI-assisted game-log analysis. https://mahjongsoul.com/news/254
- Mahjong Soul. Notice on unfair conduct. https://mahjongsoul.com/news/24
- Risko, E. F., & Gilbert, S. J. (2016). Cognitive Offloading. https://doi.org/10.1016/j.tics.2016.07.002
- ChatGPT as a cognitive crutch (2025). https://doi.org/10.1016/j.ssaho.2025.102287
