Dejé demasiado en manos de la IA de mahjong y acabé como un “operador de IA” que casi nunca queda último, pero tampoco gana: el infierno de dominó de rascar unos puntos porcentuales en un juego del 25%

En mahjong de cuatro jugadores, si todos tienen exactamente la misma fuerza, la probabilidad inicial de quedar primero es del 25%. Ese es el primer dato cruel.

Publicidad
Publicidad

1. Conclusión: la IA de mahjong no multiplica mágicamente las victorias; acumula pequeños porcentajes

En mahjong de cuatro jugadores, si todos tienen exactamente la misma fuerza, la probabilidad inicial de quedar primero es del 25%. Ese es el primer dato cruel.

Ni un jugador de élite ni una IA fuerte convierten de repente la mitad de las partidas en victorias. En niveles altos, la ventaja aparece como pequeñas diferencias sostenidas: algunos primeros puestos más, algunos últimos menos, una tasa algo menor de perder al dar con un descarte la ficha ganadora al rival y decisiones que cambian con los puntos, la ronda, si eres Este, el valor de la mano y el riesgo.

El mahjong avanzado no es lanzar un ataque definitivo. Es trabajar en una fábrica de dominós: conservar una ficha segura, empujar una mano lista para ganar a falta de una ficha (tenpai) cuando tiene valor y buena espera, abandonar una pelea barata y mala, y jugar el último reparto según la clasificación necesaria. Cada decisión parece minúscula. Tras cientos de partidas completas (hanchan), la clasificación las recuerda todas.

Una precaución científica: no existe una buena estimación causal del tipo “estudiar con IA aumenta exactamente X puntos la tasa de primeros puestos de un humano”. La fuerza de una política de IA y el efecto educativo de usarla como profesora son preguntas distintas.

2. El cruel punto de partida del 25% en mahjong de cuatro

Con cuatro jugadores simétricos, cada posición promedia 25%. Por eso “si eres realmente bueno deberías ganar la mitad” es un modelo equivocado.

El mahjong contiene información oculta, robos aleatorios y tres rivales. Una buena decisión puede perder y una mala decisión puede ganar una mano. La habilidad se observa mejor en la distribución de posiciones y en la calidad de las decisiones a largo plazo que en una sesión aislada.

“Hoy no gané ninguna, mi estrategia está rota” es como diagnosticar el clima mundial mirando el tiempo de una sola tarde.

3. Suphx: cerca del 30% de primeros ya es una barbaridad

Suphx, de Microsoft Research, es uno de los sistemas de referencia de mahjong con aprendizaje profundo por refuerzo. En la evaluación publicada jugó 5.760 partidas completas (hanchan) en la sala experta de Tenhou y obtuvo un rango estable de 8,74, frente a 7,46 del grupo humano de élite usado como comparación.

La tabla 5 del artículo informa:

Métrica Suphx Humanos de élite Bakuuchi NAGA
1.º 29,3% 28,0% 28,0% 25,6%
4.º 18,7% 20,5% 22,4% 21,1%
Tasa de victoria de mano 22,83% - 23,07% 22,69%
Tasa de perder al dar la ficha ganadora con un descarte 10,06% - 12,16% 11,42%

Lo importante no es solo el 29,3%. Suphx tuvo simultáneamente la mayor tasa de primeros, la menor de cuartos y la menor tasa de ese tipo de derrota por descarte de esa tabla.

Eso rompe la explicación simplista de “para ganar más debes aceptar quedar último más veces”. Una política mejor puede mover ambos extremos en la dirección favorable.

Suphx también utiliza un sistema que predice la recompensa global (Global Reward Prediction) y conecta decisiones locales con el resultado final de toda la partida. La mejor decisión para una mano concreta no siempre es la mejor para la partida completa.

Y una advertencia: estos son datos de Tenhou, no de Mahjong Soul. El sistema de rango y la población de jugadores son distintos; 29,3% no es un objetivo universal que deba copiarse.

4. Los rangos altos son una fábrica de artesanos del dominó

En niveles iniciales, aprender eficiencia de fichas ya crea una diferencia enorme. Arriba, casi todos han recogido ese dinero gratis.

Las ventajas restantes son pequeñas: cuándo guardar una ficha segura, elegir entre una mejor espera o más valor, cuánto atacar contra un riichi —la declaración de una mano cerrada lista para ganar—, si merece la pena pelear con una mano que aún necesita un paso para llegar a tenpai (iishanten), cuánto cambia el riesgo si eres Este y cuándo un segundo puesto en las rondas del Sur debe perseguir el primero.

Una decisión parece insignificante. Quinientas repeticiones no lo son.

El nivel alto es la fábrica donde quien se ríe de un 0,5% acaba enterrado lentamente bajo valor esperado.

5. Si delegas demasiado, puedes convertirte en un “operador de IA que no conoce las reglas”

“¿Qué descarto?” → IA. “¿Abro la mano?” → IA. “¿Cuál es mi espera?” → IA. “¿Qué patrón de puntuación (yaku) tengo?” → La IA dice que se puede ganar.

El rendimiento puede subir antes que la comprensión. Quizá estés aprendiendo a operar un analizador de mahjong, no a jugar mahjong.

En psicología, usar herramientas externas para reducir el procesamiento mental interno se llama descarga cognitiva (cognitive offloading). La revisión de Risko y Gilbert describe cómo esa externalización reduce la carga cognitiva y también puede tener consecuencias cognitivas.

Además, un ensayo aleatorizado de 2025 con 120 universitarios encontró menor retención de conocimiento a los 45 días en un grupo que utilizó ChatGPT sin restricciones como apoyo de estudio frente a un grupo tradicional. No es un estudio de mahjong y no prueba una relación directa. Sí respalda una advertencia general: externalizar la respuesta no garantiza construir el proceso mental que la produce.

Es como seguir una guía hasta el jefe final y descubrir que el examen real era sobre el tutorial.

6. ¿Qué significa “no consigo primeros, pero tampoco muchos últimos”?

Por sí solo, no basta para diagnosticar nada. Al menos cuatro hipótesis encajan:

  1. Exceso de defensa: rechazas riesgos rentables y te concentras en segundo/tercero.
  2. Calidad de ataque: las declaraciones de riichi, las aperturas con chi/pon/kan, la velocidad o el valor no convierten oportunidades en primeros.
  3. Gestión de clasificación: en las rondas del Sur o en la última mano no persigues correctamente el primero cuando la situación lo permite.
  4. Varianza: la estrategia no cambió; la muestra reciente simplemente contiene menos primeros.

Por eso “pocos cuartos = juegas demasiado defensivo” no es un diagnóstico serio por sí mismo.

7. Con base científica no se puede declarar “exceso de defensa” solo con porcentajes de posición

Los datos agregados sufren un problema de identificación: mecanismos distintos pueden producir el mismo resultado.

Una distribución de 20% primeros y 15% últimos puede provenir de retirarse demasiado, mala suerte en manos de alto valor, mala gestión del final o simplemente ruido en unas cien partidas.

Suphx también rompe la historia simple de que defender bien reduce necesariamente los primeros: tuvo defensa extraordinaria y, a la vez, la mayor tasa de primeros de la tabla comparativa.

Para diagnosticar exceso de defensa hay que observar comportamiento condicionado: turno, distancia de la mano hasta quedar lista para ganar (shanten), calidad de espera, valor, si eres Este, posición actual, riichi rival y decisión concreta de seguir atacando o retirarte.

8. Una mala racha de 100 partidas puede ser puro ruido

Si suponemos una probabilidad real de primero del 25% y, de forma muy aproximada, tratamos cada partida completa como un ensayo de Bernoulli independiente, el margen de muestreo aproximado al 95% sería:

Partidas completas Margen aproximado alrededor del 25%
100 ±8,5 puntos porcentuales
500 ±3,8 puntos
1.000 ±2,7 puntos

Por tanto, un 20% de primeros en 100 partidas no demuestra que la estrategia se haya roto.

Mahjong Soul real no es una colección perfecta de ensayos independientes: cambian rivales, rangos, reglas y tu propia habilidad. La tabla solo sirve para visualizar cuánto puede oscilar una muestra corta.

La varianza del mahjong espera pacientemente a que digas “100 ya deberían bastar” para tocarte el hombro.

9. Convierte de nuevo a la IA en profesor: recoge razones, no solo respuestas

Un mejor ciclo de revisión es:

  1. Decide tu jugada antes de abrir la IA.
  2. Compárala con las candidatas del modelo.
  3. Pide una explicación de una frase: “¿por qué?”.
  4. Pregunta la condición de inversión: “¿qué tendría que cambiar para que la decisión contraria fuese correcta?”.
  5. Etiqueta el error: eficiencia, defensa, ataque/retirada, valor, apertura de mano, riichi o clasificación.
  6. Revisa errores repetidos en lugar de acumular infinitos consejos nuevos.

Las manos más útiles suelen ser las perdidas al dar con tu descarte la ficha ganadora al rival, las decisiones ajustadas entre atacar y retirarte, abrir o no abrir la mano, los grandes desacuerdos con la IA y las situaciones de las rondas del Sur o de la última mano.

MAKA de Mahjong Soul puede analizar registros de partidas clasificadas de cuatro jugadores y mostrar evaluaciones y consejos. Tras la partida sirve mejor como detector de patrones repetidos que como una hoja de respuestas.

10. Estadísticas que conviene revisar

Métrica Qué puede revelar
1.º/2.º/3.º/4.º Dónde se concentran tus puestos
Tasa de mano ganada Frecuencia de conversión en victoria
Derrotas por dar la ficha ganadora con un descarte Riesgo defensivo y pérdidas
Declaraciones de riichi Uso ofensivo de una mano cerrada en tenpai
Aperturas con chi/pon/kan Tendencia de velocidad y manos abiertas
Valor medio de victoria Calidad, no solo cantidad
Este / no Este Aprovechamiento del turno de Este
Rondas del Sur / última mano Gestión de clasificación

Mejor aún: condicionar la decisión de atacar o retirarte por turno, shanten, espera, valor, riichi rival, si eres Este y puntuación actual.

Entonces “últimamente no gano” empieza a ser un problema analizable.

11. La asistencia de IA en vivo es otro asunto: úsala para revisar después

Aprender con IA no es lo mismo que dejar que una herramienta externa elija jugadas durante una partida clasificatoria.

Los avisos oficiales de Mahjong Soul incluyen el uso de herramientas externas y otras conductas que dañan la equidad entre ejemplos de conductas prohibidas, con posibles sanciones de cuenta.

La línea segura es sencilla: juega tú; después analiza el registro con las herramientas de revisión permitidas, incluido MAKA.

Si no, puedes desbloquear la configuración más rara: rango alto, reglas internas cero. ¿Yaku? Pregunta a la IA. ¿Puntuación? El servidor sabrá.

12. Resumen: apila los dominós del 2%

  • En cuatro jugadores iguales, el punto de partida para ser primero es 25%.
  • Incluso Suphx ronda el 30%, no el 50%.
  • Una buena política puede aumentar primeros y reducir últimos a la vez.
  • “Pocos primeros + pocos últimos” no demuestra exceso de defensa.
  • Las muestras cortas son muy ruidosas.
  • Delegar demasiado en IA puede separar rendimiento de comprensión.
  • Pregunta no solo “¿qué?”, sino “¿por qué?” y “¿qué condición cambiaría la respuesta?”.

El mahjong de alto nivel consiste en acumular ventajas pequeñas.

Los dominós son aburridos. La clasificación los recuerda todos.

13. Referencias

  1. Li, J. et al. (2020). Suphx: Mastering Mahjong with Deep Reinforcement Learning. https://arxiv.org/abs/2003.13590
  2. Microsoft Research. Suphx: The World Best Mahjong AI. https://www.microsoft.com/en-us/research/project/suphx-mastering-mahjong-with-deep-reinforcement-learning/
  3. Mahjong Soul. MAKA AI-assisted game-log analysis. https://mahjongsoul.com/news/254
  4. Mahjong Soul. Notice on unfair conduct. https://mahjongsoul.com/news/24
  5. Risko, E. F., & Gilbert, S. J. (2016). Cognitive Offloading. https://doi.org/10.1016/j.tics.2016.07.002
  6. ChatGPT as a cognitive crutch (2025). https://doi.org/10.1016/j.ssaho.2025.102287
Publicidad
Mendoi-chan

Escrito por

Mendoi-chan

Convierte las fricciones del trabajo y la vida diaria en estructuras claras y próximos pasos prácticos.

Acerca del sitio
Publicidad

Artículos recientes

  1. 1¿Mejora la escritura de la IA al añadir reglas? — Cómo convertir a un editor profesional en un flujo de TypeScript
  2. 2¿Qué hace que una persona parezca “profunda”? — No apresura la respuesta, conserva la complejidad y aun así llega a una decisión
  3. 3Español (es)
  4. 4¿Por qué los personajes más fuertes del manga y el anime mueren, son sellados o pierden poder? El “impuesto de ¿por qué no mandan a Gojo?” en 30 personajes
  5. 5¿Qué llevaba aquel pequeño autobús policial? — El día en que, yendo a comer, aparecieron un posible vehículo de traslado y un coche con la tapa del combustible abierta

También te puede interesar

Publicidad