1. Todo empezó con algo simple: ganar en un juego de cartas
El objetivo original no era académico: subir PP, quitar Ward, Storm a la cara, ganar.
Pero cuando haces miles de partidas simuladas para comparar mazos aparecen preguntas: ¿es suerte?, ¿basta la media?, ¿qué pasa con un matchup terrible?, ¿cómo decides con una mano rival oculta?, ¿por qué una política nueva empeora?
De repente aparecen Monte Carlo, actualización bayesiana, equilibrio de Nash, programación dinámica, POMDP, optimización robusta, inferencia causal y contrafactuales.
La persona no necesita calcularlo todo mentalmente. La persona decide qué quiere saber; la IA y el código hacen repetición, registro, estadística y comparación.
2. Imagina inventar un puesto: “profesor de juego de cartas”
Entrenar una IA para jugar como una persona fuerte se parece a formar a un empleado nuevo.
El “becario” debe aprender mulligan, guardar cartas, usar Evolución, prever respuestas, planear dos o tres turnos, calcular lethal, controlar la mano y dejar espacio en mesa.
Así que se divide el trabajo: primero condición de victoria; luego recursos que no deben gastarse; por último, comprobar si mueres el turno siguiente.
Después la IA practica miles de partidas.
Cuatro mil partidas de prácticas ya no son prácticas. Es una fábrica de formación.
3. Seguir literalmente un consejo humano puede empeorar el juego
Las guías dicen “guarda esta carta”, “reserva SEP”, “rampa pronto”, “conserva las piezas de combo”. Suelen ser consejos correctos, pero con condiciones.
Guárdala, salvo que gastarla evite morir. Reserva Evolución, salvo que usarla ahora destruya el próximo turno rival. Rampa, salvo que perder la mesa te mate inmediatamente.
Las personas completan esas excepciones con experiencia. La IA puede no hacerlo.
Humano: “Normalmente se guarda.” IA: “Entendido.” IA: muere.
Seguir instrucciones y comprender el propósito son habilidades diferentes.
4. Búsqueda en árbol: leer “esta jugada, la siguiente y la siguiente”
Supongamos tres acciones: A eliminar una unidad, B atacar al líder, C guardar la carta.
Cada acción abre un futuro distinto y el rival tiene varias respuestas. Eso forma un árbol.
El problema es que las ramas explotan. Diez opciones por paso pueden convertirse en unas diez mil ramas en cuatro pasos.
Por eso usamos límites de profundidad, beam search para conservar ramas prometedoras y presupuestos de nodos para limitar el cálculo.
Pero podar demasiado pronto puede borrar una jugada débil ahora que sería fantástica dos turnos después.
Buscar no significa solo “mirar más lejos”. Significa decidir qué futuros merecen seguir vivos.
5. Las demás teorías tienen trabajos distintos
Monte Carlo: simular muchas veces y mirar el promedio.
Actualización bayesiana: cambiar la probabilidad de que el rival tenga algo según lo que hace.
POMDP: decidir cuando parte del estado real está oculto.
Minimax: asumir que el rival dará su mejor respuesta.
Equilibrio de Nash: estudiar situaciones donde cambiar unilateralmente no mejora fácilmente el resultado.
Aprendizaje sin arrepentimiento: reducir a largo plazo el “ojalá hubiera elegido otra cosa”.
Optimización robusta: buscar fuerza que no colapse en malos matchups.
CVaR: mirar la zona mala de resultados, no solo la media.
A/B emparejado: mismo seed, mazos y orden; solo cambia la política.
Intervalo de confianza: estimar cuánto de una diferencia puede ser ruido.
Ablación: quitar componentes uno a uno.
Contrafactual: probar qué habría pasado con otra acción desde el mismo estado.
Inferencia causal: comprobar si cambiar la supuesta causa cambia realmente el resultado.
Los nombres parecen jefes finales. En lenguaje normal: probar muchas veces, actualizar sospechas, mirar el peor caso, comparar justamente e investigar un sospechoso cada vez.
6. ¿Dónde acaba “universidad” y empieza “posgrado”?
Estadística, Monte Carlo, programación dinámica, teoría de juegos, Bayes y optimización pueden aparecer en grado.
Lo que suena más a investigación es el ciclo: detectar una regresión, dividir causas en hipótesis, definir qué evidencia debería aparecer, añadir trazas, cambiar una sola cosa, probar contrafactuales, usar datos no vistos y rechazar la política si falla.
El grado da una caja de herramientas. La investigación pregunta cómo usarla para producir evidencia convincente.
7. ¿Humanidades o STEM? Los problemas reales mezclan ambos
Árboles, algoritmos, probabilidad y aprendizaje por refuerzo son técnicos.
Teoría de juegos, Nash, Pareto, riesgo y decisión también viven en economía e investigación operativa.
La inferencia causal aparece en economía, medicina, ciencias sociales e IA.
Los problemas reales no respetan las paredes de las facultades.
Incluso una mesa de cartas puede convertirse en laboratorio interdisciplinario.
8. El valor real de la universidad o la formación profesional no es recordarlo todo
Pocos recuerdan cada fórmula años después.
Pero haber oído “Monte Carlo”, “Bayes”, “optimización” o “teoría de juegos” crea un índice mental.
Cuando aparece un problema puedes pensar: “Esto suena bayesiano”, “parece optimización”, “deberíamos compararlo bajo las mismas condiciones”.
Eso es mucho mejor que no saber ni qué buscar.
La educación crea un mapa de herramientas. La formación profesional funciona parecido: fundamentos primero; profundidad cuando el trabajo la exige.
9. La IA hace mucho más valioso “conocer lo básico”
Antes, conocer el nombre de una teoría podía no bastar si no sabías derivar las fórmulas, programarlo y ejecutar la estadística.
Ahora puedes orientar a la IA: “¿encaja Monte Carlo aquí?”, “¿esto es un problema de información parcial?”, “¿esta diferencia puede ser azar?”, “haz una ablación”.
La IA ayuda con implementación y cálculo.
El conocimiento básico pasa de “resolverlo todo solo” a saber qué trabajo intelectual pedir.
10. No tener “alergia al conocimiento” es una ventaja
POMDP, PSRO, CVaR, cluster bootstrap.
Las palabras intimidan.
Pero si reaccionas con “¿para qué sirve?” en lugar de “esto no es para mí”, ya has entrado.
POMDP: información oculta. PSRO: añadir buenas respuestas. CVaR: mirar malos resultados. Cluster bootstrap: medir incertidumbre respetando grupos relacionados.
No necesitas comprenderlo todo antes de tocarlo. Puedes tocarlo y profundizar después con IA.
11. Si tu memoria de trabajo se llena, mueve la memoria fuera de tu cabeza
Un juego de cartas ya exige mano, mesa, PP, Evolución, respuestas rivales, Ward, curación, lethal y turnos futuros.
La investigación añade seeds, hashes, configs, hipótesis, intervalos y registro histórico.
No tiene sentido memorizarlo todo.
Condiciones en configs, cálculos en código, historial en logs, comparaciones masivas en IA.
La mente humana conserva la pregunta y la sensación de “este resultado parece raro”.
No es hacer trampa. Es reservar el cerebro para el juicio.
12. Conclusión: quería hacer Storm a la cara y acabé entendiendo para qué sirve estudiar
Un juego de cartas conectó búsqueda, probabilidad, estadística, teoría de juegos, causalidad, educación e IA.
No necesitas dominar cada tema cuando lo estudias por primera vez.
Haberlo visto, conocer el nombre y no tener miedo ya crea una puerta de entrada para años después.
La IA reduce muchísimo el coste desde “me suena” hasta “puedo probarlo de verdad”.
La persona pregunta. La máquina calcula. Si el resultado parece raro, la persona vuelve a preguntar.
Y al final, el objetivo original sigue siendo sencillo.
Quitar Ward. Evolucionar.
Storm a la cara.
Curioso lugar para amortizar la educación.


