La idea terrorífica de un simulador de cartas es introducir manualmente nombre, coste, estadísticas, texto y casos especiales cientos de veces.
Pero si los datos ya existen en un formato estructurado y también existe un motor de batalla reutilizable, el problema cambia. Se importa la base de datos, se reutilizan efectos comunes y solo se programan mecánicas realmente nuevas.
En este caso, Beyond Decks ya tenía datos, mazos, seeds deterministas, replays, Battle Sim, IA y benchmarks.
No era “rehacer el juego”. Era añadir un laboratorio y un cerebro mejor a un mundo ya construido.
1. Sin animaciones, una partida dura ridículamente poco
El cliente real gasta tiempo en animaciones de robo, arrastrar cartas, voces, evolución, ataques, daño y pensamiento humano.
El simulador hace:
estado A
→ acciones legales
→ elegir
→ actualizar estado
→ estado B
hasta que alguien pierde.
La parte cara no es la presentación. Es cuánto futuro obligamos a analizar a la IA.
2. El simulador base resultó ser serio, no un juguete
Ya incluye seeds deterministas, replay, selección de objetivos, look-ahead táctico, planificación de turno completo, lethal solver, mecánicas de clase, benchmarks, auditoría de cobertura y checks runtime.
Su autor también aclara que la IA no pretende ser un oráculo perfecto de torneo: es intermedia.
Eso es ideal. Reglas, cartas, replays y máquina de combate ya existen. Falta sobre todo la capa de decisión parecida a la humana.
3. 12.480 partidas dieron Royal cerca de 79,8%—una gran muestra también amplifica los sesgos de la IA
El motor pasó bien la cobertura de reglas, pero Royal terminó cerca de 79,8% y Witch cerca de 25,6%.
No hay que gritar “Royal es invencible” solo porque hay muchas partidas.
Si Royal puede funcionar con “bajar unidad, ganar mesa, pegar a la cara” mientras un mazo complejo gasta piezas, evolución y mano sin pensar en el futuro, la IA está favoreciendo ciertos estilos.
Una gran muestra puede medir una política equivocada con una precisión impresionante.
4. Por eso se añadió conocimiento humano como hábito de pensamiento, no como respuesta fija
Se estructuraron mulligan, cartas a guardar, evolución, espacio de mano/mesa, cambio ataque-defensa, turnos fuertes rivales, planes alternativos, lethal a 2–3 turnos y errores comunes.
En vez de “siempre juega X”, se usan señales:
hold_value +20
future_combo_value +30
opponent_counter_cost +25
uso prematuro -40
La guía humana orienta la búsqueda; no la encadena.
5. Ahora se ejecutan 4.032 partidas reales—2.016 son condiciones A/B
56 grupos × 2 direcciones × 18 seeds = 2.016 condiciones
En cada condición juega una vez la política de referencia y una vez la política humana. El motor procesa 4.032 partidas reales.
2.016 es el número de preguntas iguales que reciben dos IAs.
6. Antes de la gran ejecución, se para y se valida
Se corrigió primero una regresión donde los finishers se usaban demasiado pronto. Después se hicieron smoke tests con DB y mazos reales.
También se revisan cobertura, cartas no soportadas, gaps de reglas, hashes, IDs duplicados, referencias y versiones del corpus.
Tras aprender que una IA mala puede producir 12.000 partidas muy obedientemente, la regla es: primero valida el experimento; luego paga el tamaño de muestra.
7. human-prior v1 aún no es adaptación completa
El mismo Ramp Dragon debería cambiar de objetivo:
normal → ramp
muere el próximo turno → defender
rival sin recursos → atacar
finisher sin setup → guardar
setup listo → finisher
Hay que recalcular qué objetivo importa ahora cada turno.
8. Adaptive AI cambia entre ATTACK / SURVIVE / SETUP / RESOURCE / LETHAL
Cada turno puntúa modos usando vida, mesa, mano, PP, evolución, presión rival, daño estimado y preparación del combo.
Si estás a 6 de vida frente a 14 de daño, SURVIVE debe superar a RESOURCE.
Adaptarse no es prohibir una carta hasta cierto turno. Es comparar constantemente el valor de jugar ahora contra esperar.
9. Mira 2–3 turnos al futuro, pero poda usando conocimiento humano
El árbol completo explota.
50 acciones legales
→ priors humanos: 20
→ evaluación barata: 10
→ búsqueda 2–3 turnos sobre esas 10
Una acción +8 ahora que te mata el próximo turno debe perder contra una +3 que permite sobrevivir y contraatacar.
10. Leer la mano oculta sería hacer trampa—modela “quizá la tenga”
Usa líder, arquetipo, cartas gastadas, mazo restante, tamaño de mano y acciones previas para construir varios mundos plausibles.
tiene AoE 30%
no tiene 70%
Evalúa la misma jugada en esos mundos.
Eso se acerca al razonamiento humano: “puede tenerlo, lo respeto un poco, pero no puedo respetarlo todo”.
11. El orden importa—no cambies la IA a mitad de las 4.032 partidas
La secuencia correcta es:
congelar v1
→ terminar 4.032
→ analizar errores
→ Adaptive v2
→ quick A/B
→ repetir ~2.016 condiciones
→ full ~12k
→ optimizar 40 cartas
→ diagnóstico de matchups
v2 debe responder a fallos observados, no a una lista de funciones que “suenan inteligentes”.
12. El objetivo no es una CPU que memoriza la guía, sino una que puede romperla cuando el tablero lo exige
Combina conocimiento humano, árbol de juego, evaluación futura, probabilidad de mano rival y objetivos dinámicos.
Entonces puede decir:
“Normalmente ramp, pero si muero defiendo.” “Normalmente guardo, pero si hay lethal gasto todo.” “Normalmente desarrollo, pero si el AoE es probable reservo recursos.”
La guía aconseja; el estado real decide.
13. El patrón sirve para más juegos: construye un laboratorio para ganar, no el juego entero
En Pokémon se puede reutilizar un simulador para optimizar equipo, selección, cambios y movimientos. En cartas, construcción, mulligan, recursos y política de matchup.
Rehacer el juego y estudiar cómo ganar son trabajos diferentes.
Si el simulador ya existe, úsalo.
No reconstruyas el estadio. Construye el laboratorio que aprende a ganar dentro.
Y si Royal vuelve a 80%, pregunta primero:
“¿Otra vez este bot sacó matrícula en ‘bajar unidad y pegar a la cara’?”
