Construyamos la IA más fuerte con IA — el bot de Shadowverse WB que empeoró al ver tres turnos ahora razona hacia atrás desde rutas de victoria, derrota y resultados “forzados” con alcance probado

Tema: Shadowverse: Worlds Beyond

Repetir un error diez mil veces no lo convierte en verdad.

Cómo usar las herramientas de lectura

Escuchar lee el artículo en voz alta. La lectura rápida muestra frases a tu ritmo. La práctica de idiomas compara las traducciones disponibles. Guardar añade un marcador en este navegador, accesible desde los guardados del reproductor.

Compartir este artículo

Compartir este artículo

Publicidad
Publicidad

1. Solo quería pegar a la cara y apareció un laboratorio

El objetivo era usar IA para encontrar el mazo más fuerte. Se fijaron Set 8, base de 826 cartas, commit del motor, hash del entorno, mazos legales y seeds. El baseline histórico de 12.480 partidas tuvo rule coverage 100%, unsupported 0 y rule gap 0, pero la IA cruda produjo resultados absurdos como Sword ~79,8% y Rune ~25,6%.

Repetir un error diez mil veces no lo convierte en verdad.

2. El consejo humano empeoró al bot y el promedio escondió incendios

human-prior-v1 se probó en 2.016 paired units / 4.032 games: baseline 50,99%, nuevo 49,36%, -1,64pt. Adaptive v2 ganó +0,74pt global pero Runecraft cayó -6,25pt y falló el leader floor; T11 también falló, incluido Abysscraft -16,67pt.

El consejo humano depende del contexto; un peso fijo puede matar ese contexto. Un promedio aprobado puede esconder una clase ardiendo.

3. El análisis causal encontró bugs del propio laboratorio

Se corrigieron un max_nodes=160 desconectado y un error de perspectiva actor/fixed-player que invertía conclusiones causales. Eso mejoró la plataforma de análisis, no el rendimiento general.

El programa Set 8 cerró tras 20 experimentos y 31.406 engine games en PAUSED_COMPLETE_NO_PROMOTION: 439 discordant units, 0 explicación causal completa, 11 parcial, 428 sin resolver. human-prior-v1 siguió activo y el final unseen holdout de 8.064 partidas quedó sellado.

4. 52 mazos jugaron 46.900 partidas y nació el ranking “cerebro apagado vs cerebro apagado”

El corpus tuvo 52 decks / 25 archetypes / 7 leaders. El análisis de mercado usó 46.900 partidas; un 7×7 directo separado, 1.512. Promedios: Buff Forest 71,99%, Rally Sword 65,97%, Midrange Abyss 54,17%, Artifact Portal 54,17%, Ramp Dragon 53,70%, Evolution Haven 31,71%, Calgidensula Witch 18,29%.

Son valores simulator-direct, no ladder WR. Los mazos donde lo bueno ahora sigue siendo bueno después parecieron más fáciles para la IA actual.

5. En torneos humanos Witch vivía en otro universo

En Dexel Rising Cup #2 del 8-8-2026, Hand Witch fue 116 de 384 listas, ~30,2%, la más usada. Calgidensula Witch quedó última en el 7×7 de IA con 18,29%. No son necesariamente las mismas 40 cartas, pero la brecha humano-IA es demasiado grande para ignorarla.

Rally Sword fue fuerte en ambos mundos, lo que sugiere que estrategias tolerantes a errores pueden ser más robustas para jugadores no expertos.

6. Future Optionality: reglas sí, orden y planes casi no

Se auditaron 7 leaders / 24 mechanics en RULE, STATE, VISIBILITY, IMMEDIATE VALUE, FUTURE VALUE, SEQUENCE, SEARCH y PLAN. En 27.810 decisions / 118.575 root candidates, solo 8.878, 7,49%, tenían future value explícito. rule/state/immediate 24/24 supported; sequence faltaba en 23/24 y plan en 20/24.

Witch mostró sensibilidad al orden de robo; Dragon, que PP y Awakening abren opciones futuras. Los 12 MYOPIC_REVERSAL de Dragon fueron ramp 6 + Awakening 6, pero no se convirtieron en bonuses fijos.

7. Se construyó un planner closed-loop real de tres turnos

El motor avanza al menos 3 future turn boundaries, ejecuta una sola acción, observa draw/random/opponent action y vuelve a planificar. No mira hidden hand ni future draw order.

Ablation: 56 games, 3.979/3.979 root actions, 3-turn completion 100%, hidden-info 0, 81.621 replans y 35.821 plan changes. La implementación funcionó; el rendimiento cayó -25,0 a -37,5pt vs human-prior-v1. Ver más lejos solo permitió equivocarse a mayor distancia.

8. Leaf calibration separó dónde se rompe el ranking

Se capturaron 3.979 root-action leaves, 1.009 unique leaves y 54.208 terminal rollout rows. De 73 primeras divergencias: leaf weighting 59, chance aggregation 12, opponent backup 2.

El sospechoso principal pasó a ser la valoración del leaf. Los 12 proxies Dragon anteriores solo cambiaron realmente hacia ramp en 1/12 con search real de tres turnos.

9. Learned value predijo mejor y eligió peor el mejor movimiento

Holdout v1.1 fresco: 727 leaves / 104 roots / 22.768 terminal rollouts, siete leaders. Brier 0,1144→0,0972 y pairwise 75,7→78,9% mejoraron.

Pero root argmax 59,6→39,4%, top2 73,1→64,4%, top3 82,7→76,0%, mean regret 4,42→5,29pt; Forest/Haven/Portal fallaron floors. HOLD_OFFLINE.

Predecir probabilidades mejor no equivale a escoger la mejor acción.

10. Ahora razonamos hacia atrás desde lethal

LETHAL ← daño ← PP ← cartas ← thresholds Spellboost/Awakening/Rally ← acción actual. Ramp no vale por “+8 puntos”; vale cuando una ruta real de victoria necesita llegar a 8PP a tiempo.

El objetivo genera requisitos hacia atrás y el motor real comprueba la ruta hacia delante.

11. También razonamos desde nuestra propia derrota

Desde SELF_LOSS se infieren daño necesario del rival, daño de mesa, daño adicional de mano, requisitos para quitar Ward, PP e información pública. Cada acción se evalúa por qué rutas de victoria enemigas corta.

Seguridad absoluta crea una IA que cura hasta perder educadamente. RISK_REQUIRED permite elegir una línea arriesgada no forzada cuando las líneas seguras casi no conservan probabilidad real de victoria.

12. “Forzado” necesita un alcance de prueba declarado

Victoria: PROVEN_WIN_NOW, FORCED_WIN_FULLY_OBSERVABLE_SUBTREE, FORCED_WIN_WITHIN_ENUMERATED_RESPONSE_SET, ROBUST_WIN_BELIEF, CONDITIONAL_WIN. Derrota separa igualmente proof, belief y conditional.

En proof search, self=OR y opponent=AND. Para certeza en chance deben cubrirse todos los outcomes alcanzables. Se prohíben hidden-hand truth, future draw order y strategy fusion; solo se replanifica después de observar.

13. La prioridad pasa de sumar puntos misteriosos a gates

Orden: proven win now → fully observable forced → enumerated forced → quitar forced loss evitable → maximizar expected final win probability → near-tie safety → robustness → route progress/cut → validated continuation value.

belief/conditional no son forced. Solo acciones peores tanto en posibilidad de victoria como en riesgo de derrota pueden eliminarse como strictly dominated.

14. Tres turnos son el mínimo, no una pared

Configuración inicial H_MIN=3, selective H_MAX=5. Solo se extienden ramas con lethal, forced response, threshold importante, delayed payoff o near tie sin resolver.

Rollouts 32/candidate y 64→128→256 para los mejores ambiguos. Roots: UNIQUE_BEST / PRACTICAL_TIE / UNRESOLVED. epsilon 0,02/0,03/0,05 se decide solo en development y se congela antes del nuevo holdout.

15. Nuevo QC: capturar errores seguros de sí mismos antes de buscar la IA más fuerte

Primary exige 0 hidden-info, future-draw, rule gap, strategy fusion, false proven, forced-scope mislabel, chance-completeness violation, lethal miss, avoidable forced loss y leakage. Luego se miden cobertura de 7 leaders, argmax, mean/p90/p95 regret, leader floors y top2 best-set.

Brier/pairwise/calibration son Secondary y no rescatan un fallo Primary. El holdout v1.1 está consumido para siempre.

Le dimos futuro y se volvió más débil. Le enseñamos probabilidades y predijo mejor pero eligió peor. Ahora razona hacia atrás desde ganar y perder, y solo llama “forzado” a lo que el alcance de evidencia realmente demuestra.

Construyamos la IA más fuerte con IA. Por ahora quizá el QC sea más fuerte que el bot; probablemente es sano.


PublicidadLibros sobre este tema

  • Co-Intelligence (edición en inglés)

    Ethan Mollick / Penguin Publishing Group / 2024

    Un libro sobre IA, el tema de este artículo.

  • The Coming Wave (edición en inglés)

    Mustafa Suleyman / Penguin Random House / 2023

    Un libro sobre IA, el tema de este artículo.

Este artículo contiene enlaces de afiliado (publicidad). Sobre la publicidad En calidad de Afiliado de Amazon, obtengo ingresos por las compras adscritas que cumplen los requisitos aplicables. As an Amazon Associate I earn from qualifying purchases.

Para leer hoy

Cada uno responde a una pregunta que suelen hacerse quienes leen este artículo.

Ver todos los artículosMás sobre Juegos de cartas y de mesa

Compartir este artículo

Publicidad

¿Otro más? ¿Algo divertido?

Ya que terminaste: un par de historias cercanas y otras totalmente distintas, pero divertidas.

  1. Tema cercano¿Se borraron mis datos?No: Ace solo estaba en el octavo pack — Shadowverse: Worlds Beyond, un falso desastre de transferencia y la “larga cola de personajes”
  2. No gastes 30 minutos en decidir un riesgo de 100 yenesla verdadera fuerza de “se me ocurrió y lo hice” está en comprimir el riesgo y la fricción de actuar
  3. Totalmente distinto, pero divertidoEl cuerpo humano es absurdamente incómodopor qué no existe un único “+1 de resistencia”
  4. ¿Por qué los niños tienen tanta energía?Del motor “me aburro → corro” a la calma de la adolescencia y el smartphone
  5. ¿Por qué está tan de moda el malatang?Lo probé y resultó ser un “juego de texturas” en el que el caldo salva a todo lo demás
  6. ¿La trampa de 199 yenes por 100 g?Por qué “¡qué barato!” se convierte en “espera, ¿es por 100 g?”

Buscar otros artículos

Todos los artículos

Mendoi-chan

Quién está detrás del sitio

Mendoi-chan

Convierte las fricciones del trabajo y la vida diaria en estructuras claras y próximos pasos prácticos.

Publicidad

Artículos recientes

  1. 1La humanidad no gana esto — Traté PRAGMATA como un museo lunar y terminé aterrorizado por la producción industrial de una civilización mecánica
  2. 2¿Por qué pierden todos mis ataques? — Un jugador de Pyra/Mythra contra la intangibilidad de Kazuya y la barriga del cocodrilo
  3. 3Para quienes tienen dificultad para hacer cosas solos: desmonta el “si nadie viene, no voy” y crea tu propio “SO de acción en solitario”
  4. 4la base lunar aguantó más que mi sistema de controles
  5. 5Una hipoteca a 50 años no abarata la vivienda — deuda, tipos de interés y vigilancia de la FSA japonesa

También te puede interesar

Publicidad