1. Solo quería pegar a la cara y apareció un laboratorio
El objetivo era usar IA para encontrar el mazo más fuerte. Se fijaron Set 8, base de 826 cartas, commit del motor, hash del entorno, mazos legales y seeds. El baseline histórico de 12.480 partidas tuvo rule coverage 100%, unsupported 0 y rule gap 0, pero la IA cruda produjo resultados absurdos como Sword ~79,8% y Rune ~25,6%.
Repetir un error diez mil veces no lo convierte en verdad.
2. El consejo humano empeoró al bot y el promedio escondió incendios
human-prior-v1 se probó en 2.016 paired units / 4.032 games: baseline 50,99%, nuevo 49,36%, -1,64pt. Adaptive v2 ganó +0,74pt global pero Runecraft cayó -6,25pt y falló el leader floor; T11 también falló, incluido Abysscraft -16,67pt.
El consejo humano depende del contexto; un peso fijo puede matar ese contexto. Un promedio aprobado puede esconder una clase ardiendo.
3. El análisis causal encontró bugs del propio laboratorio
Se corrigieron un max_nodes=160 desconectado y un error de perspectiva actor/fixed-player que invertía conclusiones causales. Eso mejoró la plataforma de análisis, no el rendimiento general.
El programa Set 8 cerró tras 20 experimentos y 31.406 engine games en PAUSED_COMPLETE_NO_PROMOTION: 439 discordant units, 0 explicación causal completa, 11 parcial, 428 sin resolver. human-prior-v1 siguió activo y el final unseen holdout de 8.064 partidas quedó sellado.
4. 52 mazos jugaron 46.900 partidas y nació el ranking “cerebro apagado vs cerebro apagado”
El corpus tuvo 52 decks / 25 archetypes / 7 leaders. El análisis de mercado usó 46.900 partidas; un 7×7 directo separado, 1.512. Promedios: Buff Forest 71,99%, Rally Sword 65,97%, Midrange Abyss 54,17%, Artifact Portal 54,17%, Ramp Dragon 53,70%, Evolution Haven 31,71%, Calgidensula Witch 18,29%.
Son valores simulator-direct, no ladder WR. Los mazos donde lo bueno ahora sigue siendo bueno después parecieron más fáciles para la IA actual.
5. En torneos humanos Witch vivía en otro universo
En Dexel Rising Cup #2 del 8-8-2026, Hand Witch fue 116 de 384 listas, ~30,2%, la más usada. Calgidensula Witch quedó última en el 7×7 de IA con 18,29%. No son necesariamente las mismas 40 cartas, pero la brecha humano-IA es demasiado grande para ignorarla.
Rally Sword fue fuerte en ambos mundos, lo que sugiere que estrategias tolerantes a errores pueden ser más robustas para jugadores no expertos.
6. Future Optionality: reglas sí, orden y planes casi no
Se auditaron 7 leaders / 24 mechanics en RULE, STATE, VISIBILITY, IMMEDIATE VALUE, FUTURE VALUE, SEQUENCE, SEARCH y PLAN. En 27.810 decisions / 118.575 root candidates, solo 8.878, 7,49%, tenían future value explícito. rule/state/immediate 24/24 supported; sequence faltaba en 23/24 y plan en 20/24.
Witch mostró sensibilidad al orden de robo; Dragon, que PP y Awakening abren opciones futuras. Los 12 MYOPIC_REVERSAL de Dragon fueron ramp 6 + Awakening 6, pero no se convirtieron en bonuses fijos.
7. Se construyó un planner closed-loop real de tres turnos
El motor avanza al menos 3 future turn boundaries, ejecuta una sola acción, observa draw/random/opponent action y vuelve a planificar. No mira hidden hand ni future draw order.
Ablation: 56 games, 3.979/3.979 root actions, 3-turn completion 100%, hidden-info 0, 81.621 replans y 35.821 plan changes. La implementación funcionó; el rendimiento cayó -25,0 a -37,5pt vs human-prior-v1. Ver más lejos solo permitió equivocarse a mayor distancia.
8. Leaf calibration separó dónde se rompe el ranking
Se capturaron 3.979 root-action leaves, 1.009 unique leaves y 54.208 terminal rollout rows. De 73 primeras divergencias: leaf weighting 59, chance aggregation 12, opponent backup 2.
El sospechoso principal pasó a ser la valoración del leaf. Los 12 proxies Dragon anteriores solo cambiaron realmente hacia ramp en 1/12 con search real de tres turnos.
9. Learned value predijo mejor y eligió peor el mejor movimiento
Holdout v1.1 fresco: 727 leaves / 104 roots / 22.768 terminal rollouts, siete leaders. Brier 0,1144→0,0972 y pairwise 75,7→78,9% mejoraron.
Pero root argmax 59,6→39,4%, top2 73,1→64,4%, top3 82,7→76,0%, mean regret 4,42→5,29pt; Forest/Haven/Portal fallaron floors. HOLD_OFFLINE.
Predecir probabilidades mejor no equivale a escoger la mejor acción.
10. Ahora razonamos hacia atrás desde lethal
LETHAL ← daño ← PP ← cartas ← thresholds Spellboost/Awakening/Rally ← acción actual. Ramp no vale por “+8 puntos”; vale cuando una ruta real de victoria necesita llegar a 8PP a tiempo.
El objetivo genera requisitos hacia atrás y el motor real comprueba la ruta hacia delante.
11. También razonamos desde nuestra propia derrota
Desde SELF_LOSS se infieren daño necesario del rival, daño de mesa, daño adicional de mano, requisitos para quitar Ward, PP e información pública. Cada acción se evalúa por qué rutas de victoria enemigas corta.
Seguridad absoluta crea una IA que cura hasta perder educadamente. RISK_REQUIRED permite elegir una línea arriesgada no forzada cuando las líneas seguras casi no conservan probabilidad real de victoria.
12. “Forzado” necesita un alcance de prueba declarado
Victoria: PROVEN_WIN_NOW, FORCED_WIN_FULLY_OBSERVABLE_SUBTREE, FORCED_WIN_WITHIN_ENUMERATED_RESPONSE_SET, ROBUST_WIN_BELIEF, CONDITIONAL_WIN. Derrota separa igualmente proof, belief y conditional.
En proof search, self=OR y opponent=AND. Para certeza en chance deben cubrirse todos los outcomes alcanzables. Se prohíben hidden-hand truth, future draw order y strategy fusion; solo se replanifica después de observar.
13. La prioridad pasa de sumar puntos misteriosos a gates
Orden: proven win now → fully observable forced → enumerated forced → quitar forced loss evitable → maximizar expected final win probability → near-tie safety → robustness → route progress/cut → validated continuation value.
belief/conditional no son forced. Solo acciones peores tanto en posibilidad de victoria como en riesgo de derrota pueden eliminarse como strictly dominated.
14. Tres turnos son el mínimo, no una pared
Configuración inicial H_MIN=3, selective H_MAX=5. Solo se extienden ramas con lethal, forced response, threshold importante, delayed payoff o near tie sin resolver.
Rollouts 32/candidate y 64→128→256 para los mejores ambiguos. Roots: UNIQUE_BEST / PRACTICAL_TIE / UNRESOLVED. epsilon 0,02/0,03/0,05 se decide solo en development y se congela antes del nuevo holdout.
15. Nuevo QC: capturar errores seguros de sí mismos antes de buscar la IA más fuerte
Primary exige 0 hidden-info, future-draw, rule gap, strategy fusion, false proven, forced-scope mislabel, chance-completeness violation, lethal miss, avoidable forced loss y leakage. Luego se miden cobertura de 7 leaders, argmax, mean/p90/p95 regret, leader floors y top2 best-set.
Brier/pairwise/calibration son Secondary y no rescatan un fallo Primary. El holdout v1.1 está consumido para siempre.
Le dimos futuro y se volvió más débil. Le enseñamos probabilidades y predijo mejor pero eligió peor. Ahora razona hacia atrás desde ganar y perder, y solo llama “forzado” a lo que el alcance de evidencia realmente demuestra.
Construyamos la IA más fuerte con IA. Por ahora quizá el QC sea más fuerte que el bot; probablemente es sano.


