1. Je voulais seulement aller face, un laboratoire est apparu
Le but était d’utiliser l’IA pour trouver le deck le plus fort. Set 8, base de 826 cartes, commit moteur, hash d’environnement, decks légaux et seeds ont été figés. Le baseline historique de 12 480 parties avait rule coverage 100%, unsupported 0, rule gap 0, mais l’IA brute produisait encore Sword ~79,8% et Rune ~25,6%.
Répéter une erreur dix mille fois ne la transforme pas en vérité.
2. Le conseil humain a affaibli le bot et la moyenne a caché des incendies
human-prior-v1 a été testé sur 2 016 paired units / 4 032 games : baseline 50,99%, nouveau 49,36%, -1,64pt. Adaptive v2 gagnait +0,74pt globalement mais Runecraft perdait -6,25pt et échouait au leader floor ; T11 échouait aussi, notamment Abysscraft -16,67pt.
Le conseil humain dépend du contexte ; un fixed weight peut tuer ce contexte. Une moyenne correcte peut cacher une classe en feu.
3. L’analyse causale a aussi trouvé des bugs dans le laboratoire
Un max_nodes=160 non relié au planner et une confusion actor/fixed-player inversant des conclusions causales ont été corrigés. La plateforme est devenue plus sûre, sans restaurer la performance générale.
La recherche Set 8 s’est arrêtée après 20 expériences et 31 406 engine games à PAUSED_COMPLETE_NO_PROMOTION : 439 discordant units, 0 explication causale complète, 11 partielles, 428 non résolues. human-prior-v1 reste actif et le final unseen holdout de 8 064 parties reste scellé.
4. 52 decks ont joué 46 900 parties et créé le classement « cerveau éteint contre cerveau éteint »
Le corpus comptait 52 decks / 25 archetypes / 7 leaders. L’analyse marché a utilisé 46 900 parties ; un direct 7×7 séparé, 1 512. Moyennes : Buff Forest 71,99%, Rally Sword 65,97%, Midrange Abyss 54,17%, Artifact Portal 54,17%, Ramp Dragon 53,70%, Evolution Haven 31,71%, Calgidensula Witch 18,29%.
Ce sont des valeurs simulator-direct, pas des ladder WR. Les decks où « bon maintenant » reste bon ensuite semblent plus simples pour l’IA actuelle.
5. Dans les tournois humains, Witch vivait dans un autre univers
Au Dexel Rising Cup #2 du 8 août 2026, Hand Witch représentait 116 des 384 listes, ~30,2%, la plus forte présence. Calgidensula Witch finissait dernière du 7×7 IA à 18,29%. Il ne faut pas supposer les mêmes 40 cartes, mais l’écart humain-IA est énorme.
Rally Sword était fort des deux côtés, ce qui suggère que les stratégies tolérantes aux erreurs de décision peuvent être plus robustes pour les non-experts.
6. Future Optionality : règles oui, ordre et plans presque absents
Audit de 7 leaders / 24 mechanics sur RULE, STATE, VISIBILITY, IMMEDIATE VALUE, FUTURE VALUE, SEQUENCE, SEARCH, PLAN. Parmi 27 810 decisions / 118 575 root candidates, seuls 8 878, 7,49%, avaient une future value explicite. rule/state/immediate 24/24 supported ; sequence MISSING 23/24 et plan MISSING 20/24.
Witch montrait l’effet de l’ordre de pioche ; Dragon, que PP et Awakening ouvrent des choix futurs. Les 12 MYOPIC_REVERSAL Dragon = ramp 6 + Awakening 6 n’ont pas été transformés en bonus fixes.
7. Un vrai planner closed-loop à trois tours a été construit
Le moteur avance au moins 3 future turn boundaries, exécute une action, observe draw/random/opponent action puis replannifie. Il ne regarde ni hidden hand ni future draw order.
Ablation 56 games : 3 979/3 979 root actions, 3-turn completion 100%, hidden-info 0, 81 621 replans, 35 821 plan changes. L’implémentation marche ; la performance chute de -25,0 à -37,5pt vs human-prior-v1. Voir plus loin a surtout permis de se tromper plus loin.
8. Leaf calibration a séparé l’endroit où le ranking casse
3 979 root-action leaves, 1 009 unique leaves, 54 208 terminal rollout rows. Sur 73 first divergences : leaf weighting 59, chance aggregation 12, opponent backup 2.
Le principal suspect devient l’évaluation du leaf. Sur les 12 anciens proxies Dragon, seulement 1/12 change réellement vers ramp avec le search trois tours réel.
9. Learned value prédit mieux mais choisit moins bien la meilleure action
Fresh holdout v1.1 : 727 leaves / 104 roots / 22 768 terminal rollouts, sept leaders. Brier 0,1144→0,0972 et pairwise 75,7→78,9% s’améliorent.
Mais root argmax 59,6→39,4%, top2 73,1→64,4%, top3 82,7→76,0%, mean regret 4,42→5,29pt ; Forest/Haven/Portal échouent aux floors. HOLD_OFFLINE.
Mieux prédire des probabilités n’est pas mieux choisir l’action numéro un.
10. On raisonne maintenant à rebours depuis lethal
LETHAL ← dégâts ← PP ← cartes ← thresholds Spellboost/Awakening/Rally ← action actuelle. Ramp ne vaut pas « +8 points » ; il vaut lorsque la route de victoire réelle exige 8PP à temps.
Le but produit les préconditions à rebours, le moteur réel vérifie la route vers l’avant.
11. On raisonne aussi depuis notre propre mort
Depuis SELF_LOSS, on remonte dégâts nécessaires, board damage, dégâts supplémentaires en main, préconditions pour retirer Ward, PP et informations publiques. Chaque action est jugée par les routes de victoire adverses qu’elle coupe.
La sécurité absolue produit une IA qui soigne jusqu’à perdre poliment. RISK_REQUIRED autorise une ligne risquée non-forced-loss lorsque les lignes sûres laissent presque zéro chance réelle de gagner.
12. « Forcé » exige une portée de preuve déclarée
Victoire : PROVEN_WIN_NOW, FORCED_WIN_FULLY_OBSERVABLE_SUBTREE, FORCED_WIN_WITHIN_ENUMERATED_RESPONSE_SET, ROBUST_WIN_BELIEF, CONDITIONAL_WIN. Défaite sépare pareillement proof, belief et conditional.
En proof search, self=OR et opponent=AND. La certitude sur chance exige tous les reachable outcomes. Hidden-hand truth, future draw order et strategy fusion sont interdits ; replan uniquement après observation.
13. La priorité devient une série de gates
Ordre : proven win now → fully observable forced → enumerated forced → supprimer forced loss évitable → maximiser expected final win probability → near-tie safety → robustness → route progress/cut → validated continuation value.
belief/conditional ne sont pas forced. Seules les actions pires à la fois en chance de victoire et en risque de défaite sont strictly dominated.
14. Trois tours sont un minimum, pas un mur
Configuration initiale H_MIN=3, selective H_MAX=5. Seules les branches avec lethal, forced response, threshold important, delayed payoff ou near tie non résolu sont prolongées.
Rollouts 32/candidate puis 64→128→256 pour les meilleurs ambiguës. Roots : UNIQUE_BEST / PRACTICAL_TIE / UNRESOLVED. epsilon 0,02/0,03/0,05 est choisi uniquement en development puis gelé avant le nouveau holdout.
15. Nouveau QC : attraper les erreurs confiantes avant de chercher l’IA la plus forte
Primary exige 0 hidden-info, future-draw, rule gap, strategy fusion, false proven, forced-scope mislabel, chance-completeness violation, lethal miss, avoidable forced loss et leakage. Puis couverture 7 leaders, argmax, mean/p90/p95 regret, leader floors, top2 best-set.
Brier/pairwise/calibration restent Secondary et ne sauvent pas un échec Primary. Le holdout v1.1 est consommé définitivement.
On a donné le futur au bot et il est devenu plus faible. On lui a appris les probabilités : la prédiction s’est améliorée, le meilleur choix s’est dégradé. Désormais il raisonne à rebours depuis victoire et défaite et n’appelle « forcé » que ce que la preuve soutient réellement.
Construisons l’IA la plus forte avec l’IA. Pour l’instant, le QC est peut-être plus fort que le bot — c’est probablement sain.


