1. Eu só queria bater na cara e apareceu um laboratório
O objetivo era usar IA para achar o deck mais forte. Fixamos Set 8, banco de 826 cartas, commit do engine, hash do ambiente, decks legais e seeds. O baseline histórico de 12.480 jogos teve rule coverage 100%, unsupported 0 e rule gap 0, mas a IA crua ainda produziu números absurdos como Sword ~79,8% e Rune ~25,6%.
Repetir um erro dez mil vezes não o transforma em verdade.
2. Conselho humano piorou o bot e a média escondeu incêndios
human-prior-v1 foi testado em 2.016 paired units / 4.032 games: baseline 50,99%, novo 49,36%, -1,64pt. Adaptive v2 ganhou +0,74pt no geral, mas Runecraft caiu -6,25pt e falhou o leader floor; T11 também falhou, incluindo Abysscraft -16,67pt.
Conselho humano é contextual; fixed weight pode matar o contexto. A média pode passar enquanto uma classe pega fogo.
3. A análise causal encontrou bugs no próprio laboratório
Foram corrigidos um contrato max_nodes=160 desconectado e um erro actor/fixed-player que invertia conclusões causais. A plataforma melhorou, mas o desempenho amplo não voltou.
A pesquisa Set 8 terminou após 20 experimentos e 31.406 engine games em PAUSED_COMPLETE_NO_PROMOTION: 439 discordant units, 0 explicação causal completa, 11 parciais, 428 não resolvidas. human-prior-v1 ficou ativo e o final unseen holdout de 8.064 jogos permaneceu lacrado.
4. 52 decks jogaram 46.900 partidas e nasceu o ranking “sem cérebro vs sem cérebro”
O corpus teve 52 decks / 25 archetypes / 7 leaders. A análise de mercado usou 46.900 jogos; um 7×7 direto separado usou 1.512. Médias: Buff Forest 71,99%, Rally Sword 65,97%, Midrange Abyss 54,17%, Artifact Portal 54,17%, Ramp Dragon 53,70%, Evolution Haven 31,71%, Calgidensula Witch 18,29%.
São valores simulator-direct, não ladder WR. Decks em que “bom agora” continua bom depois parecem mais fáceis para a IA atual.
5. Em torneios humanos Witch vivia em outro universo
No Dexel Rising Cup #2 de 08/08/2026, Hand Witch apareceu em 116 de 384 listas, ~30,2%, a maior presença. Calgidensula Witch ficou última no 7×7 da IA com 18,29%. Não se deve assumir as mesmas 40 cartas, mas a diferença humano-IA é grande demais para ignorar.
Rally Sword foi forte nos dois mundos, sugerindo que estratégias resistentes a decisões imperfeitas podem ser escolhas mais robustas para não especialistas.
6. Future Optionality: regras sim; ordem e planos quase não
Auditamos 7 leaders / 24 mechanics em RULE, STATE, VISIBILITY, IMMEDIATE VALUE, FUTURE VALUE, SEQUENCE, SEARCH e PLAN. Em 27.810 decisions / 118.575 root candidates, só 8.878, 7,49%, tinham future value explícito. rule/state/immediate 24/24 supported; sequence faltava em 23/24 e plan em 20/24.
Witch mostrou efeito da ordem de draw; Dragon mostrou que PP e Awakening abrem escolhas futuras. Os 12 MYOPIC_REVERSAL de Dragon foram ramp 6 + Awakening 6, sem virar bônus fixo.
7. Construímos um planner closed-loop real de três turnos
O engine avança pelo menos 3 future turn boundaries, executa só uma ação, observa draw/random/opponent action e replana. Não olha hidden hand nem future draw order.
Ablation: 56 games, 3.979/3.979 root actions, 3-turn completion 100%, hidden-info 0, 81.621 replans e 35.821 plan changes. A implementação funcionou; o desempenho caiu -25,0 a -37,5pt vs human-prior-v1. Ver mais longe apenas permitiu errar mais longe.
8. Leaf calibration separou onde o ranking quebra
Foram capturados 3.979 root-action leaves, 1.009 unique leaves e 54.208 terminal rollout rows. Das 73 primeiras divergências: leaf weighting 59, chance aggregation 12, opponent backup 2.
O suspeito principal passou a ser a avaliação do leaf. Dos 12 antigos proxies Dragon, só 1/12 realmente mudou para ramp no search real de três turnos.
9. Learned value previu melhor e escolheu pior a melhor ação
Holdout v1.1 novo: 727 leaves / 104 roots / 22.768 terminal rollouts, sete leaders. Brier 0,1144→0,0972 e pairwise 75,7→78,9% melhoraram.
Mas root argmax 59,6→39,4%, top2 73,1→64,4%, top3 82,7→76,0%, mean regret 4,42→5,29pt; Forest/Haven/Portal falharam floors. HOLD_OFFLINE.
Prever probabilidades melhor não é o mesmo que escolher a melhor jogada.
10. Agora raciocinamos de trás para frente a partir do lethal
LETHAL ← dano ← PP ← cartas ← thresholds Spellboost/Awakening/Rally ← ação atual. Ramp não vale “+8 pontos”; vale quando uma rota concreta de vitória exige chegar a 8PP no tempo certo.
O objetivo gera requisitos para trás; o engine real verifica a rota para frente.
11. Também raciocinamos a partir da própria derrota
De SELF_LOSS vêm dano necessário do oponente, dano de board, dano adicional da mão, requisitos para remover Ward, PP e informação pública. Cada ação é medida pelas rotas de vitória adversárias que corta.
Segurança absoluta cria a IA que cura até perder educadamente. RISK_REQUIRED permite uma linha arriscada não-forced-loss quando linhas seguras quase não preservam chance real de vitória.
12. “Forçado” exige escopo de prova declarado
Vitória: PROVEN_WIN_NOW, FORCED_WIN_FULLY_OBSERVABLE_SUBTREE, FORCED_WIN_WITHIN_ENUMERATED_RESPONSE_SET, ROBUST_WIN_BELIEF, CONDITIONAL_WIN. Derrota separa do mesmo modo proof, belief e conditional.
No proof search, self=OR e opponent=AND. Certeza em chance exige cobrir todos os outcomes alcançáveis. Hidden-hand truth, future draw order e strategy fusion são proibidos; replanejamento só após observação.
13. Prioridade vira gates, não soma misteriosa de pontos
Ordem: proven win now → fully observable forced → enumerated forced → remover forced loss evitável → maximizar expected final win probability → near-tie safety → robustness → route progress/cut → validated continuation value.
belief/conditional não são forced. Só ações piores tanto em chance de vitória quanto em risco de derrota podem ser eliminadas como strictly dominated.
14. Três turnos são o mínimo, não uma parede
Configuração inicial H_MIN=3, selective H_MAX=5. Apenas branches com lethal, forced response, threshold importante, delayed payoff ou near tie não resolvido são estendidos.
Rollouts começam em 32/candidate; tops ambíguos recebem 64→128→256. Roots: UNIQUE_BEST / PRACTICAL_TIE / UNRESOLVED. epsilon 0,02/0,03/0,05 é decidido só em development e congelado antes do novo holdout.
15. Novo QC: capturar erros confiantes antes de procurar a IA mais forte
Primary exige zero hidden-info, future-draw, rule gap, strategy fusion, false proven, forced-scope mislabel, chance-completeness violation, lethal miss, avoidable forced loss e leakage. Depois verifica cobertura dos 7 leaders, argmax, mean/p90/p95 regret, leader floors e top2 best-set.
Brier/pairwise/calibration são Secondary e não salvam falha Primary. O holdout v1.1 está consumido para sempre.
Demos futuro ao bot e ele piorou. Ensinamos probabilidade e a previsão melhorou enquanto a melhor ação piorou. Agora ele raciocina para trás a partir de vitória e derrota, e só chama algo de “forçado” quando o escopo da evidência realmente prova isso.
Vamos criar a IA mais forte com IA. Por enquanto o QC talvez seja mais forte que o bot — e isso é saudável.
