1. A ideia era só bater na cara; apareceu um laboratório
A pergunta inicial era simples: qual é o deck mais forte agora? Reunir listas públicas, congelar as regras, deixar CPUs jogarem dezenas de milhares de partidas e ler o ranking.
A primeira verdade incômoda surgiu rápido: executar as regras corretamente não significa jogar bem. O Set 8 foi fixado com 826 cartas, commit do motor, hash do ambiente, decks legais e seeds determinísticos. O baseline histórico de 12.480 partidas tinha 100% de rule coverage, 0 unsupported e 0 rule gap conhecido, mas a IA crua ainda produzia Sword ~79,8%, Forest 63,7%, Dragon 60,9% e Rune 25,6%.
Repetir o mesmo erro dez mil vezes não o transforma em verdade. Só cria uma máquina industrial de errar com consistência.
2. Conselho humano deixou o bot mais fraco
human-prior-v1 adicionou princípios comuns: preservar recursos importantes, respeitar setup e condições de vitória e não gastar evolução à toa. O A/B exato teve 2.016 paired units e 4.032 engine games. Baseline 50,99%; human-prior-v1 49,36%; delta -1,64pt.
A IA ouviu humanos e piorou.
O problema é que conselho humano é condicional. “Guarde esta carta” deixa de valer quando não usá-la significa morrer agora. Fixed weights preservam a frase e destroem o contexto.
3. Adaptive v2 melhorou a média e quebrou Witch
Adaptive v2 alternou LETHAL, SURVIVE, STABILIZE, SETUP, RESOURCE e PRESSURE, com busca curta e future value. No geral, +0,74pt contra v1, mas Runecraft caiu -6,25pt e ultrapassou o leader floor preregistrado de -5pt. REJECT.
T11 terminou +0,30 contra v1, porém -2,38 contra reference-v5 e Abyss -16,67. REJECT de novo.
A média dizia “aprovado”; uma disciplina estava pegando fogo.
4. Na análise de causa, os pesquisadores foram presos primeiro
Um defeito real apareceu: max_nodes=160 estava configurado, mas não conectado ao planner, e 9.067 decisões passaram do limite nominal. Corrigir a conexão não melhorou a performance ampla.
Depois surgiu um bug de actor attribution. Uma intervenção marcada como “loss→win” estava normalizada pela perspectiva do fixed player; pela perspectiva do actor cuja ação mudou, era win→loss. A investigação tinha prendido a vítima.
Actor, direction e invariants foram corrigidos. A plataforma ficou mais segura; a causa de performance continuou fugitiva.
5. Após 31.406 partidas, “ainda não sabemos” virou uma conclusão legítima
A pesquisa de policy do Set 8 fechou com 20 experimentos e 31.406 actual engine games confirmadas. Entre 439 discordant units, 0 causas de performance foram totalmente explicadas de forma causal, 11 parcialmente e 428 ficaram unresolved.
O estado final foi PAUSED_COMPLETE_NO_PROMOTION. human-prior-v1 continuou active. O final unseen holdout planejado de 8.064 partidas ficou intocado.
O principal resultado não foi uma super-IA, mas um sistema capaz de não promover uma IA só porque um recorte conveniente parece bonito.
6. Depois colocamos 52 decks de mercado para jogar 46.900 partidas
O corpus de mercado tinha 52 decks, 25 arquétipos e 7 líderes. Quick/broad, otimização local de 1–3 cartas, ranking com seeds inéditos e traces levaram o ledger a 46.900 actual engine games.
As sete recomendações finais fizeram um round robin direto: 21 pares não ordenados, 1.512 partidas, 72 por célula não diagonal, 756 com reference-v5 e 756 com human-prior-v1, além de 756 primeiro/segundo jogador. Coverage 100%, sem unsupported, rule gap ou hidden-info violation.
7. Nasceu o “ranking de sem-cérebro contra sem-cérebro”
| Rank | Deck | Média direta 7×7 | Pior matchup |
|---|---|---|---|
| 1 | Buff Forest | 71,99% | Abyss 59,72% |
| 2 | Rally Sword | 65,97% | Forest 31,94% |
| 3 | Midrange Abyss | 54,17% | 40,3% |
| 4 | Artifact Portal | 54,17% | 36,1% |
| 5 | Ramp Dragon | 53,70% | Forest 25,0% |
| 6 | Evolution Haven | 31,71% | Dragon 12,5% |
| 7 | Calgidensula Witch | 18,29% | Forest 1,4% |
Decks em que “fazer uma jogada forte agora” costuma continuar bom depois são fáceis para a IA atual. Decks que sacrificam tempo agora para comprar uma explosão daqui a dois ou três turnos parecem bem mais difíceis.
8. Em torneios humanos, Witch parecia morar em outro universo
Dexel Rising Cup #2, em 8 de agosto de 2026: 64 equipes, 192 jogadores e 384 decks submetidos. Hand Witch apareceu 116 vezes, cerca de 30,2% do field; AF/Storm Portal 52, Evolution Haven 34, Rally/Evolution Sword 29 e Ramp Dragon 25.
Humanos de alto nível tratavam Witch como top meta. A Calgidensula Witch do 7×7 da IA terminou em último com 18,29%. Não podemos presumir listas idênticas de 40 cartas, mas o gap humano-versus-IA é enorme.
Rally Sword, por outro lado, foi forte nos dois mundos. Heurística grosseira, mas útil: forte com IA simples + forte com humanos experientes pode indicar maior tolerância a decisões imperfeitas.
9. Auditoria de Future Optionality
As 24 mecânicas dos sete líderes foram auditadas em RULE, STATE, VISIBILITY, IMMEDIATE VALUE, FUTURE VALUE, SEQUENCE, SEARCH e PLAN.
Entre 27.810 decisões e 118.575 root candidates, somente 8.878 —7,49%— carregavam future value explícito. Rule/state/immediate foram SUPPORTED 24/24. Sequence ficou MISSING em 23/24 e plan em 20/24.
A IA conhece as regras e entende bastante bem “valor agora”, mas quase não representa ordem ou planos longos.
10. Witch: saber que Spellboost existe não é entender Spellboost
Spellboost tinha rule/state, mas visibility/future value eram PARTIAL e sequence/plan MISSING. DRAW → SPELL é diferente de SPELL → DRAW: a carta comprada antes pode receber o boost posterior; a carta comprada depois não recebe retroativamente um boost que já aconteceu.
Nos 12 fixtures sintéticos: DRAW_FIRST_BETTER 4, SPELL_FIRST_BETTER 0, EQUIVALENT 8. Os 50 estados reais representativos foram resumidos como STATE_DEPENDENT. A solução não é “sempre compre primeiro”, e sim replanejar depois da observação.
11. Dragon: +1 de PP máximo compra direitos de ação futuros
Ramp pode perder tempo agora, mas libera cartas caras, turnos de múltiplas cartas, cura, remoção e finishers. A passagem 6→7 também cruza Awakening.
A auditoria encontrou 12 Dragoncraft MYOPIC_REVERSAL: 6 ramp + 6 Awakening. O immediate control aparecia primeiro, mas a continuação diagnóstica t+2 podia inverter o ranking. Isso não autoriza um bonus fixo de ramp.
12. As outras cinco classes tinham suas próprias versões do problema
Forest: combo thresholds, geração barata e bounce order. Sword: Rally 9→10 e multi-summon. Abyss: Shadows, conteúdo do reanimate pool e HP como recurso. Haven: Countdown e Act, onde não usar agora preserva uma opção futura. Portal: tokens de custo zero e copy explodem o sequence space.
EP, SEP, Extra PP e limites de mão, board e leader area também são trocas entre valor presente e optionality futura.
13. Então construímos um planner closed-loop de três turnos reais
O planner tinha de avançar o motor por pelo menos três future turn boundaries, não três ações. E não executava um script fixo: uma ação, observa draw/generation/random, recalcula três turnos a partir do novo estado. A estrutura é próxima de Receding Horizon / MPC.
Nada de espiar future draw order próprio ou a mão real do oponente; foi usado belief sampling. FutureRelevantState guardou Spellboost, Extra PP, Countdown, Act, Rally, Shadows e destroyed-follower pool. Nenhum bonus fixo de optionality, Witch ou ramp.
14. A implementação funcionou. A performance caiu no porão.
Ablation: 56 actual engine games. Foram avaliadas 3.979 / 3.979 root actions, three-turn completion 100%, hidden-info violation 0. Observation replans: 81.621; plan changes: 35.821.
Mas base/widen ficaram -37,5pt contra human-prior-v1, e replan/state/robust -25,0pt. Todos romperam o floor preregistrado de -10pt. Decisão correta: REJECT_ACTIVE_UNCHANGED. Targeted, broad, market 7×7 e final holdout ficaram NOT_RUN.
Construímos uma IA que enxerga mais longe e erra com mais confiança.
15. Isso não prova que três turnos sejam suficientes
O que desapareceu foi a suspeita “a implementação não chega realmente a três turnos”. Não foi provado que três turnos sejam um horizonte estratégico suficiente. A melhora de -37,5 para -25,0 com replan é apenas um sinal direcional, porque cada candidato teve só 8 conditions.
Os 12 antigos reversals de Dragon foram reavaliados com busca real de três turnos; apenas 1/12 realmente mudou o ranking em direção a ramp. O proxy antigo não era ground truth.
Os principais suspeitos passaram a ser o terminal/leaf evaluator e o opponent response model.
16. Próxima pergunta: “Você disse que esse futuro vale -150. Se jogarmos 100 vezes a partir daqui, quantas ganham?”
A próxima rodada não deve mudar pesos imediatamente. Primeiro, congelar cada leaf de três turnos e decompor o evaluator em raw feature→normalization→weight→contribution, especialmente para descobrir qual termo cria valores extremos como -150.
Depois, reiniciar do mesmo leaf 32–128 vezes até terminal para estimar empirical win rate. Raw score não é probabilidade: calibrar score→probability e medir Brier score, log loss e reliability. Qualidade de ranking é medida separadamente por Spearman, Kendall, same-root argmax accuracy, pairwise concordance e decision regret.
Por fim, cross-play de opponent response com human-prior-v1, reference-v5 e search-based stress response. Isso separa scoring ruim, modelo de oponente irreal, escala/pesos ruins, representação de estado insuficiente ou horizonte ainda curto.
17. Conclusão: o futuro está visível; a régua de correção está suspeita
A IA passou de “o que é forte agora?” para “eu realmente simulo três turnos”, mas ainda não podemos confiar em como ela avalia o futuro que vê.
A jornada passou por Sword 79,8%, conselho humano contraproducente, Witch quebrada, bug de actor, 46.900 partidas de mercado, Future Optionality e finalmente visão real de três turnos.
E a IA ficou mais fraca.
A gente só queria bater na cara. A próxima matéria é Brier score e leaf-value calibration. Shadowverse virou pós-graduação sem aviso.
Apêndice de dados
- Set 8 card DB: 826
- baseline: 12.480 games
- policy research: 31.406 actual engine games
- status:
PAUSED_COMPLETE_NO_PROMOTION - active:
human-prior-v1 - market: 52 decks / 25 archetypes / 7 leaders
- market analysis: 46.900 games
- direct 7×7: 1.512 games
- optionality: 27.810 decisions / 118.575 candidates / 7,49%
- sequence MISSING 23/24; plan MISSING 20/24
- Dragon reversals: 12 = ramp 6 + Awakening 6
- RH3 Ablation: 56 games
- root coverage: 3.979/3.979; completion 100%
- replans 81.621; plan changes 35.821
- resultado:
REJECT_ACTIVE_UNCHANGED - final holdout:
NOT_RUN
Referências
- Shadowverse: Worlds Beyond Deck Portal oficial
- Dexel Rising Cup #2
- Silver & Veness (2010), POMCP
- Cowling, Powley & Whitehouse (2012), ISMCTS
- Model Predictive Control / Receding Horizon Control
- Brier score, reliability e clustered validation
