Demos a uma IA “sem cérebro” visão de três turnos — e ela ficou ainda pior: o que 46.900 partidas de simulação de mercado e uma linha separada de pesquisa em IA revelaram sobre “ver o futuro e avaliá-lo mal”

Tema: Shadowverse: Worlds Beyond

A pergunta inicial era simples: qual é o deck mais forte agora?

Como usar os recursos de leitura

Ouvir lê o artigo em voz alta. A leitura rápida mostra trechos no ritmo escolhido. A prática de idiomas compara as traduções disponíveis. Salvar cria um favorito neste navegador, acessível na lista do player.

Compartilhar este artigo
Publicidade
Publicidade

1. A ideia era só bater na cara; apareceu um laboratório

A pergunta inicial era simples: qual é o deck mais forte agora? Reunir listas públicas, congelar as regras, deixar CPUs jogarem dezenas de milhares de partidas e ler o ranking.

A primeira verdade incômoda surgiu rápido: executar as regras corretamente não significa jogar bem. O Set 8 foi fixado com 826 cartas, commit do motor, hash do ambiente, decks legais e seeds determinísticos. O baseline histórico de 12.480 partidas tinha 100% de rule coverage, 0 unsupported e 0 rule gap conhecido, mas a IA crua ainda produzia Sword ~79,8%, Forest 63,7%, Dragon 60,9% e Rune 25,6%.

Repetir o mesmo erro dez mil vezes não o transforma em verdade. Só cria uma máquina industrial de errar com consistência.

2. Conselho humano deixou o bot mais fraco

human-prior-v1 adicionou princípios comuns: preservar recursos importantes, respeitar setup e condições de vitória e não gastar evolução à toa. O A/B exato teve 2.016 paired units e 4.032 engine games. Baseline 50,99%; human-prior-v1 49,36%; delta -1,64pt.

A IA ouviu humanos e piorou.

O problema é que conselho humano é condicional. “Guarde esta carta” deixa de valer quando não usá-la significa morrer agora. Fixed weights preservam a frase e destroem o contexto.

3. Adaptive v2 melhorou a média e quebrou Witch

Adaptive v2 alternou LETHAL, SURVIVE, STABILIZE, SETUP, RESOURCE e PRESSURE, com busca curta e future value. No geral, +0,74pt contra v1, mas Runecraft caiu -6,25pt e ultrapassou o leader floor preregistrado de -5pt. REJECT.

T11 terminou +0,30 contra v1, porém -2,38 contra reference-v5 e Abyss -16,67. REJECT de novo.

A média dizia “aprovado”; uma disciplina estava pegando fogo.

4. Na análise de causa, os pesquisadores foram presos primeiro

Um defeito real apareceu: max_nodes=160 estava configurado, mas não conectado ao planner, e 9.067 decisões passaram do limite nominal. Corrigir a conexão não melhorou a performance ampla.

Depois surgiu um bug de actor attribution. Uma intervenção marcada como “loss→win” estava normalizada pela perspectiva do fixed player; pela perspectiva do actor cuja ação mudou, era win→loss. A investigação tinha prendido a vítima.

Actor, direction e invariants foram corrigidos. A plataforma ficou mais segura; a causa de performance continuou fugitiva.

5. Após 31.406 partidas, “ainda não sabemos” virou uma conclusão legítima

A pesquisa de policy do Set 8 fechou com 20 experimentos e 31.406 actual engine games confirmadas. Entre 439 discordant units, 0 causas de performance foram totalmente explicadas de forma causal, 11 parcialmente e 428 ficaram unresolved.

O estado final foi PAUSED_COMPLETE_NO_PROMOTION. human-prior-v1 continuou active. O final unseen holdout planejado de 8.064 partidas ficou intocado.

O principal resultado não foi uma super-IA, mas um sistema capaz de não promover uma IA só porque um recorte conveniente parece bonito.

6. Depois colocamos 52 decks de mercado para jogar 46.900 partidas

O corpus de mercado tinha 52 decks, 25 arquétipos e 7 líderes. Quick/broad, otimização local de 1–3 cartas, ranking com seeds inéditos e traces levaram o ledger a 46.900 actual engine games.

As sete recomendações finais fizeram um round robin direto: 21 pares não ordenados, 1.512 partidas, 72 por célula não diagonal, 756 com reference-v5 e 756 com human-prior-v1, além de 756 primeiro/segundo jogador. Coverage 100%, sem unsupported, rule gap ou hidden-info violation.

7. Nasceu o “ranking de sem-cérebro contra sem-cérebro”

Rank Deck Média direta 7×7 Pior matchup
1 Buff Forest 71,99% Abyss 59,72%
2 Rally Sword 65,97% Forest 31,94%
3 Midrange Abyss 54,17% 40,3%
4 Artifact Portal 54,17% 36,1%
5 Ramp Dragon 53,70% Forest 25,0%
6 Evolution Haven 31,71% Dragon 12,5%
7 Calgidensula Witch 18,29% Forest 1,4%

Decks em que “fazer uma jogada forte agora” costuma continuar bom depois são fáceis para a IA atual. Decks que sacrificam tempo agora para comprar uma explosão daqui a dois ou três turnos parecem bem mais difíceis.

8. Em torneios humanos, Witch parecia morar em outro universo

Dexel Rising Cup #2, em 8 de agosto de 2026: 64 equipes, 192 jogadores e 384 decks submetidos. Hand Witch apareceu 116 vezes, cerca de 30,2% do field; AF/Storm Portal 52, Evolution Haven 34, Rally/Evolution Sword 29 e Ramp Dragon 25.

Humanos de alto nível tratavam Witch como top meta. A Calgidensula Witch do 7×7 da IA terminou em último com 18,29%. Não podemos presumir listas idênticas de 40 cartas, mas o gap humano-versus-IA é enorme.

Rally Sword, por outro lado, foi forte nos dois mundos. Heurística grosseira, mas útil: forte com IA simples + forte com humanos experientes pode indicar maior tolerância a decisões imperfeitas.

9. Auditoria de Future Optionality

As 24 mecânicas dos sete líderes foram auditadas em RULE, STATE, VISIBILITY, IMMEDIATE VALUE, FUTURE VALUE, SEQUENCE, SEARCH e PLAN.

Entre 27.810 decisões e 118.575 root candidates, somente 8.878 —7,49%— carregavam future value explícito. Rule/state/immediate foram SUPPORTED 24/24. Sequence ficou MISSING em 23/24 e plan em 20/24.

A IA conhece as regras e entende bastante bem “valor agora”, mas quase não representa ordem ou planos longos.

10. Witch: saber que Spellboost existe não é entender Spellboost

Spellboost tinha rule/state, mas visibility/future value eram PARTIAL e sequence/plan MISSING. DRAW → SPELL é diferente de SPELL → DRAW: a carta comprada antes pode receber o boost posterior; a carta comprada depois não recebe retroativamente um boost que já aconteceu.

Nos 12 fixtures sintéticos: DRAW_FIRST_BETTER 4, SPELL_FIRST_BETTER 0, EQUIVALENT 8. Os 50 estados reais representativos foram resumidos como STATE_DEPENDENT. A solução não é “sempre compre primeiro”, e sim replanejar depois da observação.

11. Dragon: +1 de PP máximo compra direitos de ação futuros

Ramp pode perder tempo agora, mas libera cartas caras, turnos de múltiplas cartas, cura, remoção e finishers. A passagem 6→7 também cruza Awakening.

A auditoria encontrou 12 Dragoncraft MYOPIC_REVERSAL: 6 ramp + 6 Awakening. O immediate control aparecia primeiro, mas a continuação diagnóstica t+2 podia inverter o ranking. Isso não autoriza um bonus fixo de ramp.

12. As outras cinco classes tinham suas próprias versões do problema

Forest: combo thresholds, geração barata e bounce order. Sword: Rally 9→10 e multi-summon. Abyss: Shadows, conteúdo do reanimate pool e HP como recurso. Haven: Countdown e Act, onde não usar agora preserva uma opção futura. Portal: tokens de custo zero e copy explodem o sequence space.

EP, SEP, Extra PP e limites de mão, board e leader area também são trocas entre valor presente e optionality futura.

13. Então construímos um planner closed-loop de três turnos reais

O planner tinha de avançar o motor por pelo menos três future turn boundaries, não três ações. E não executava um script fixo: uma ação, observa draw/generation/random, recalcula três turnos a partir do novo estado. A estrutura é próxima de Receding Horizon / MPC.

Nada de espiar future draw order próprio ou a mão real do oponente; foi usado belief sampling. FutureRelevantState guardou Spellboost, Extra PP, Countdown, Act, Rally, Shadows e destroyed-follower pool. Nenhum bonus fixo de optionality, Witch ou ramp.

14. A implementação funcionou. A performance caiu no porão.

Ablation: 56 actual engine games. Foram avaliadas 3.979 / 3.979 root actions, three-turn completion 100%, hidden-info violation 0. Observation replans: 81.621; plan changes: 35.821.

Mas base/widen ficaram -37,5pt contra human-prior-v1, e replan/state/robust -25,0pt. Todos romperam o floor preregistrado de -10pt. Decisão correta: REJECT_ACTIVE_UNCHANGED. Targeted, broad, market 7×7 e final holdout ficaram NOT_RUN.

Construímos uma IA que enxerga mais longe e erra com mais confiança.

15. Isso não prova que três turnos sejam suficientes

O que desapareceu foi a suspeita “a implementação não chega realmente a três turnos”. Não foi provado que três turnos sejam um horizonte estratégico suficiente. A melhora de -37,5 para -25,0 com replan é apenas um sinal direcional, porque cada candidato teve só 8 conditions.

Os 12 antigos reversals de Dragon foram reavaliados com busca real de três turnos; apenas 1/12 realmente mudou o ranking em direção a ramp. O proxy antigo não era ground truth.

Os principais suspeitos passaram a ser o terminal/leaf evaluator e o opponent response model.

16. Próxima pergunta: “Você disse que esse futuro vale -150. Se jogarmos 100 vezes a partir daqui, quantas ganham?”

A próxima rodada não deve mudar pesos imediatamente. Primeiro, congelar cada leaf de três turnos e decompor o evaluator em raw feature→normalization→weight→contribution, especialmente para descobrir qual termo cria valores extremos como -150.

Depois, reiniciar do mesmo leaf 32–128 vezes até terminal para estimar empirical win rate. Raw score não é probabilidade: calibrar score→probability e medir Brier score, log loss e reliability. Qualidade de ranking é medida separadamente por Spearman, Kendall, same-root argmax accuracy, pairwise concordance e decision regret.

Por fim, cross-play de opponent response com human-prior-v1, reference-v5 e search-based stress response. Isso separa scoring ruim, modelo de oponente irreal, escala/pesos ruins, representação de estado insuficiente ou horizonte ainda curto.

17. Conclusão: o futuro está visível; a régua de correção está suspeita

A IA passou de “o que é forte agora?” para “eu realmente simulo três turnos”, mas ainda não podemos confiar em como ela avalia o futuro que vê.

A jornada passou por Sword 79,8%, conselho humano contraproducente, Witch quebrada, bug de actor, 46.900 partidas de mercado, Future Optionality e finalmente visão real de três turnos.

E a IA ficou mais fraca.

A gente só queria bater na cara. A próxima matéria é Brier score e leaf-value calibration. Shadowverse virou pós-graduação sem aviso.

Apêndice de dados

  • Set 8 card DB: 826
  • baseline: 12.480 games
  • policy research: 31.406 actual engine games
  • status: PAUSED_COMPLETE_NO_PROMOTION
  • active: human-prior-v1
  • market: 52 decks / 25 archetypes / 7 leaders
  • market analysis: 46.900 games
  • direct 7×7: 1.512 games
  • optionality: 27.810 decisions / 118.575 candidates / 7,49%
  • sequence MISSING 23/24; plan MISSING 20/24
  • Dragon reversals: 12 = ramp 6 + Awakening 6
  • RH3 Ablation: 56 games
  • root coverage: 3.979/3.979; completion 100%
  • replans 81.621; plan changes 35.821
  • resultado: REJECT_ACTIVE_UNCHANGED
  • final holdout: NOT_RUN

Referências

  • Shadowverse: Worlds Beyond Deck Portal oficial
  • Dexel Rising Cup #2
  • Silver & Veness (2010), POMCP
  • Cowling, Powley & Whitehouse (2012), ISMCTS
  • Model Predictive Control / Receding Horizon Control
  • Brier score, reliability e clustered validation

Publicidade

Para ler hoje

Cada um responde a uma pergunta que quem lê este artigo costuma ter em seguida.

Ver todos os artigosMais sobre Jogos de cartas e tabuleiro

Encontrar outros artigos

Todos os artigos

Mendoi-chan

Quem mantém o site

Mendoi-chan

Transforma as dificuldades do trabalho e do dia a dia em estruturas claras e próximos passos práticos.

Publicidade

Artigos recentes

  1. 1O padre ladrão de calcinha é pego, mas o “tio reprodutor” é herói? O mangá reduz os fetiches mais nichados e a web novel desperta até “Gravidez Imaginária”
  2. 2A humanidade não ganha isso — Tratei PRAGMATA como um museu lunar e acabei assustado com a capacidade industrial de uma civilização de máquinas
  3. 3Por que todos os meus ataques perdem? — Um jogador de Pyra/Mythra contra a intangibilidade do Kazuya e a barriga do crocodilo
  4. 4Para quem tem dificuldade de fazer coisas sozinho: desmonte o “se ninguém vier, eu não vou” e crie seu “SO de ação solo”
  5. 5a base lunar aguentou mais que o meu esquema de controles

Leia também

Publicidade