Vamos criar a IA mais forte usando IA — o bot de Shadowverse WB que ficou pior ao enxergar três turnos agora raciocina de trás para frente a partir de rotas de vitória, derrota e resultados “forçados” com escopo de prova

Tema: Shadowverse: Worlds Beyond

Repetir um erro dez mil vezes não o transforma em verdade.

Como usar os recursos de leitura

Ouvir lê o artigo em voz alta. A leitura rápida mostra trechos no ritmo escolhido. A prática de idiomas compara as traduções disponíveis. Salvar cria um favorito neste navegador, acessível na lista do player.

Compartilhar este artigo

Compartilhar este artigo

Publicidade
Publicidade

1. Eu só queria bater na cara e apareceu um laboratório

O objetivo era usar IA para achar o deck mais forte. Fixamos Set 8, banco de 826 cartas, commit do engine, hash do ambiente, decks legais e seeds. O baseline histórico de 12.480 jogos teve rule coverage 100%, unsupported 0 e rule gap 0, mas a IA crua ainda produziu números absurdos como Sword ~79,8% e Rune ~25,6%.

Repetir um erro dez mil vezes não o transforma em verdade.

2. Conselho humano piorou o bot e a média escondeu incêndios

human-prior-v1 foi testado em 2.016 paired units / 4.032 games: baseline 50,99%, novo 49,36%, -1,64pt. Adaptive v2 ganhou +0,74pt no geral, mas Runecraft caiu -6,25pt e falhou o leader floor; T11 também falhou, incluindo Abysscraft -16,67pt.

Conselho humano é contextual; fixed weight pode matar o contexto. A média pode passar enquanto uma classe pega fogo.

3. A análise causal encontrou bugs no próprio laboratório

Foram corrigidos um contrato max_nodes=160 desconectado e um erro actor/fixed-player que invertia conclusões causais. A plataforma melhorou, mas o desempenho amplo não voltou.

A pesquisa Set 8 terminou após 20 experimentos e 31.406 engine games em PAUSED_COMPLETE_NO_PROMOTION: 439 discordant units, 0 explicação causal completa, 11 parciais, 428 não resolvidas. human-prior-v1 ficou ativo e o final unseen holdout de 8.064 jogos permaneceu lacrado.

4. 52 decks jogaram 46.900 partidas e nasceu o ranking “sem cérebro vs sem cérebro”

O corpus teve 52 decks / 25 archetypes / 7 leaders. A análise de mercado usou 46.900 jogos; um 7×7 direto separado usou 1.512. Médias: Buff Forest 71,99%, Rally Sword 65,97%, Midrange Abyss 54,17%, Artifact Portal 54,17%, Ramp Dragon 53,70%, Evolution Haven 31,71%, Calgidensula Witch 18,29%.

São valores simulator-direct, não ladder WR. Decks em que “bom agora” continua bom depois parecem mais fáceis para a IA atual.

5. Em torneios humanos Witch vivia em outro universo

No Dexel Rising Cup #2 de 08/08/2026, Hand Witch apareceu em 116 de 384 listas, ~30,2%, a maior presença. Calgidensula Witch ficou última no 7×7 da IA com 18,29%. Não se deve assumir as mesmas 40 cartas, mas a diferença humano-IA é grande demais para ignorar.

Rally Sword foi forte nos dois mundos, sugerindo que estratégias resistentes a decisões imperfeitas podem ser escolhas mais robustas para não especialistas.

6. Future Optionality: regras sim; ordem e planos quase não

Auditamos 7 leaders / 24 mechanics em RULE, STATE, VISIBILITY, IMMEDIATE VALUE, FUTURE VALUE, SEQUENCE, SEARCH e PLAN. Em 27.810 decisions / 118.575 root candidates, só 8.878, 7,49%, tinham future value explícito. rule/state/immediate 24/24 supported; sequence faltava em 23/24 e plan em 20/24.

Witch mostrou efeito da ordem de draw; Dragon mostrou que PP e Awakening abrem escolhas futuras. Os 12 MYOPIC_REVERSAL de Dragon foram ramp 6 + Awakening 6, sem virar bônus fixo.

7. Construímos um planner closed-loop real de três turnos

O engine avança pelo menos 3 future turn boundaries, executa só uma ação, observa draw/random/opponent action e replana. Não olha hidden hand nem future draw order.

Ablation: 56 games, 3.979/3.979 root actions, 3-turn completion 100%, hidden-info 0, 81.621 replans e 35.821 plan changes. A implementação funcionou; o desempenho caiu -25,0 a -37,5pt vs human-prior-v1. Ver mais longe apenas permitiu errar mais longe.

8. Leaf calibration separou onde o ranking quebra

Foram capturados 3.979 root-action leaves, 1.009 unique leaves e 54.208 terminal rollout rows. Das 73 primeiras divergências: leaf weighting 59, chance aggregation 12, opponent backup 2.

O suspeito principal passou a ser a avaliação do leaf. Dos 12 antigos proxies Dragon, só 1/12 realmente mudou para ramp no search real de três turnos.

9. Learned value previu melhor e escolheu pior a melhor ação

Holdout v1.1 novo: 727 leaves / 104 roots / 22.768 terminal rollouts, sete leaders. Brier 0,1144→0,0972 e pairwise 75,7→78,9% melhoraram.

Mas root argmax 59,6→39,4%, top2 73,1→64,4%, top3 82,7→76,0%, mean regret 4,42→5,29pt; Forest/Haven/Portal falharam floors. HOLD_OFFLINE.

Prever probabilidades melhor não é o mesmo que escolher a melhor jogada.

10. Agora raciocinamos de trás para frente a partir do lethal

LETHAL ← dano ← PP ← cartas ← thresholds Spellboost/Awakening/Rally ← ação atual. Ramp não vale “+8 pontos”; vale quando uma rota concreta de vitória exige chegar a 8PP no tempo certo.

O objetivo gera requisitos para trás; o engine real verifica a rota para frente.

11. Também raciocinamos a partir da própria derrota

De SELF_LOSS vêm dano necessário do oponente, dano de board, dano adicional da mão, requisitos para remover Ward, PP e informação pública. Cada ação é medida pelas rotas de vitória adversárias que corta.

Segurança absoluta cria a IA que cura até perder educadamente. RISK_REQUIRED permite uma linha arriscada não-forced-loss quando linhas seguras quase não preservam chance real de vitória.

12. “Forçado” exige escopo de prova declarado

Vitória: PROVEN_WIN_NOW, FORCED_WIN_FULLY_OBSERVABLE_SUBTREE, FORCED_WIN_WITHIN_ENUMERATED_RESPONSE_SET, ROBUST_WIN_BELIEF, CONDITIONAL_WIN. Derrota separa do mesmo modo proof, belief e conditional.

No proof search, self=OR e opponent=AND. Certeza em chance exige cobrir todos os outcomes alcançáveis. Hidden-hand truth, future draw order e strategy fusion são proibidos; replanejamento só após observação.

13. Prioridade vira gates, não soma misteriosa de pontos

Ordem: proven win now → fully observable forced → enumerated forced → remover forced loss evitável → maximizar expected final win probability → near-tie safety → robustness → route progress/cut → validated continuation value.

belief/conditional não são forced. Só ações piores tanto em chance de vitória quanto em risco de derrota podem ser eliminadas como strictly dominated.

14. Três turnos são o mínimo, não uma parede

Configuração inicial H_MIN=3, selective H_MAX=5. Apenas branches com lethal, forced response, threshold importante, delayed payoff ou near tie não resolvido são estendidos.

Rollouts começam em 32/candidate; tops ambíguos recebem 64→128→256. Roots: UNIQUE_BEST / PRACTICAL_TIE / UNRESOLVED. epsilon 0,02/0,03/0,05 é decidido só em development e congelado antes do novo holdout.

15. Novo QC: capturar erros confiantes antes de procurar a IA mais forte

Primary exige zero hidden-info, future-draw, rule gap, strategy fusion, false proven, forced-scope mislabel, chance-completeness violation, lethal miss, avoidable forced loss e leakage. Depois verifica cobertura dos 7 leaders, argmax, mean/p90/p95 regret, leader floors e top2 best-set.

Brier/pairwise/calibration são Secondary e não salvam falha Primary. O holdout v1.1 está consumido para sempre.

Demos futuro ao bot e ele piorou. Ensinamos probabilidade e a previsão melhorou enquanto a melhor ação piorou. Agora ele raciocina para trás a partir de vitória e derrota, e só chama algo de “forçado” quando o escopo da evidência realmente prova isso.

Vamos criar a IA mais forte com IA. Por enquanto o QC talvez seja mais forte que o bot — e isso é saudável.


Para ler hoje

Cada um responde a uma pergunta que quem lê este artigo costuma ter em seguida.

Ver todos os artigosMais sobre Jogos de cartas e tabuleiro

Compartilhar este artigo

Publicidade

Mais um? Algo divertido?

Já que você terminou: algumas histórias próximas e outras totalmente diferentes, mas divertidas.

  1. Assunto próximoNão gaste 30 minutos decidindo um risco de 100 ienesa força de “pensei e fiz” está em comprimir risco e atrito de ação
  2. Ganhe no turno seis; só os piratas estão em outro jogoAggro Nightmare do Set 9, a marca WELCOME, o inferno do Éter Vermelho e seis vitórias seguidas
  3. Totalmente diferente, mas divertidoEles só saíram para procurar o cachorroum acidente em cadeia em que ninguém ganha e por que não se deve recolher um animal em uma faixa ativa por conta própria
  4. Como “fazer valer o preço” no jantar do Shabu-yo?Se 12 pratos de carne realmente são o ponto de equilíbrio e por que Gusto e Shabu-yo têm marcas diferentes mesmo sendo do grupo Skylark
  5. Por que fica mais difícil fazer amigos depois da faculdadeconhecer gente deixa de acontecer automaticamente e passa a exigir novos caminhos
  6. Comer dente-de-leão não garante virar estrelao que os anos de aperto de Masato Sakai revelam sobre uma profissão com candidatos demais e papéis de menos

Encontrar outros artigos

Todos os artigos

Mendoi-chan

Quem mantém o site

Mendoi-chan

Transforma as dificuldades do trabalho e do dia a dia em estruturas claras e próximos passos práticos.

Publicidade

Artigos recentes

  1. 1O padre ladrão de calcinha é pego, mas o “tio reprodutor” é herói? O mangá reduz os fetiches mais nichados e a web novel desperta até “Gravidez Imaginária”
  2. 2A humanidade não ganha isso — Tratei PRAGMATA como um museu lunar e acabei assustado com a capacidade industrial de uma civilização de máquinas
  3. 3Por que todos os meus ataques perdem? — Um jogador de Pyra/Mythra contra a intangibilidade do Kazuya e a barriga do crocodilo
  4. 4Para quem tem dificuldade de fazer coisas sozinho: desmonte o “se ninguém vier, eu não vou” e crie seu “SO de ação solo”
  5. 5a base lunar aguentou mais que o meu esquema de controles
Publicidade