1. Decida primeiro: fazer o jogo ou o laboratório que descobre como vencer?
Para pesquisar decks e jogadas, você não precisa começar por arte, animação, voz e UI.
O núcleo é:
estado atual
→ gerar ações legais
→ escolher
→ aplicar regras
→ próximo estado
O produto é um laboratório numérico.
Se houver engine confiável, reutilize. Se não, faça primeiro as regras mínimas corretas.
2. Defina entradas e saídas antes do código
Entradas: card DB, decks, first/second, seed, policy, environment, jogos.
Saídas: winner, turns, matchup WR, first/second gap, worst matchup, brick, key-card drop, erros, melhorias de deck.
O simulator começa pela pergunta.
3. Card DB — dados não são comportamento
Guarde ID, nome, classe, custo, tipo, stats, rarity, set, text, evolution, related cards, tags.
JSON ou SQLite bastam.
“Fanfare: 4 damage” ainda não implementa target, redução, trigger e ordering.
DB guarda manuais; Rules Engine executa.
4. Represente o jogo como state
Guarde turn, active player, HP, PP, hand, deck, board, graveyard, Evolution, Super-Evolution, Crests, amulets, counters, temporary effects.
O significado das regras importa mais que a tela.
5. Rules Engine = state A → action → state B
Play, attack, Evolution, Act, target, end turn, draw, PP refresh e win check são transitions.
O engine deve ser correto até com bot burro.
6. Efeitos genéricos + exceções
Crie damage, heal, draw, buff, summon, destroy, banish, Ward, Storm.
Casos especiais usam overrides.
Conte unsupported, partial, runtime gaps.
7. Legal action generation
Inclua playable cards, targets, attacks, Evolution, Act, end turn e, quando fizer sentido, hold, draw-first, board-slot clearing.
Pergunte:
a ação correta existia no candidate set?
8. Seed, replay e hash
Fixe seed e guarde engine commit, DB hash, deck hash, policy hash, environment hash, schedule hash, seed hash.
Mesmas condições devem reproduzir a mesma partida.
9. Primeira IA simples
Reference policy: lethal → finish; vai morrer → defender; curve; board bom → face; board ruim → trade.
Ela é baseline.
10. Human knowledge como prior
Use mulligan, hold, EP/SEP, setup, swing turn, hand cap, board slot, future lethal.
Não transforme isso em lei absoluta.
Use scores como hold_value, future_combo, survival, premature_spend.
Guide é mapa.
11. Tree Search, Beam, Node Budget
10 candidatos por camada viram 10, 100, 1.000, 10.000.
Use depth, beam width, node budget, pruning.
Não elimine cedo demais o setup importante.
Separe immediate, future, survival, setup, lethal, resource value.
12. Hidden hand: Belief, POMDP, Monte Carlo
Não dê hidden hand real para a policy.
Crie mundos: AoE 30%, Ward 20%, nada 50%.
Isso é belief.
O problema lembra POMDP; sample mãos e rode futuros várias vezes.
13. Large simulation como paired A/B
Mesmo deck, rival, first/second, seed; muda só policy.
Quick → development → unseen holdout.
Objetivo: reduzir noise sem perder comparação justa.
14. Meça mais que win rate
Average, meta-weighted, worst matchup, bottom average, variance, first/second gap, brick, key-card drop, turns, confidence intervals.
CVaR olha a parte ruim.
Bootstrap e McNemar ajudam paired A/B.
15. Deck optimization comprime o espaço
Não dá para testar todas as combinações de 40 cartas.
Parta de decks reais e teste swaps, role replacement e techs.
Double Oracle adiciona counters, PSRO usa deck + policy, No-Regret reduz regret, Robust Optimization protege o floor.
16. Registre por que a IA perdeu
Action trace guarda candidates, scores, choice, objective, reservation, early combo spend, missed lethal, hand burn, board lock.
Ablation desliga componentes.
Counterfactual compara A e B no mesmo public state.
17. Nova expansão = novo environment snapshot
Guarde format, legal sets e hashes.
Faça diff da DB e recalcule só decks/matchups afetados.
Só mudou meta weight? Reutilize resultados.
18. Arquitetura pequena e CLI-first
Separe upstream, deck, policy, simulation, diagnosis, statistics, config, data, reports, docs, tests.
CLI: status, doctor, db check, validate, simulate, experiment, optimize, diagnose, context.
GitHub vira memória externa do laboratório.
19. Roadmap zero-to-one
1 card DB
2 uma partida mínima correta
3 legal actions/targets
4 seed/replay/hash
5 simple policy + 100 games
6 coverage
7 real decks + matrix
8 human prior
9 search + belief
10 paired A/B + holdout
11 deck optimization
12 diagnosis + expansion diff
Não faça uma máquina errar 10.000 vezes por minuto.
20. Conclusão
DB = memória. Rules Engine = física. Policy = cérebro. Search = antecipação. Statistics = boletim. Action Trace = câmera. Git = caderno. AI Agents = pesquisadores.
O humano pergunta:
“Esse número é realmente confiável?”
Começou como Storm na cara.
Terminou como laboratório de IA.
Tira Ward, evolui,
Storm na cara.
