1. Tudo começou com um objetivo simples: ganhar no card game
O plano original não era acadêmico: aumentar PP, tirar Ward, Storm na cara, ganhar.
Mas quando você começa a fazer milhares de partidas simuladas para comparar decks, surgem perguntas: é sorte? média basta? e um matchup horrível? como pensar com a mão adversária escondida? por que uma política nova piorou?
De repente entram Monte Carlo, atualização bayesiana, equilíbrio de Nash, programação dinâmica, POMDP, otimização robusta, inferência causal e contrafactuais.
A pessoa não precisa calcular tudo de cabeça. Ela escolhe o que quer descobrir; IA e código fazem repetição, registro, estatística e comparação.
2. Imagine criar um cargo: “professor de card game”
Treinar uma IA para jogar como um bom humano parece treinamento de funcionário novo.
O “estagiário” precisa aprender mulligan, guardar cartas, usar Evolução, prever resposta, planejar dois ou três turnos, calcular lethal, controlar mão e deixar espaço no board.
É informação demais para uma cabeça só, então o trabalho é quebrado: primeiro condição de vitória, depois recursos que não devem ser gastos agora, por fim checar se você morre no próximo turno.
Depois, a IA pratica milhares de jogos.
Quatro mil partidas de estágio já viraram centro industrial de treinamento.
3. Seguir conselho humano literalmente pode deixar a IA mais fraca
Guias dizem “guarde esta carta”, “reserve SEP”, “faça ramp cedo”, “segure peça de combo”.
Normalmente faz sentido, mas sempre há condições.
Guarde, a não ser que usar agora seja necessário para sobreviver. Reserve Evolução, a não ser que usar agora destrua o próximo turno rival. Rampe, a não ser que entregar o board faça você morrer.
Humanos completam essas exceções com experiência. A IA pode não completar.
Humano: “Normalmente segura.” IA: “Entendido.” IA: morre.
Seguir instrução e entender a intenção por trás da instrução são habilidades diferentes.
4. Busca em árvore: ler “esta jogada, a próxima e a próxima”
Suponha três ações: A remover inimigo, B atacar o líder, C guardar a carta.
Cada ação abre um futuro diferente. O rival também tem várias respostas. Esses ramos formam uma árvore.
O problema é explosão combinatória. Dez opções por etapa podem virar cerca de dez mil ramos em quatro etapas.
Por isso usamos limite de profundidade, beam search para manter ramos promissores e orçamento de nós para limitar cálculo.
Mas podar cedo demais pode apagar uma jogada ruim agora e excelente daqui a dois turnos.
Buscar não é só “ver mais longe”. É decidir quais futuros continuam vivos.
5. As outras teorias resolvem outros problemas
Monte Carlo: simular muitas vezes e olhar a média.
Atualização bayesiana: mudar a chance de o rival ter algo depois de observar suas ações.
POMDP: decidir quando parte do estado verdadeiro está escondida.
Minimax: considerar que o rival dará a resposta mais forte.
Equilíbrio de Nash: estudar estratégias em que mudar sozinho não dá vantagem fácil.
Aprendizado sem arrependimento: reduzir ao longo do tempo o “eu devia ter escolhido outra coisa”.
Otimização robusta: ser forte sem desabar em matchups ruins.
CVaR: olhar a faixa de resultados ruins.
A/B pareado: mesmo seed, decks e ordem; muda só a política.
Intervalo de confiança: medir quanto da diferença pode ser ruído.
Ablação: retirar um componente por vez.
Contrafactual: testar outra ação a partir do mesmo estado.
Inferência causal: verificar se mudar a suposta causa muda o resultado.
Em linguagem comum: testar bastante, atualizar suspeitas, olhar cenário ruim, comparar de forma justa e investigar um suspeito por vez.
6. Onde termina “faculdade” e começa “pós-graduação”?
Estatística, Monte Carlo, programação dinâmica, teoria dos jogos, Bayes e otimização aparecem na graduação.
O lado mais “pós” é o processo: ver regressão, criar hipóteses, prever sinais observáveis, adicionar logs, mudar uma peça, testar contrafactual, usar dados nunca vistos e rejeitar a política se ela falhar.
A graduação dá ferramentas. Pesquisa pergunta como usar essas ferramentas para construir evidência.
7. Humanas ou exatas? Problemas reais misturam
Busca, algoritmos, probabilidade e reforço são bem de exatas/computação.
Teoria dos jogos, Nash, Pareto, risco e decisão também aparecem em economia e pesquisa operacional.
Inferência causal aparece em economia, medicina, ciências sociais e IA.
Problemas reais não respeitam departamentos.
Até um board de card game pode virar laboratório interdisciplinar.
8. O valor da faculdade ou curso técnico não é lembrar tudo
É normal esquecer fórmulas anos depois.
Mas saber que existem Monte Carlo, Bayes, otimização e teoria dos jogos cria um índice mental.
Quando surge um problema, você consegue pensar: “Isso parece Bayes”, “talvez seja otimização”, “vamos comparar nas mesmas condições”.
É muito melhor do que nem saber o que pesquisar.
Educação cria um mapa de ferramentas. Cursos técnicos fazem algo parecido: base primeiro, profundidade quando o trabalho exige.
9. IA aumenta muito o valor de “sei a base”
Antes, saber o nome de uma teoria não ajudava tanto se você não conseguia derivar, programar e fazer estatística.
Agora a pessoa pode orientar: “Monte Carlo cabe aqui?”, “isso parece informação parcial?”, “veja se essa diferença pode ser acaso”, “faça ablação para separar causas”.
A IA ajuda com implementação e cálculo.
Conhecimento básico passa de “resolver tudo sozinho” para saber qual trabalho intelectual delegar.
10. Não ter alergia a conhecimento é uma vantagem
POMDP, PSRO, CVaR, cluster bootstrap.
Os nomes assustam.
Mas se a primeira pergunta for “para que serve?” em vez de “isso não é para mim”, você já entrou.
POMDP: informação escondida. PSRO: adicionar respostas fortes. CVaR: olhar resultados ruins. Cluster bootstrap: medir incerteza respeitando grupos de dados relacionados.
Não é preciso entender tudo antes de tocar. Você toca primeiro e aprofunda com IA depois.
11. Se a memória de trabalho enche, coloque a memória para fora da cabeça
Card game já exige mão, board, PP, Evolução, resposta rival, Ward, cura, lethal e próximos turnos.
Pesquisa acrescenta seeds, hashes, configs, hipóteses, intervalos e histórico.
Não faz sentido guardar tudo mentalmente.
Condições em configs, cálculos em código, histórico em logs, comparações grandes em IA.
A pessoa guarda a pergunta e o “isso parece estranho”.
Isso não é trapaça. É preservar o cérebro para julgamento.
12. Conclusão: eu queria Storm na cara e acabei entendendo o valor da educação
Um card game conectou busca, probabilidade, estatística, teoria dos jogos, causalidade, educação e IA.
Você não precisa dominar tudo quando aprende pela primeira vez.
Ter visto, conhecer o nome e não ter medo já cria uma porta para usar aquilo anos depois.
A IA reduz muito o custo entre “já ouvi falar” e “consigo testar num problema real”.
A pessoa pergunta. A máquina calcula. Se o resultado parece estranho, a pessoa pergunta de novo.
No final, o plano original continua simples.
Tira Ward. Evolui.
Storm na cara.
Um lugar inesperado para a educação se pagar.
