Je voulais juste faire Storm face, et toutes les théories croisées à l’université se sont mises à servir — Pourquoi « apprendre les bases puis pratiquer avec l’IA » est si puissant

Le plan n’avait rien d’académique : gagner du PP, retirer Ward, Storm face, gagner.

Utiliser les outils de lecture

Écouter lit l’article à voix haute. La lecture rapide affiche les groupes de mots au rythme choisi. La pratique des langues compare les traductions disponibles. Enregistrer ajoute un favori dans ce navigateur, accessible dans la liste du lecteur.

Partager cet article

Partager cet article

Publicité
Publicité

1. Au départ, je voulais seulement gagner à un jeu de cartes

Le plan n’avait rien d’académique : gagner du PP, retirer Ward, Storm face, gagner.

Puis on fait jouer l’IA des milliers de parties pour comparer des decks, et les questions arrivent : est-ce du hasard ? la moyenne suffit-elle ? que faire d’un matchup catastrophique ? comment raisonner avec une main adverse cachée ? pourquoi une nouvelle politique régresse-t-elle ?

Soudain apparaissent Monte Carlo, mise à jour bayésienne, équilibre de Nash, programmation dynamique, POMDP, optimisation robuste, inférence causale et contrefactuels.

L’humain n’a pas besoin de calculer tout cela mentalement. Il choisit la question ; l’IA et le code gèrent répétition, journalisation, statistiques et comparaisons.

2. Imaginons un métier : « professeur de jeu de cartes »

Entraîner une IA à jouer comme un bon humain ressemble à former un nouvel employé.

Le « stagiaire » doit apprendre le mulligan, la conservation des cartes, l’usage de l’Évolution, les réponses adverses, le plan à deux ou trois tours, le lethal, la taille de main et l’espace de board.

Trop d’informations à tenir simultanément, donc on conçoit le travail : condition de victoire, ressources à ne pas dépenser, puis vérification de la survie au prochain tour.

Puis l’IA pratique des milliers de parties.

Quatre mille parties de stage, ce n’est plus un stage, c’est une usine de formation.

3. Suivre littéralement un conseil humain peut rendre l’IA plus faible

Les guides disent : « garde cette carte », « réserve SEP », « rampe tôt », « garde les pièces de combo ».

C’est souvent juste, mais conditionnel.

Garde-la, sauf si la jouer évite de mourir. Économise l’Évolution, sauf si la dépenser maintenant détruit le prochain tour adverse. Rampe, sauf si perdre le board signifie mourir.

Les humains ajoutent automatiquement ces exceptions grâce à l’expérience. L’IA peut ne pas le faire.

Humain : « En général, garde-la. » IA : « Compris. » IA : meurt.

Obéir à une instruction et comprendre son objectif sont deux compétences différentes.

4. Recherche arborescente : lire « ce coup, le suivant, puis le suivant »

Supposons trois actions : A retirer une unité, B attaquer le leader, C conserver la carte.

Chaque action ouvre un futur différent, puis l’adversaire possède plusieurs réponses. Ces branches forment un arbre.

Le problème : les branches explosent. Dix choix par étape peuvent donner environ dix mille branches en quatre étapes.

On utilise donc une limite de profondeur, le beam search et un budget de nœuds.

Mais couper trop tôt peut supprimer une action faible maintenant mais excellente dans deux tours.

Chercher ne signifie pas seulement « regarder plus loin ». Il faut décider quels futurs méritent de rester vivants.

5. Les autres théories ont chacune un rôle

Monte Carlo : simuler de nombreuses fois et regarder la moyenne.

Mise à jour bayésienne : modifier la probabilité que l’adversaire possède quelque chose après observation.

POMDP : décider lorsque certaines informations réelles sont cachées.

Minimax : supposer que l’adversaire choisit la meilleure réponse.

Équilibre de Nash : étudier les stratégies où changer seul n’apporte pas facilement un avantage.

Apprentissage sans regret : réduire sur le long terme le « j’aurais dû choisir autre chose ».

Optimisation robuste : être fort sans s’effondrer dans les mauvais matchups.

CVaR : regarder la zone des mauvais résultats.

A/B apparié : même seed, mêmes decks, même ordre ; seule la politique change.

Intervalle de confiance : mesurer combien de différence peut venir du bruit.

Ablation : retirer un composant à la fois.

Contrefactuel : tester une autre action depuis le même état.

Inférence causale : vérifier si modifier la cause supposée modifie réellement le résultat.

Les noms anglais impressionnent. En français simple : tester souvent, mettre à jour une hypothèse, regarder le pire, comparer proprement et interroger un suspect à la fois.

6. Où finit le niveau licence et où commence l’esprit recherche ?

Statistiques, Monte Carlo, programmation dynamique, théorie des jeux, Bayes et optimisation peuvent apparaître à l’université.

Ce qui ressemble davantage à la recherche avancée est la boucle : observer une régression, formuler plusieurs hypothèses, prédire les preuves attendues, ajouter des traces, changer un composant, tester des contrefactuels, utiliser des données jamais vues et refuser la méthode si elle échoue.

L’université donne une boîte à outils. La recherche demande comment produire des preuves convaincantes avec ces outils.

7. Sciences humaines ou STEM ? Les vrais problèmes mélangent tout

Recherche, algorithmes, probabilités et apprentissage par renforcement sont très techniques.

Théorie des jeux, Nash, Pareto, risque et décision sont aussi présents en économie et recherche opérationnelle.

L’inférence causale apparaît en économie, médecine, sciences sociales et IA.

Les problèmes réels ne respectent pas les départements.

Même un board de cartes peut devenir un laboratoire interdisciplinaire.

8. La valeur des études n’est pas de tout mémoriser

Il est normal d’oublier des formules après des années.

Mais avoir entendu parler de Monte Carlo, Bayes, optimisation ou théorie des jeux crée un index mental.

Face à un problème, on peut penser : « Ça ressemble à Bayes », « c’est peut-être une optimisation », « comparons sous les mêmes conditions ».

C’est bien plus facile que de ne même pas savoir quoi chercher.

L’éducation construit une carte des outils. La formation professionnelle fonctionne aussi ainsi : bases d’abord, profondeur lorsque la pratique l’exige.

9. L’IA augmente énormément la valeur de « connaître les bases »

Autrefois, connaître le nom d’une méthode pouvait être insuffisant si l’on ne savait pas dériver les équations, coder et faire les statistiques.

Aujourd’hui, l’humain peut orienter : « Monte Carlo convient-il ici ? », « est-ce un problème d’information cachée ? », « cette différence peut-elle être du hasard ? », « faisons une ablation ».

L’IA aide à implémenter et calculer.

La connaissance de base devient aussi un index pour donner le bon travail intellectuel à l’IA.

10. Ne pas avoir “d’allergie au savoir” est un avantage

POMDP, PSRO, CVaR, cluster bootstrap.

Les mots sont agressifs.

Mais si votre première réaction est « à quoi ça sert ? » plutôt que « ce n’est pas pour moi », vous êtes déjà entré.

POMDP : information cachée. PSRO : ajouter des réponses fortes. CVaR : regarder les mauvais résultats. Cluster bootstrap : mesurer l’incertitude en respectant les groupes liés.

Pas besoin de tout comprendre avant de toucher. On touche d’abord, on approfondit avec l’IA ensuite.

11. Si la mémoire de travail sature, sortez la mémoire de votre tête

Un jeu de cartes demande déjà main, board, PP, Évolution, réponses, Ward, soins, lethal et tours futurs.

La recherche ajoute seeds, hashes, configs, hypothèses, intervalles et historique.

Inutile de tout mémoriser.

Conditions dans les configs, calculs dans le code, historique dans les logs, comparaisons massives par l’IA.

L’humain garde la question et le sentiment : « ce résultat est bizarre ».

Ce n’est pas tricher. C’est réserver le cerveau au jugement.

12. Conclusion : je voulais Storm face et j’ai compris l’utilité des études

Un jeu de cartes a relié recherche, probabilités, statistiques, théorie des jeux, causalité, éducation et IA.

Pas besoin de tout maîtriser lors du premier apprentissage.

Avoir vu l’idée, connaître son nom et ne pas en avoir peur suffit déjà à créer une porte d’entrée pour plus tard.

L’IA réduit énormément le coût entre « ça me dit quelque chose » et « je peux le tester sur un vrai problème ».

L’humain pose la question. La machine calcule. Le résultat paraît étrange, l’humain repose une question.

Et l’objectif d’origine reste simple.

Retirer Ward. Évoluer.

Storm face.

Endroit inattendu pour rentabiliser les études.


PublicitéLivres sur ce sujet

  • Co-Intelligence (édition anglaise)

    Ethan Mollick / Penguin Publishing Group / 2024

    Un livre sur IA, le sujet de cet article.

  • The Coming Wave (édition anglaise)

    Mustafa Suleyman / Penguin Random House / 2023

    Un livre sur IA, le sujet de cet article.

Cet article contient des liens affiliés (publicité). À propos de la publicité En tant que Partenaire Amazon, je réalise un bénéfice sur les achats remplissant les conditions requises. As an Amazon Associate I earn from qualifying purchases.

Partager cet article

Publicité

À lire aujourd’hui

Chacun répond à une question que se posent souvent les lecteurs de cet article.

Voir tous les articlesPlus sur AI

Trouver d’autres articles

Tous les articles

Mendoi-chan

Rédigé par

Mendoi-chan

Elle transforme les frictions du travail et du quotidien en structures claires et en prochaines étapes concrètes.

À propos
Publicité

Articles récents

  1. 15 millions de yens de loyer, est-ce vraiment de « l’argent jeté » ? À une ou deux personnes, acheter uniquement la surface réellement utilisée peut être plus rationnel
  2. 2Un salaire annuel de 6 millions de yens est-il élevé ? Si « mes 30 amis gagnent tous ça » devient l’échantillon du Japon, le dénominateur explose
  3. 3Le corps humain est absurdement peu pratique : pourquoi il n’existe pas un seul « +1 d’endurance »
  4. 4Ne mettez pas un péage au milieu d’un article : “Suivant”, pages vues, paywall et rafraîchissement publicitaire
  5. 5L’IA atteint sa limite, le streaming aussi — et le vrai temps libre réapparaît
Publicité