CV ici
Professeur agrégé en mathématiques
Docteur en mathématiques appliquées
Sujet de thèse : Apprentissage dans les jeux stochastiques
Lieu : INRIA Grenoble, LIG, équipe POLARIS
Directeurs de thèse : Nicolas Gast et Bruno Gaujal
Ingénieur diplômé de l'ENSIMAG
Activité la plus récente : ATER à l'IUT2 Grenoble
Mail académique : romain.cravic@univ-grenoble-alpes.fr
Mes travaux de recherche étudient deux problématiques distinctes :
1) L'apprentissage boite noire dans les jeux à information complète (algorithmes Q-learning avec optimisme)
2) La résolution de jeux à information incomplète (algorithmes Monte-Carlo CFR)
Pour découvrir mes travaux de recherche, vous trouverez ci-dessous :
Mon manuscrit de thèse ( pdf )
Mes slides de soutenance ( pdf )
Le projet Python pour la partie expérimentale (lien à venir)
Un article publié à la conférence AAMAS 2023 concernant la première partie ( pdf )
Deux versions d'articles non publiés concernant la deuxième partie ( pdf et pdf )
Résumé des travaux de thèse :
Cette thèse traite de deux problèmes d'apprentissage dans les jeux stochastiques à deux joueurs et à somme nulle. Le premier problème consiste à ce que l'apprenant incarne un des deux joueurs et apprenne à jouer efficacement contre un adversaire arbitraire via un simulateur du jeu dont il ignore les paramètres internes au début du processus d'apprentissage. Le deuxième problème consiste à apprendre l'équilibre de Nash du jeu par auto-apprentissage en ayant une parfaite connaissance du modèle considéré.
Pour le premier problème, les jeux considérés sont à information complète, c'est-à-dire que les joueurs observent parfaitement l'état courant du jeu au moment de prendre des décisions. A l'inverse, nous ne faisons pas cette hypothèse pour le deuxième problème et considérons des jeux à information incomplète où les joueurs doivent se fier à l'historique de leurs observations passées pour inférer l'état du jeu et les informations obtenues par leur adversaire.
Pour chacun des deux problèmes nous proposons un algorithme qui traite le cas des jeux à horizon de temps infini en le reliant au cas fini via l'introduction d'un facteur d'amortissement dans les récompenses produites par le jeu au cours du temps. Plus précisément nous proposons l'algorithme DONQ-learning pour le premier problème qu'on appelle apprentissage boite noire dans les jeux à information complète, et l'algorithme DOS-CFR pour le deuxième problème qu'on appelle ici résolution des jeux à information incomplète. Dans les deux cas les garanties théoriques établies dans notre analyse de ces algorithmes se traduisent par l'obtention de bornes de regrets probabilistes et sous-linéaires en l'horizon de temps T qui tend vers l'infini.
Pour finir, la thèse comporte une partie expérimentale consistant à élaborer une intelligence artificielle capable de jouer efficacement à un jeu de mémoire et de bluff : le Robin Wood.
Vous trouverez également ci-dessous la liste des séminaires que j'ai présentés durant mon doctorat.
2022, Polaris-tt : Stochastic games and Nash equilibria (slides)
2022, LiPhy non-permanent's seminar : Optimal strategies in random situations (slides)
2023, Polaris-tt : Learning in finite-horizon MDP with UCB (slides)
2023, Conference AAMAS : Decentralized Model-free RL for stochastic games with average-reward objective (slides, poster)
2024, Séminaire-tutoriel POLARIS : IIEFG, algorithmes CFR et variantes de Monte-Carlo, partie 1 (Slides)
2024, Séminaire-tutoriel POLARIS : IIEFG, algorithmes CFR et variantes de Monte-Carlo, partie 2 (Slides)
Voici pour finir une description des stages que j'ai co-encadrés avec mes directeurs pendant mon doctorat.
Eté 2023 : j'ai été le co-encadrant d'Abel Douzal, un étudiant de l'ENS Ulm, pour son stage de L3 qui a duré 2 mois. Le stage consistait à comprendre le modèle des jeux stochastiques à observation partielle et les algorithmes existant dans la littérature qui permettent de les résoudre, pour ensuite les appliquer sur un jeu de proie-chasseur.
Eté 2024 : J'ai été le co-encadrant de Rafael Mascarenhas-dall-nery un étudiant de L3 info à l'UGA, pour son stage de L3 qui a duré 2 mois. Le but du stage était de comprendre le fonctionnement des algorithmes type MCCFR dans les jeux à information incomplète sous forme extensive et d'appliquer ces algos à une variante de Poker faite maison pour comparer les performences des différentes variantes de l'algorithme. Rafael s'est intéressé également à la combinaison de ces algorithmes avec des réseaux de neurones.
Vous trouverez ci-dessous la liste des enseignements que j'ai effectués à l'Université Grenoble Alpes, plus précisément au DLST, à l'UFR IM2AG, et à l'IUT2 département informatique.
L1 IMA TD Algèbre linéaire.
L1 IMA CTD Algorithmique et programmation en Python.
L1 INF TD Système et environnement de programmation.
BUT1 info CTD Outils mathématiques fondamentaux
BUT1 info CTD Mathématiques discrètes
BUT1 info TP Initiation au développement
BUT1 info TP Développement orienté objet
BUT1 info CTD Méthodes numériques
L1 SV CTD Outils fondamentaux de mathématiques pour les sciences de la nature.
BUT2 info CTD Probabilités
BUT2 info CTD Algèbre linéaire
L3 MMA TP Introduction à la modélisation numérique.
BUT3 info CTD Codes correcteurs d'erreurs
M2 ORCO CM Optimization Under Uncertainty.
Vous trouverez également ci-après la liste des formations et ateliers auxquels j'ai participé dans un objectif de perfectionnement de mes compétences pédagogiques.
Parcours ES (stage intensif de 3 jours à Autrans et formations à la carte)
Atelier "Math a modeler" (médiation des mathématiques par le jeu aurpsè d'un jeune public)
Formation à l'utilisation de plateformes pédagogiques (Moodle, Chamilo, ...)
Vous trouverez ci-dessous l'historique de ma formation universitaire et mes réussites depuis le bac.
2025 : Diplôme -> Doctorat
2025 : Titularisation dans le corps des agrégés.
2021-2025 : Doctorat en mathématiques appliquées à l'INRIA de Grenoble
2021 : Diplome -> Master ORCO
2021 : Diplome -> Diplome ingénieur ENSIMAG
2020-2021 : Formation Master 2 ORCO à l'UFR IM2AG (Operational research and combinatorial optimization)
2019-2020 : Formation ingénieur ENSIMAG 2ème année filière MMIS
2019 : Concours -> Agrégation de mathématiques (classé 41ème)
2018-2019 : Formation Master 2 Préparation à l'agrégation externe de mathématiques à l'institut Fourrier.
2017-2018 : Formation Master 1 Mathématiques générales à l'institut Fourrier
2016-2017 : Formation ingénieur ENSIMAG première année.
2016 : Concours de prépas CCP (classé 93ème)
2014-2016 : Formation prépa MPSI-MP au lycé Carnot à Dijon
2014 : Bas S (mention très bien)