Référence : CARE-SPEECH-MIAI-POC-001
Nombre de Postes : 1
Lieu de travail : ST MARTIN D HERES
Date de publication : lundi 27 avril 2026
Type de contrat : CDD de recherche (post-doctorat ou ingénieur de recherche)
Durée du contrat : 18 mois
Date d'embauche : 1 octobre 2026
Quotité de travail : Complet
Rémunération : Selon expérience et grille en vigueur
Niveau d'études souhaité : Doctorat / Master
Expérience souhaitée : Expérience en IA parole / traitement du signal / machine learning
Section(s) CN : 03 - Sciences informatiques : signaux, images, langues, automatique, robotique, interactions, systèmes intégrés matériel-logiciel
Le candidat ou la candidate contribuera au développement de méthodes d’intelligence artificielle pour l’aide au dépistage précoce et au suivi longitudinal des troubles de la parole et du langage dans le cadre du projet CARE-SPEECH.
L’objectif principal consiste à développer des modèles robustes d’analyse automatique de la parole à partir d’enregistrements réalisés en conditions réelles (smartphone, environnement domestique), afin de produire des indicateurs cliniquement interprétables à destination des orthophonistes.
La personne recrutée participera à la conception, l’évaluation et l’intégration de pipelines IA exploitant des approches modernes de traitement automatique de la parole (ASR, modèles auto-supervisés, deep learning, modèles multimodaux) appliquées à la santé numérique.
Les missions principales de la personne recrutée sont :
Mise en place et coordination de collectes de données de parole auprès d’écoles, de cabinets d’orthophonie et de partenaires cliniques, dans le respect des protocoles éthiques et réglementaires.
Développement de méthodes d’analyse automatique de la parole pour le dépistage et le suivi des troubles de la parole et du langage.
Conception et évaluation de pipelines robustes exploitant des modèles de reconnaissance automatique de la parole (ASR) et des représentations auto-supervisées (SSL).
Adaptation et fine-tuning de modèles de parole pré-entraînés pour des données cliniques et écologiques.
Définition d’indicateurs explicables et cliniquement pertinents pour l’aide à la décision.
Évaluation des performances et de la robustesse sur des données réelles et longitudinales.
Participation à l’intégration des modèles IA dans une application mobile destinée aux patients et aidants.
Valorisation scientifique des travaux (publications scientifiques, logiciels et dépôts APP).
Formation
Doctorat ou Master en informatique, traitement automatique de la parole, intelligence artificielle, sciences du langage, linguistique computationnelle, traitement du signal, ou discipline connexe.
Très bonnes compétences en apprentissage automatique et profond.
Expérience en traitement automatique de la parole (speech processing / speech AI).
Bonne maîtrise de Python et des frameworks IA (PyTorch, TensorFlow ou équivalent).
Connaissance des approches modernes de reconnaissance automatique de la parole (Whisper, wav2vec2, HuBERT, etc.) ainsi que des méthodes d'alignement forcé phonétique (CTC alignment, Montreal Forced Aligner, WhisperX, etc.).
Une expérience en apprentissage auto-supervisé, modèles de fondation ou LLMs est appréciée.
Connaissances en phonétique, phonologie, linguistique clinique ou sciences du langage appliquées à la parole pathologique.
Compréhension des marqueurs linguistiques et prosodiques associés aux troubles de la parole et du langage.
Intérêt pour l’analyse conjointe des dimensions acoustiques, linguistiques et interactionnelles de la parole, et les applications en IA en santé numérique.
Capacité à travailler dans un environnement interdisciplinaire.
Intérêt pour les interactions avec les professionnels de santé.
Autonomie, rigueur scientifique et capacité d’initiative.
Bonnes compétences en rédaction scientifique et communication en anglais.
Les travaux se dérouleront au Laboratoire d’Informatique de Grenoble (LIG), laboratoire de recherche de référence regroupant plus de 450 membres et couvrant un large spectre de thématiques en informatique et intelligence artificielle.
La personne recrutée intégrera les activités de recherche en IA appliquée à la santé et au traitement de la parole menées par Fabien Ringeval au sein du LIG. Elle travaillera en interaction étroite avec des chercheurs en IA, traitement automatique de la parole, santé numérique et interaction humain-machine.
Le poste s’inscrit dans le projet CARE-SPEECH, un projet soutenu par le programme MIAI Proof of Concept (PoC) visant à développer des outils d’IA fiables et centrés sur l'humain pour le dépistage précoce et l’accompagnement thérapeutique des troubles de la parole et du langage. Le projet repose sur une forte collaboration académique–industrielle avec la startup SuperBlabla.
Le candidat ou la candidate collaborera notamment avec :
Léonore Leleu (CEO Superblabla, anciennce orthophoniste en libéral),
Daniel Chipan (CTO Superblabla, développeur full-stack),
ainsi qu’un réseau de partenaires académiques et cliniques impliqués dans le projet.
Le poste est ouvert à des profils académiques orientés recherche ainsi qu’à des profils ingénieurs expérimentés en IA parole et développement appliqué.
Le poste se situe dans un secteur relevant de la protection du potentiel scientifique et technique (PPST), et nécessite donc, conformément à la réglementation, que votre arrivée soit autorisée par l'autorité compétente du MESR.
Référence : CARE-SPEECH-MIAI-POC-002
Nombre de Postes : 1
Lieu de travail : ST MARTIN D HERES
Date de publication : Vendredi 22 avril 2026
Type de contrat : CDD de recherche (post-doctorat ou ingénieur de recherche)
Durée du contrat : 18 mois
Date d'embauche prévue : 1 mars 2027
Quotité de travail : Complet
Rémunération : Selon expérience et grille en vigueur
Niveau d'études souhaité : Doctorat / Master
Expérience souhaitée : Expérience en IA générative / modèles de langage (LLMs) / systèmes multi-agents (IA agentique)
Section(s) CN : 03 - Sciences informatiques : signaux, images, langues, automatique, robotique, interactions, systèmes intégrés matériel-logiciel
Conception et développement de systèmes IA générative et agentique pour l’assistance aux orthophonistes dans le suivi thérapeutique, l’aide à la décision et la rédaction de comptes-rendus de bilans orthophoniques.
Développement de workflows exploitant des modèles de langage (LLMs), des architectures multi-agents et des approches multimodales combinant parole, texte et contexte clinique.
Conception de mécanismes d’explicabilité, traçabilité et contrôle humain des recommandations IA dans un paradigme de clinician-in-the-loop AI.
Interaction avec des orthophonistes pour l’évaluation des usages, besoins cliniques et contraintes métier.
Participation à la validation expérimentale et à la valorisation scientifique et technologique des travaux (publications, logiciels, dépôts APP).
Très bonnes compétences en intelligence artificielle, machine learning et deep learning.
Expérience en IA générative, modèles de langage (LLMs) ou NLP.
Connaissance des architectures agentiques, systèmes multi-agents ou frameworks d’orchestration LLM (LangChain, LangGraph, AutoGen, CrewAI, etc.).
Bonne maîtrise de Python et des frameworks IA modernes.
Expérience en développement logiciel et intégration de systèmes IA.
Intérêt pour les problématiques d’IA explicable, fiable et centrée sur l’humain.
Connaissances en interaction humain–machine, technologies de santé numérique ou raisonnement clinique appréciées.
Une expérience en traitement automatique de la parole ou données multimodales est un atout.
Capacité à travailler dans un environnement interdisciplinaire associant IA, santé et développement logiciel.
Intérêt pour les interactions avec les professionnels de santé et les utilisateurs finaux.
Sens de l’organisation et capacité à développer des systèmes robustes et utilisables en pratique.
Autonomie, rigueur scientifique et capacité d’initiative.
Bonnes compétences en rédaction scientifique et communication en anglais.
Les travaux se dérouleront au Laboratoire d’Informatique de Grenoble (LIG), laboratoire de recherche de référence regroupant plus de 450 membres et couvrant un large spectre de thématiques en informatique et intelligence artificielle.
La personne recrutée intégrera les activités de recherche en IA appliquée à la santé et au traitement de la parole menées par Fabien Ringeval au sein du LIG. Elle travaillera en interaction étroite avec des chercheurs en IA, traitement automatique de la parole, santé numérique et interaction humain-machine.
Le poste s’inscrit dans le projet CARE-SPEECH, un projet soutenu par le programme MIAI Proof of Concept (PoC) visant à développer des outils d’IA fiables et centrés sur l'humain pour le dépistage précoce et l’accompagnement thérapeutique des troubles de la parole et du langage. Le projet repose sur une forte collaboration académique–industrielle avec la startup SuperBlabla.
Le candidat ou la candidate collaborera notamment avec :
Léonore Leleu (CEO Superblabla, anciennce orthophoniste en libéral),
Daniel Chipan (CTO Superblabla, développeur full-stack),
ainsi qu’un réseau de partenaires académiques et cliniques impliqués dans le projet.
Le poste est ouvert à des profils académiques orientés recherche ainsi qu’à des profils ingénieurs expérimentés en IA parole et développement appliqué.
Le poste se situe dans un secteur relevant de la protection du potentiel scientifique et technique (PPST), et nécessite donc, conformément à la réglementation, que votre arrivée soit autorisée par l'autorité compétente du MESR.
Les tâches de répétition de phrases sont utilisées pour explorer les compétences langagières des enfants et contribuer au repérage des troubles développementaux du langage (TDL). Leur analyse peut dépasser la simple mesure de fidélité à la phrase cible : les omissions de mots fonctionnels, les modifications de la morphologie verbale ou la simplification des structures syntaxiques peuvent renseigner sur différentes dimensions des difficultés rencontrées.
La littérature propose plusieurs méthodes de cotation : répétition exacte, nombre de mots correctement reproduits, comptage des erreurs ou préservation de caractéristiques linguistiques ciblées. Une étude menée en français distingue notamment des cotations portant sur les éléments lexicaux, les mots fonctionnels, la syntaxe, la morphologie verbale et le sens général [1]. Une revue systématique récente confirme l’intérêt des tâches de répétition pour distinguer les enfants avec et sans TDL, tout en soulignant la diversité des protocoles et des cotations [2].
L’automatisation de ces analyses pourrait faciliter l’exploitation des tâches de répétition et produire des profils d’erreurs interprétables. Elle soulève cependant deux difficultés : les systèmes de reconnaissance de la parole peuvent modifier ou corriger les productions enfantines, et les outils d’analyse linguistique peuvent être peu fiables sur des énoncés incomplets ou atypiques. Il est donc nécessaire de comparer les résultats automatiques à une référence manuelle.
Le stage vise à concevoir et évaluer des méthodes automatiques caractérisant la fidélité morphologique et morphosyntaxique de phrases répétées par des enfants, puis à explorer leur intérêt pour le repérage des TDL.
Il s’agira de déterminer si des indicateurs linguistiques ciblés apportent une information complémentaire aux mesures globales de fidélité, telles que les distances d’édition entre séquences de mots ou de phonèmes.
Le travail commencera sur le corpus Child Pathological Speech Database (CPSD), utilisé comme terrain d’expérimentation méthodologique. Les méthodes seront ensuite adaptées aux données collectées avec l'application SuperBlabla, dont les tâches sont conçues pour l’évaluation du langage.
Quelles caractéristiques morphologiques et morphosyntaxiques peuvent être évaluées de manière fiable dans les phrases disponibles ?
Quelles conventions de cotation permettent de distinguer les erreurs linguistiques des variantes acceptables et des difficultés articulatoires ?
Dans quelle mesure des méthodes automatiques reproduisent-elles les annotations et scores manuels ?
Quel est l’effet des erreurs de transcription automatique sur les résultats ?
Les indicateurs linguistiques apportent-ils une information complémentaire aux scores globaux pour le repérage des TDL ?
Le corpus CPSD comprend des enregistrements de répétition de phrases, leurs cibles et des transcriptions disponibles, auprès d’enfants au développement typique et d’enfants présentant des troubles du langage. Dans le sous-ensemble clinique envisagé, 11 enfants ont reçu un diagnostic de trouble du langage, dont 9 présentent également un trouble développemental des sons de la parole.
Cette coexistence devra être prise en compte dans l’interprétation : une difficulté de production phonologique ne peut pas être assimilée automatiquement à une erreur morphologique ou syntaxique.
La seconde phase utilisera les données SuperBlabla accessibles pendant le stage. En cas de collecte plus tardive, le travail aboutira à un protocole et à des outils prêts à leur être appliqués.
L’étudiant ou l’étudiante réalisera une synthèse ciblée des méthodes de cotation de la répétition de phrases et de leur évaluation pour le repérage des TDL.
Cette synthèse couvrira les scores globaux, les cotations par types d’erreurs et les approches automatiques. Elle permettra de sélectionner un nombre limité d’indicateurs adaptés au français et aux données disponibles.
Un inventaire des phrases cibles identifiera les phénomènes effectivement représentés : mots fonctionnels, pronoms et clitiques, morphologie verbale, accords audibles, ordre des constituants et structures complexes, selon leur présence dans le corpus.
Deux niveaux d’annotation seront distingués :
Les phrases cibles : structures attendues et occasions d’évaluer chaque phénomène.
Les productions enfantines : éléments préservés, omis, ajoutés ou modifiés, avec signalement des cas ambigus ou non évaluables.
Seules les distinctions observables dans l’audio seront évaluées : une opposition uniquement orthographique ne pourra pas être déduite de la prononciation.
Une phase pilote permettra d’estimer le coût d’annotation et d’ajuster les consignes. Un sous-ensemble diversifié sera annoté indépendamment par deux personnes, puis arbitré. L’accord entre annotateurs sera mesuré avec des indicateurs adaptés aux catégories et aux scores retenus. Les annotations automatiques pourront servir de préannotations, mais ne constitueront pas leur propre référence.
Le travail comparera un ensemble limité d’approches :
Références simples : répétition exacte, distance d’édition lexicale normalisée et proportion de mots correctement reproduits.
Analyse linguistique : alignement cible–production, étiquetage morphologique, repérage des mots fonctionnels et comparaison de caractéristiques ou de relations syntaxiques.
Modélisation : prédiction de catégories d’erreurs ou de scores manuels à partir de ces représentations, si le volume de données le permet.
Des modèles de langage pourront être explorés comme outils d’annotation ou de cotation, en complément des méthodes explicites. Leur évaluation devra notamment vérifier qu’ils ne reconstruisent pas une phrase grammaticalement correcte à la place de la production réellement observée.
Les premiers développements partiront des transcriptions manuelles, afin d’isoler la qualité de l’analyse linguistique. La même procédure sera ensuite appliquée aux transcriptions automatiques.
L’évaluation distinguera deux objectifs.
Fidélité à la référence manuelle : précision, rappel et F1 pour les catégories d’erreurs ; erreurs de prédiction et mesures d’accord pour les scores.
Intérêt pour le repérage des TDL : agrégation au niveau de l’enfant, examen de l’association avec l’âge, puis analyses ROC exploratoires, sensibilité et spécificité. Les indicateurs linguistiques seront comparés aux scores globaux de fidélité.
Les séparations entre apprentissage et évaluation seront réalisées au niveau des enfants. Les choix de variables, réglages et seuils appris seront effectués exclusivement dans les données d’apprentissage. Le faible effectif clinique conduira à privilégier des modèles simples, une estimation de l’incertitude et une analyse qualitative des erreurs.
Les grilles et méthodes seront adaptées aux nouvelles phrases et aux caractéristiques de la population collectée. Les scores et seuils CPSD ne seront pas transférés sans réévaluation.
Cette phase examinera la couverture des phénomènes linguistiques, la robustesse des analyses et la quantité d’annotation nécessaire pour évaluer les modèles sur le nouveau corpus.
Une synthèse bibliographique et un choix argumenté de cotations.
Un inventaire linguistique des phrases et un guide d’annotation.
Un sous-ensemble annoté et contrôlé, accompagné d’une mesure d’accord.
Une chaîne d’analyse reproductible et documentée.
Une comparaison des méthodes manuelles et automatiques, sur transcriptions manuelles puis automatiques.
Un mémoire présentant les résultats, les limites et les recommandations pour l'application SuperBlabla.
Les données de parole enfantine seront traitées conformément aux autorisations et aux règles d’accès du projet.
Période Travaux principaux
Mois 1 Bibliographie, prise en main des données et inventaire linguistique
Mois 2 Annotation pilote, accord entre annotateurs et méthodes de référence
Mois 3–4 Développement et évaluation des analyses automatiques sur CPSD
Mois 5 Adaptation aux données SuperBlabla disponibles et analyses complémentaires
Mois 6 Consolidation, documentation et rédaction du mémoire
Étudiant ou étudiante de M2 en traitement automatique des langues, informatique, sciences du langage ou domaine connexe, avec un intérêt pour le langage de l’enfant.
Compétences souhaitées : programmation Python, traitement de corpus, bases en statistiques et apprentissage automatique. Des connaissances en morphologie, syntaxe du français ou phonétique seront appréciées. Le stage pourra être orienté davantage vers la modélisation ou l’annotation linguistique selon le profil, tout en conservant leur articulation.
[1] Leclercq, A.-L., Quémart, P., Magis, D., & Maillart, C. (2014). The sentence repetition task: A powerful diagnostic tool for French children with specific language impairment. Research in Developmental Disabilities, 35, 3423–3430.
Référence centrale pour les cotations différenciées en français. Présentation et prépublication.
[2] Ward, L., Polišenská, K., & Bannard, C. (2024). Sentence Repetition as a Diagnostic Tool for Developmental Language Disorder: A Systematic Review and Meta-Analysis. Journal of Speech, Language, and Hearing Research, 67, 2191–2221.
Synthèse des tâches, cotations et plans d’étude. Article.
[3] Pham, G., & Ebert, K. D. (2020). Diagnostic Accuracy of Sentence Repetition and Nonword Repetition for Developmental Language Disorder in Vietnamese. Journal of Speech, Language, and Hearing Research, 63, 1521–1536.
Comparaison de cotations et évaluation des seuils de classification. Texte intégral.
[4] Asgari, M., Sliter, A., & van Santen, J. (2016). Automatic scoring of a Sentence Repetition Task from Voice Recordings. Text, Speech, and Dialogue, 9924, 470–477.
Exemple de prédiction de scores manuels à partir de transcriptions automatiques et de mesures de similarité. Notice et accès au texte.