Responsable d'Équipe
Responsable d'Équipe Adjoint
Membres de l'Équipe
Permanents
Non-Permanents
Mot(s) Clé(s)
Traitement automatique de la parole
synthèse vocale, Apprentissage de représentations, Prosodie, Réhaussement de la parole, Localisation de sources sonores, Séparation de sources sonores, Apprentissage profond, Production de la parole, Modélisation de signaux de parole, Interaction homme-robot, Synthèse articulatoire
Les travaux de ComLearn visent à capturer (perception), analyser et modéliser (apprentissage), et générer (synthèse) les différents signaux sociaux verbaux (parole) et co-verbaux (expressions faciales, gestes, regard, etc.) mis en jeu dans une situation d’interaction communicationnelle.
Ses recherches s’appuient sur le traitement automatique de la parole, la vision par ordinateur, l’apprentissage automatique interactif (par renforcement, par démonstration), et des plateformes expérimentales.
Ses applications incluent la robotique sociale, l’aide au handicap (suppléance vocale), la simulation d’environnement d’interaction ou l’étude et la simulation des processus mise en œuvre dans l’apprentissage de la parole chez l’enfant.
ComLearn travaille en étroite collaboration avec l’équipe Inria RobotLearn
Chiffres Clés
Axes de Recherche
Les thématiques de recherche de ComLearn visent notamment :
- Perception multimodale : Analyse de scènes audiovisuelles complexes (localisation de locuteurs, séparation de sources, débruitage de la parole).
- Synthèse vocale (codage, réhaussement de la parole, synthèse à partir du texte) avec un focus sur l'expressivité, la réactivité, la synthèse audiovisuelle).
- Apprentissage auto-supervisé des représentations de la parole, avec un focus sur l'interprétabilité et le contrôle des représentations
- Modélisation acoustico-articulatoire (inversion, synthèse, biofeedback)
- Modélisation de la prosodie, incluant analyse (acoustique, gestuelle) et génération (automatique, contrôle gestuel)
- Interaction homme-robot avec l'analyse, la modélisation et la génération de signaux verbaux et co-verbaux (incluant le regard ou les mouvements de tête).
- IA développementale : Modélisation de l’acquisition du langage chez l’enfant via des agents artificiels interactifs.
- Technologies d’assistance vocale : Restauration de la communication pour les personnes atteintes de troubles de la parole (silent speech interface, électrolarynx, TTS).
- Simulation d’interactions multimodales multi-parties : Création d’environnements virtuels pour générer des données d'interaction multimodales réalistes.
- Expérimentation et évaluation : Collecte de données multimodales (interactions humain-robot, signaux biologiques) et développement de métriques d’évaluation fines.
Plateformes et Expérimentations
Prix et Distinctions
Projets en Cours
Faits Marquants
2023
Organisation de la 12ème édition de Speech Synthesis Workshop (SSW 2023) et du challenge Blizzard associé, avec l’appui de Gérard BAILLY, Thomas HUEBER et Olivier PERROTIN.
2022
Publication de l’article « Dynamical Variational Autoencoders: A Comprehensive Review » dans Foundations and Trends in Machine Learning (Vol. 15, No. 1-2, pp 1-175). Cet article a été réalisé en collaboration avec INRIA et LPNC dans le cadre de l’institut 3IA MIAI et a déjà cité plus de 440 fois.
Partenariats
Partenaires Académiques
- LPNC
- LIG (Grenoble)
- INSERM (Grenoble)
- ENS, LISN (Paris)
- LIS (Marseille)
- Centrale Supelec
- IRISA (Rennes)
- LPP (Paris)
- Institut Jean le Rond d'Alembert (Paris)
- University of Edinburgh
- University College London
- TU Graz
Partenaires Industriels
- Orange
- ATOS
- NeverLabs
- Meta
- Arturia
- Vogo
- Ives
- Dynamic.XYZ
- Humans Matter