Une fracture numérique qui demeure importante
En France, plus de 7 millions de personnes vivent avec une déficience auditive, soit plus de 11 % de la population. Parmi elles, près de 500 000 souffrent d’une surdité sévère ou profonde, tandis qu’environ 100 000 personnes utilisent couramment la langue des signes française. Cette réalité se traduit également par des difficultés d’accès à l’emploi, à l’éducation et aux services publics : environ 34 % des personnes sourdes sont inactives, principalement en raison des barrières de communication.
Malgré les avancées de l’accessibilité numérique, la majorité des interfaces conversationnelles actuelles restent conçues autour du texte et de la voix. La langue des signes demeure très peu prise en charge par les systèmes d’intelligence artificielle.
Un LLM multimodal qui comprend les gestes autant que les mots
Le cœur du projet consiste à développer un LLM multimodal, capable de traiter simultanément plusieurs modalités d’information : texte, voix, vidéo et mouvements gestuels.
L’objectif est double :
- traduire instantanément un texte ou une conversation orale vers la langue des signes ;
- interpréter les signes réalisés par un utilisateur afin de les convertir en texte ou en langage oral.
Cette traduction est pensée comme bidirectionnelle et en temps réel, ouvrant la voie à des échanges naturels entre personnes sourdes et entendantes, sans nécessiter systématiquement un interprète humain.
Des impacts sociétaux majeurs
Les bénéfices attendus dépassent largement le domaine technologique.
Le projet vise notamment à :
- améliorer l’accès aux services publics, à la santé et à l’éducation ;
- renforcer l’autonomie des personnes sourdes dans leur vie quotidienne ;
- faciliter l’apprentissage de la langue des signes ;
- réduire l’isolement social ;
- favoriser une meilleure inclusion professionnelle.
En démocratisant la traduction en temps réel, l’intelligence artificielle pourrait devenir un véritable levier d’égalité des chances.
Une application mobile de traduction
Une application mobile permettrait de traduire instantanément les conversations entre langue des signes, texte et voix, offrant un outil portable utilisable au quotidien.
Un modèle économique fondé sur des briques technologiques
Le modèle économique repose sur trois offres complémentaires :
- une API Text-to-Sign, convertissant automatiquement un texte en langue des signes animée ;
- une API Sign-to-Text, transformant une vidéo de langue des signes en texte en temps réel ;
- une plateforme SaaS dédiée à la génération automatique de vidéos en langue des signes.
Cette stratégie permet d’adresser aussi bien les développeurs que les entreprises, les administrations et les producteurs de contenus.
Ressources et références
Sources du projet
- DAVI The Humanizers – Développement d’un LLM Multimodal avec prise en charge de la langue des signes, présentation du projet (2026).
Données sur la surdité et la langue des signes
Les chiffres présentés dans le projet s’appuient notamment sur les travaux et publications des organismes suivants :
- Fondation Pour l’Audition – Données statistiques sur la déficience auditive en France.
- Fondation Jean-Jaurès – Études sur l’inclusion et le handicap.
- France Travail – Données sur l’emploi des personnes en situation de handicap.
Ressources sur la Langue des Signes Française (LSF)
- Ministère des Solidarités, de l’Autonomie et des Personnes handicapées.
- Fédération Nationale des Sourds de France (FNSF).
- INSHEA (Institut national supérieur de formation et de recherche pour l’éducation inclusive).
Ressources sur l’intelligence artificielle multimodale
Pour approfondir les concepts évoqués dans cet article :
- Les travaux de recherche sur les Large Language Models (LLM) multimodaux.
- Les recherches en Vision-Language Models (VLM) appliquées à la compréhension vidéo.
- Les publications scientifiques sur la reconnaissance automatique de la langue des signes (Sign Language Recognition – SLR).
- Les recherches sur la génération de langue des signes par avatars numériques (Sign Language Generation – SLG).
Technologies mentionnées dans le projet
Le document fait référence aux briques technologiques suivantes :
- RTMW3D
- SignFlow RVQ-VAE
- SignFlow-RT
- Retorik Framework
- API Text-to-Sign
- API Sign-to-Text
- SaaS Video Generation
Pour aller plus loin
Le projet met en avant une approche qui combine :
- Intelligence artificielle générative ;
- Modèles multimodaux (texte, image, vidéo, gestes) ;
- Vision par ordinateur ;
- Humains digitaux ;
- Traduction automatique en temps réel ;
- Accessibilité numérique ;
- Inclusion des personnes sourdes et malentendantes.