Le nouveau modèle de DeepMind permet aux appareils Pixel 11 de transcrire la langue des signes en texte

27 août 2026

L’outil arrivera sur d’autres appareils à l’avenir.

Les smartphones offrent depuis longtemps la transcription vocale en texte, mais cela ne s’applique pas à la transcription de la langue des signes en texte. Cela change aujourd’hui avec le lancement de la famille Pixel 11, qui marque les débuts du nouveau modèle de DeepMind pour convertir la langue des signes en texte (SL2T). Google a intégré le modèle dans Gboard et Live Transcribe, où il permettra aux utilisateurs sourds et malentendants de signer à leur téléphone partout où ils auraient normalement tapé auparavant. Concrètement, cela offrira à ces utilisateurs un moyen plus rapide et plus naturel de rechercher sur le Web, d’écrire des messages et de converser avec le chatbot Gemini de Google.

« Il existe une grande diversité parmi les personnes sourdes en termes de maîtrise de la langue des signes, de la parole, de la lecture et de l’écriture, il est donc important de soutenir l’accès dans toutes les modalités, » déclare DeepMind. « Les personnes sourdes peuvent bénéficier du traitement de la langue des signes de la même manière que les personnes entendantes bénéficient du traitement de la langue parlée, et, de plus, la technologie ouvre de nouvelles possibilités pour combler le fossé de communication entre les communautés sourdes et entendantes. »

DeepMind a entraîné SL2T sur plus de 100 000 heures de données multilingues sur la langue des signes, avec environ un quart des données représentant des informations en langue des signes américaine (ASL). Pour cette raison, le modèle ne prend au départ en charge que la transcription ASL vers l’anglais. Google prévoit de prendre en charge davantage de langues et d’appareils à l’avenir.

SL2T n’interprète pas une vidéo brute. À la place, un modèle distinct sur l’appareil convertit les séquences en une sorte de squelette géométrique de coordonnées qui sont envoyées aux serveurs de Google. L’entreprise précise que le modèle est conçu de cette manière pour protéger la vie privée des utilisateurs. SL2T se distingue également des systèmes passés de langue des signes vers le texte en ce qu’il traduit les cadres géométriques qu’il reçoit directement en texte, au lieu de produire des glosses intermédiaires.

« Les glosses ne parviennent pas à capturer les aspects riches et non linéaires des langues des signes, tels que les marqueurs non manuels et les constructions spatiales, » explique DeepMind. « Traduire directement à partir des repères élimine les limites de vocabulaire artificielles et permet à la qualité de la traduction de croître directement avec les données. »

Alors que le soutien à l’ASL est un excellent départ, DeepMind reconnaît qu’il reste du travail à accomplir. À l’échelle mondiale, il y a plus de 70 millions de personnes sourdes et malentendantes qui communiquent dans quelque 200 langues des signes. La bonne nouvelle est que l’entreprise bénéficie d’un coup d’avance, car SL2T a été entraîné simultanément sur plusieurs langues afin de pouvoir apprendre les structures sous-jacentes partagées entre elles.

Nadia Kerroum

Nadia Kerroum

Rédactrice chez GeekyAlgeria, j’explore chaque jour l’impact de la technologie sur notre vie. Entre innovations locales, tendances mondiales et culture numérique, je raconte ce qui façonne le futur de manière simple, précise et accessible. Toujours curieuse, je cherche avant tout à partager une passion : comprendre la tech pour mieux la vivre.