IA responsable & durableInnovation & compétitivité par l’IA

Google SL2T : ce que la traduction de la langue des signes sur Pixel change réellement

Depuis le 12 août 2026, Google propose sur le Pixel 11 une fonction capable de traduire en temps réel la langue des signes américaine en texte anglais dans Gboard et Live Transcribe. Le modèle SL2T combine vision par ordinateur et traduction automatique, avec un traitement local de la vidéo puis un calcul sur serveur à partir de coordonnées corporelles. Cette première intégration grand public élargit les modes de saisie, mais elle ne concerne encore ni l’ensemble des téléphones Android ni les autres langues des signes, et elle n’est pas conçue pour remplacer un interprète dans les situations sensibles.

01

Ce que Google a réellement lancé

Google DeepMind et Android ont intégré Sign-Language-to-Text, ou SL2T 1.0, à Gboard et à Live Transcribe. La fonction convertit des signes en texte au fil du mouvement. Dans Gboard, ce texte peut alimenter une messagerie, une note, une recherche ou une requête adressée à Gemini. Dans Live Transcribe, l’objectif est de faciliter une conversation informelle en face à face.[1][2]

Le périmètre initial est étroit. Il faut un Pixel 11, la dernière version de Gboard et un clavier configuré en anglais des États-Unis ou du Canada. La seule paire linguistique annoncée au lancement est l’American Sign Language vers l’anglais. Google prévoit d’autres appareils et d’autres langues, sans calendrier public précis.[1][2]

Parler d’une traduction généralisée de « la langue des signes » sur Android serait donc inexact. Les langues des signes sont des langues naturelles distinctes, dotées de leurs propres grammaires et lexiques. La langue des signes française, par exemple, n’est pas une variante visuelle du français et n’est pas prise en charge par cette version.

02

Pourquoi cette traduction est plus complexe qu’une transcription vocale

La reconnaissance vocale associe généralement un signal sonore à du texte dans une même langue. SL2T doit accomplir une traduction entre deux langues. Le sens est porté simultanément par les mains, les bras, le torse, la tête, le visage, l’espace et le rythme. Une approche consistant à convertir chaque signe en mot anglais manquerait une partie de cette structure.

Le système traduit donc directement une séquence de mouvements vers du texte, sans passer par des « glosses », ces annotations intermédiaires souvent utilisées dans la recherche. Ce choix peut mieux préserver certaines constructions spatiales et non manuelles, mais il rend aussi l’analyse des erreurs plus difficile : le modèle produit une phrase probable sans fournir une transcription linguistique intermédiaire vérifiable.[1][3]

Executive MBA AI & Business Transformation aivancity
aivancity

Executive MBA AI & Business
Transformation

Le MBA repensé pour l’ère de l’IA. Pour dirigeants expérimentés qui veulent piloter la transformation de leur organisation. Paris, Nice & Dubai.

12 mois — Part-time 10 ans d’expérience min. Early bird 20 000 € Paris · Nice · Dubai
03

Comment SL2T transforme les gestes en texte

La caméra frontale observe le visage, le haut du corps et les mains. MediaPipe Holistic, exécuté sur le téléphone, extrait à chaque image 130 points de repère en deux dimensions. La vidéo brute est alors supprimée. Seule la séquence de coordonnées est envoyée aux serveurs de Google, où un réseau de type Transformer génère la traduction anglaise.[2][3]

Cette représentation réduit fortement la quantité d’information transmise et masque une partie de l’apparence et de l’environnement. Elle n’est toutefois pas neutre : elle perd la profondeur, certains détails du visage et des articulateurs comme la langue, ainsi que les objets auxquels une personne peut faire référence. Le rapport conjoint AISLAC souligne que ces pertes peuvent affecter la compréhension.[3]

Capacité ou contrainte Ce qu’il faut comprendre
Disponibilité Pixel 11 uniquement au lancement, avec Gboard à jour et clavier en-US ou en-CA.
Langues Traduction ASL vers anglais. Les autres langues des signes ne sont pas encore disponibles.
Entrée visuelle 130 points 2D du visage, du corps et des mains, extraits localement par MediaPipe Holistic.
Traitement La vidéo est analysée sur le téléphone puis supprimée. Les coordonnées sont traduites sur des serveurs Google.
Conservation Google indique ne pas stocker les vidéos, les coordonnées ni les traductions et ne pas les utiliser pour entraîner le modèle.
Usages prévus Saisie, messages, recherche, commandes d’assistant et conversations informelles à faible enjeu.
Usages exclus Conversations médicales, juridiques, académiques, multipartites ou à fort enjeu.
04

Ce que les résultats permettent réellement d’affirmer

Google indique avoir entraîné SL2T sur plus de 100 000 heures de données couvrant plus de 50 langues des signes, dont environ un quart en ASL. Le laboratoire affirme que cet entraînement multilingue améliore le transfert entre langues et variantes. Les poids du modèle, les données complètes et le protocole d’entraînement ne sont toutefois pas publiés, ce qui limite la reproduction indépendante.[1]

Sur FLEURS-ASL, un jeu de traduction ASL vers anglais enregistré en studio, SL2T obtient un score BLEURT de 70 en évaluation sans adaptation spécifique et un score BLEU de 25. Le rapport mentionne également BLEURT 74 sur un sous-ensemble signé d’une seule main. BLEURT mesure la proximité sémantique entre une traduction et une référence, mais ne représente pas directement la sûreté d’une conversation réelle.[1][3]

Évaluation Résultat publié Lecture prudente
FLEURS-ASL, sd-test, zero-shot BLEU 25 ; BLEURT 70 Langage complexe, mais vidéos en studio et résultats produits par l’équipe Google.
FLEURS-ASL, une main BLEU 32 ; BLEURT 74 Pertinent pour un téléphone tenu d’une main, sans couvrir toutes les situations mobiles.
PRESTO-ASL BLEU 67 ; BLEURT 85 Phrases d’assistant filmées sur tablette, plus proches de commandes ciblées que d’une conversation ouverte.
FSboard 64 % de correspondance exacte Mesure l’épellation digitale, pas la qualité globale d’une traduction continue.

Les exemples publiés montrent encore des confusions sur des signes rares, l’épellation rapide, le temps verbal et certaines descriptions spatiales. Aucune évaluation indépendante à grande échelle n’est disponible au 23 septembre 2026. Le lancement démontre donc une capacité utile dans un cadre défini, pas une traduction universelle ni une équivalence avec un interprète professionnel.

05

Un progrès d’accessibilité, à condition de préserver le choix des utilisateurs

L’apport le plus concret est celui d’un nouveau mode de saisie. Une personne signante peut produire du texte sans passer constamment par un clavier anglais, alors même que l’anglais écrit peut être une seconde langue. L’outil peut réduire une friction quotidienne dans les messages, les recherches et les échanges courts.

Cette utilité ne doit pas conduire à imposer la traduction automatique comme interface par défaut. Les personnes sourdes et malentendantes ont des pratiques linguistiques diverses. Certaines privilégient une langue des signes, d’autres l’écrit, la parole, le sous-titrage ou une combinaison. L’accessibilité suppose donc plusieurs options, une correction facile et la possibilité de revenir au clavier.

La gouvernance participative constitue ici un élément notable. Google a créé l’AI Sign Language Advisory Committee avec des associations, des institutions académiques, des interprètes et des experts sourds. Le rapport conjoint documente les usages prévus et les limites. Cette consultation ne remplace pas un audit indépendant, mais elle donne aux communautés concernées un rôle plus substantiel qu’une simple phase de test.[3]

06

Vie privée : une architecture protectrice, mais pas entièrement locale

Le téléphone ne transmet pas la vidéo brute. Cette minimisation réduit les risques liés à l’image du visage, au domicile et à l’environnement. Google déclare aussi que les coordonnées, les vidéos et les traductions ne sont ni conservées ni utilisées pour l’entraînement, sauf autorisation explicite dans une étude.[2][3]

La traduction reste pourtant dépendante du cloud. Les coordonnées corporelles sont des données issues du comportement d’une personne et peuvent relever du RGPD lorsqu’elles se rapportent à un utilisateur identifiable. Elles ne deviennent des données biométriques sensibles au sens de l’article 9 que si elles sont traitées afin d’identifier une personne de manière unique. La base juridique, l’information, la sécurité du transfert et l’effectivité de la non-conservation restent donc des sujets de conformité à documenter.[4]

07

Accessibilité et droit : ce que le cadre européen implique

L’Acte européen sur l’accessibilité s’applique depuis le 28 juin 2025 à plusieurs produits et services, dont les smartphones et certains services numériques. Il impose des exigences fonctionnelles d’accessibilité, sans prescrire une solution technique comme SL2T. Une telle fonction peut contribuer à l’accessibilité, mais sa présence ne suffit pas à démontrer la conformité globale d’un produit.[5]

Le règlement européen sur l’intelligence artificielle ne classe pas automatiquement un outil de traduction grand public parmi les systèmes à haut risque. Le contexte d’usage reste déterminant. Employer une traduction non évaluée dans une décision médicale, juridique, éducative ou professionnelle augmenterait les conséquences d’une erreur et pourrait faire intervenir d’autres obligations sectorielles. La limitation explicite aux situations à faible enjeu est donc essentielle.[3][6]

08

Ce qu’il faudra observer maintenant

  • L’arrivée effective d’autres langues des signes, avec des données, évaluations et consultations propres à chaque communauté.
  • La disponibilité sur d’autres appareils Android et les performances réelles selon la caméra, l’éclairage, la morphologie et le cadrage.
  • Des évaluations indépendantes portant sur la précision, la latence, les erreurs graves et les différences entre groupes de signants.
  • La possibilité d’un traitement plus local, afin de réduire la dépendance au réseau et l’exposition des coordonnées corporelles.
  • Le maintien d’un accès aux interprètes humains lorsque l’exactitude, la confidentialité ou la responsabilité l’exigent.

SL2T marque une étape importante parce qu’un modèle de traduction en langue des signes sort du laboratoire et devient un outil de saisie grand public. Sa valeur ne se mesurera cependant pas au seul score d’un benchmark. Elle dépendra de la fiabilité en situation réelle, de l’extension à plusieurs langues, de la protection des données et, surtout, de la capacité à renforcer l’autonomie des personnes signantes sans réduire leurs choix.

Pour aller plus loin

Pour approfondir les liens entre accessibilité, interfaces multimodales et traitement local de l’IA, découvrez également ces analyses du blog aivancity.

Sources

[1] Google DeepMind, 12 août 2026, Putting Sign Language AI into Users’ Hands. Lire l’article

[2] Google Pixel Help, Use Sign-to-Text to Translate American Sign Language into English Text in Real Time, consulté le 23 septembre 2026. Consulter la documentation

[3] Google DeepMind et AISLAC, 12 août 2026, AISLAC Joint Impact Report for SL2T 1.0. Consulter le rapport

[4] Union européenne, Règlement (UE) 2016/679 relatif à la protection des données (RGPD), articles 4 et 9. Consulter le règlement

[5] Commission européenne, European Accessibility Act, fiche officielle. Consulter la fiche officielle

[6] Union européenne, Règlement (UE) 2024/1689 établissant des règles harmonisées concernant l’intelligence artificielle (AI Act). Consulter le règlement

Ne ratez pas nos prochains articles !

Recevez les prochains articles écrits par les experts et professeurs aivancity directement dans votre boîte de réception.

Nous ne spammons pas ! Consultez notre politique de données personnelles pour plus d’informations.

Ne ratez pas nos prochains articles !

Recevez les prochains articles écrits par les experts et professeurs aivancity directement dans votre boîte de réception.

Nous ne spammons pas ! Consultez notre politique de données personnelles pour plus d’informations.

Related posts
IA AgentiqueInnovation & compétitivité par l’IA

Qwen3.8-Max : ce que le modèle d’Alibaba change réellement pour le codage et les agents IA

Lancé par Alibaba le 3 août 2026, Qwen3.8-Max associe une architecture Mixture-of-Experts de 2 400 milliards de paramètres, dont 95 milliards activés, à une fenêtre de contexte annoncée d’un million de tokens et à des capacités…
IA AgentiqueInnovation & compétitivité par l’IA

Kimi K3 : ce qu’il faut savoir du modèle open source de 2 800 milliards de paramètres

Pendant longtemps, la course mondiale à l’intelligence artificielle semblait dominée par les laboratoires américains. OpenAI, Anthropic, Google ou encore xAI occupaient les premières places des classements internationaux, tandis que les modèles chinois peinaient à rivaliser…
IA GénérativesInnovation & compétitivité par l’IA

GLM-5.2 : le modèle chinois qui veut bousculer OpenAI, Anthropic et Google

Il y a parfois des coïncidences qui ressemblent à des déclarations de guerre technologique. Quelques jours seulement après la suspension de Claude Fable 5 et Mythos 5 d’Anthropic, la Chine dévoile GLM-5.2, un nouveau modèle…