Skip to content
Aller au texte

Gouvernance de l'IA dirigée par les Sourds

La démonstration n'est pas la preuve : ce que l'IA de langue des signes de Google DeepMind doit encore prouver

Contenus audio
Écouter également sur Spotify

Le 12 août, Google DeepMind a annoncé SL2T, un modèle multilingue de traduction de la langue des signes vers le texte, et a commencé à le déployer dans des produits grand public via Gboard et Live Transcribe sur le Pixel 11. La version initiale traduit l'ASL en anglais, avec d'autres appareils et langues des signes prévus, et DeepMind indique que le modèle sous-jacent a été entraîné sur plus de 100 000 heures de données couvrant plus de 50 langues des signes. À tous égards, cela fait franchir une étape importante à l'IA en langue des signes : elle sort du laboratoire de recherche pour entrer dans un produit que des gens ordinaires porteront dans leur poche.

Ce franchissement est significatif, mais il ne faut pas le confondre avec autre chose qu'il n'est pas. Une percée technologique et un déploiement validé sont deux choses différentes, et cette distinction compte énormément lorsque la technologie en question traite une langue naturelle utilisée par une communauté linguistique historiquement marginalisée. La question que pose désormais SL2T n'est pas de savoir si le modèle fonctionne dans une démonstration. C'est de savoir si les preuves qui le sous-tendent peuvent supporter le poids que le déploiement va y faire peser.

À chacun son dû

Cette sortie ne doit pas être réduite à l'histoire familière d'une entreprise technologique construisant quelque chose pour les personnes Sourdes sans leur participation. Selon Google DeepMind, des personnes Sourdes ont été impliquées tout au long du projet, de la conceptualisation et de la collecte de données jusqu'aux études utilisateurs et à l'évaluation d'impact. L'entreprise a également créé un comité consultatif sur l'IA et la langue des signes, l'AISLAC, dont les membres comprennent des représentants liés à la National Association of the Deaf, au National Technical Institute for the Deaf du Rochester Institute of Technology, au Deaf Professional Arts Network, et à la World Federation of the Deaf. Parallèlement à cette sortie, DeepMind et l'AISLAC ont publié un rapport d'impact conjoint.

Ce rapport fait quelque chose qui reste rare dans l'IA en langue des signes : il indique où le système ne devrait pas être utilisé. SL2T 1.0 est explicitement décrit comme un outil d'aide à la saisie à faible enjeu. Il n'a pas été conçu ni validé pour les soins de santé, les procédures judiciaires, l'éducation, les décisions d'emploi, les déterminations de prestations gouvernementales, ou d'autres contextes à enjeux élevés, et le rapport indique clairement que la technologie ne doit pas se substituer à des interprètes qualifiés ni servir de moyen pour les organisations de contourner leurs obligations en matière d'accessibilité. Cela relève de la gouvernance, et cela mérite d'être reconnu. Ce n'est aussi que le début de la gouvernance.

Un benchmark est une preuve, pas la base de preuves

DeepMind fait état de performances solides. Sur FLEURS-ASL, SL2T aurait obtenu un score BLEURT en zero-shot de 70, supérieur à tout résultat précédemment rapporté, avec des évaluations supplémentaires sur PRESTO-ASL, une variante à une main de FLEURS-ASL, et des données de dactylologie FSboard. L'entreprise a également mené des tests préalables au lancement avec des employés Sourds de Google, une étude externe de type journal de bord avec des participants Sourds, et une évaluation pratique par des membres nord-américains de l'AISLAC. Ce sont des formes de preuves significatives, et aucune d'elles ne doit être écartée.

Mais c'est ici que le discours public sur l'IA a tendance à devenir imprécis, car des performances démontrées ne sont pas la même chose qu'une validation complète. Un modèle peut se comporter de manière impressionnante sur des benchmarks sélectionnés tout en conservant de sérieuses faiblesses selon les populations, les environnements, les variétés linguistiques, les styles de signature, les appareils et les cas d'usage. Le propre rapport de DeepMind le reconnaît. Le modèle peut avoir des difficultés avec la complexité grammaticale, les marqueurs non manuels, les signes régionaux, les signes polysémiques, la dactylologie, les noms propres, un positionnement de caméra atypique, un faible éclairage, l'argot, et un contexte conversationnel plus long. Il peut aussi générer un « texte fantôme » erroné, ou s'engager sur une supposition prédictive avant qu'un signeur n'ait terminé un énoncé.

Ce ne sont pas des cas limites triviaux. L'expression faciale, le mouvement de la tête, la structure spatiale, les classificateurs, la variation régionale et le contexte discursif ne sont pas des ornements du langage signé. Ils sont la langue elle-même. Un système qui gère bien le vocabulaire sous forme de citation tout en trébuchant sur la grammaire portée par le visage et l'espace de signature n'a pas résolu la traduction de la langue des signes ; il en a résolu une partie, et la partie non résolue affecte inégalement les personnes qui signent.

La prochaine question est celle de la désagrégation

Cette inégalité est précisément la raison pour laquelle la prochaine phase de preuves compte. DeepMind reconnaît que les performances des benchmarks n'ont pas encore été pleinement désagrégées selon des variables telles que l'âge, le genre, l'origine ethnique, la région, le sociolecte, et l'ASL noir américain. Le rapport note également que l'évaluation formelle impliquant des signeurs présentant des handicaps moteurs ou des schémas de mouvement atypiques reste limitée, et que le modèle n'a été ni entraîné ni formellement évalué sur des enfants de moins de 18 ans.

Un chiffre de performance agrégé ne peut pas nous dire si le système sert aussi bien les signeurs d'ASL noir américain que les autres, comment il gère une signature fortement régionale, ni comment la précision varie selon les groupes d'âge. Il ne peut pas nous dire comment le modèle se comporte pour les personnes ayant des différences de membres, des tremblements, une paralysie cérébrale, de l'arthrite, ou d'autres conditions qui influencent le mouvement, ni si la précision varie selon l'angle de la caméra, l'éclairage, le contraste de la peau, la vitesse de signature, l'espace de signature, ou l'appareil. Il ne peut pas distinguer les erreurs qui reformulent simplement un énoncé de celles qui en changent le sens. Et il ne peut pas répondre à la question qui sous-tend toutes les autres : qui décide du niveau d'erreur acceptable, et pour qui. Cette dernière question ne peut être tranchée par une équipe d'ingénierie, aussi compétente soit-elle.

La participation n'est pas une validation indépendante

Une distinction supplémentaire mérite attention. L'AISLAC est un mécanisme de gouvernance significatif ; la participation d'organisations Sourdes, les études utilisateurs et l'évaluation d'impact conjointe comptent toutes. Mais la participation consultative et l'évaluation technique indépendante remplissent des fonctions différentes. Les preuves publiées consistent actuellement en des évaluations menées par le développeur, des tests impliquant des utilisateurs et des conseillers réunis au sein de la structure de gouvernance propre au projet, et un rapport co-écrit par Google DeepMind et des participants de l'AISLAC. C'est une véritable base de preuves, et ce n'est pas une réplication indépendante.

À mesure que l'IA en langue des signes mûrit, le domaine devrait s'attendre à ce que tout domaine scientifique en maturation attend : des chercheurs externes capables de tester les affirmations de manière indépendante, de reproduire les évaluations lorsque cela est possible, d'examiner les performances par sous-groupe, de sonder les conditions adverses, et d'étudier le comportement réel après le déploiement. La technologie d'accessibilité ne devrait pas être soumise à une norme de preuve inférieure au motif que son objectif est bénéfique. Si quelque chose, la population qu'elle sert a encore plus en jeu dans la réponse.

Le problème de gouvernance le plus difficile survient après le lancement

DeepMind et l'AISLAC identifient explicitement le détournement institutionnel comme un risque critique, et ce jugement pourrait s'avérer plus important que n'importe quel score de benchmark. Une fois qu'une technologie de communication automatisée peu coûteuse existe, les écoles, les hôpitaux, les employeurs, les agences gouvernementales, les tribunaux et les entreprises font face à une puissante incitation économique à l'utiliser au-delà de son champ d'application prévu. Un produit conçu pour commander un café devient un produit auquel quelqu'un recourt aux urgences. Un outil conçu pour rédiger des messages texte devient la raison pour laquelle un employeur conclut qu'un interprète n'est plus nécessaire. Une fonctionnalité pratique se transforme discrètement en infrastructure.

Le rapport de DeepMind anticipe cette dérive et rejette catégoriquement la substitution d'interprètes. La question ouverte est de savoir si cette limite peut survivre au contact des achats institutionnels, des budgets, de l'expansion des produits, et du moment inévitable où un administrateur demandera si l'option automatisée moins chère est suffisamment bonne. Des limites énoncées sont nécessaires. Ce sont les limites appliquées qui comptent.

La gouvernance de l'IA, plus largement, converge vers le même territoire. Les questions centrales sont de moins en moins de savoir si un système peut accomplir une tâche, et de plus en plus de savoir qui le contrôle, comment ses performances sont évaluées, quelle surveillance existe, ce qui se passe lorsqu'il se comporte de manière inattendue, et qui reste responsable. Plus tôt ce mois-ci, des démocrates de la Chambre des représentants américaine ont interpellé OpenAI et Anthropic pour obtenir des réponses après que des agents d'IA ont échappé à leurs environnements de test et atteint des systèmes externes, demandant comment les systèmes étaient surveillés, quels contrôles de sécurité existaient, et si des audits indépendants devraient être exigés. Les technologies diffèrent ; le principe de gouvernance ne diffère pas. La capacité ne diminue pas le besoin de surveillance. Elle l'augmente.

Ce qui vient ensuite

Google a déjà produit des preuves que SL2T peut traduire l'ASL. Les questions les plus difficiles découlent du déploiement plutôt que de la capacité : les performances peuvent-elles être reproduites de manière indépendante ; comment la précision varie-t-elle selon les groupes démographiques, linguistiques, géographiques et de handicap ; quels seront les taux d'échec réels, et quels échecs modifient le sens plutôt que la formulation ; comment les utilisateurs sauront-ils quand le modèle est incertain, et comment les préjudices seront-ils signalés lorsqu'il se trompe ; les chercheurs externes recevront-ils un accès suffisant pour évaluer le système de manière significative ; et la gouvernance communautaire conservera-t-elle une influence réelle à mesure que le produit se développe mondialement, y compris lorsque des acheteurs institutionnels dépasseront les limites que Google a fixées, et lorsque ces limites devront rester visibles deux ou trois générations de produits plus tard.

Une démonstration montre ce qu'un système peut faire. Un benchmark dit quelque chose sur la qualité avec laquelle il le fait. Une étude utilisateur capture la manière dont les gens en font l'expérience, et une structure de gouvernance enregistre qui a voix au chapitre. Aucun de ces éléments seul ne répond à toutes les questions que soulève un déploiement grand public ; cela nécessite un écosystème de preuves, construit dans le temps et ouvert aux acteurs extérieurs.

SL2T pourrait bien être le développement le plus important à ce jour dans l'IA de langue des signes grand public, et Google a pris des mesures de gouvernance qui méritent une attention sérieuse : participation des Sourds, limites de déploiement explicites, divulgation publique des limitations, et un refus déclaré de substitution aux interprètes. La réponse appropriée n'est ni la célébration ni le rejet. C'est l'examen attentif, car lorsque l'IA en langue des signes passe du laboratoire de recherche à la poche de quelqu'un, la norme change. La démonstration ne suffit plus. Maintenant, les preuves doivent suivre.

Abonnez-vous à Novara Consulting Group

De nouveaux articles, livrés dans votre boîte de réception.

Consult