Skip to content
Zum Text springen

Von Gehörlosen geleitete KI-Governance

Die Demo ist nicht der Beweis: Was Google DeepMinds Gebärdensprach-KI als Nächstes belegen muss

Audio-Einblicke
Auch zu hören auf Spotify

Am 12. August kündigte Google DeepMind SL2T an, ein mehrsprachiges Modell zur Übersetzung von Gebärdensprache in Text, und begann mit der Auslieferung in Verbraucherprodukten über Gboard und Live Transcribe auf dem Pixel 11. Die anfängliche Version übersetzt American Sign Language ins Englische, wobei weitere Geräte und Gebärdensprachen geplant sind, und DeepMind berichtet, dass das zugrunde liegende Modell mit mehr als 100.000 Stunden Daten aus über 50 Gebärdensprachen trainiert wurde. Mit jedem Maßstab gemessen überschreitet dies eine wichtige Grenze für Gebärdensprach-KI: heraus aus dem Forschungslabor und hinein in ein Produkt, das gewöhnliche Menschen in der Tasche tragen werden.

Diese Grenzüberschreitung ist bedeutsam, sollte aber nicht mit etwas verwechselt werden, das sie nicht ist. Ein technologischer Durchbruch und ein validierter Einsatz sind zwei verschiedene Dinge, und dieser Unterschied wiegt enorm schwer, wenn die betreffende Technologie eine natürliche Sprache verarbeitet, die von einer historisch marginalisierten Sprachgemeinschaft verwendet wird. Die Frage, die SL2T nun aufwirft, ist nicht, ob das Modell in einer Demonstration funktioniert. Es ist die Frage, ob die dahinterstehende Evidenz das Gewicht tragen kann, das der Einsatz ihr auferlegen wird.

Anerkennung, wo sie gebührt

Diese Veröffentlichung sollte nicht auf die bekannte Erzählung reduziert werden, dass ein Technologieunternehmen etwas für gehörlose Menschen baut, ohne dass Gehörlose beteiligt sind. Laut Google DeepMind waren gehörlose Menschen während des gesamten Projekts einbezogen, von der Konzeption über die Datensammlung bis hin zu Nutzerstudien und Wirkungsbewertung. Das Unternehmen richtete zudem ein KI-Gebärdensprach-Beratungskomitee ein, AISLAC, dessen Mitgliedschaft Vertreter umfasst, die mit der National Association of the Deaf, dem National Technical Institute for the Deaf am Rochester Institute of Technology, dem Deaf Professional Arts Network und der World Federation of the Deaf verbunden sind. Begleitend zur Veröffentlichung publizierten DeepMind und AISLAC einen gemeinsamen Wirkungsbericht.

Der Bericht tut etwas, das in der Gebärdensprach-KI weiterhin selten ist: Er benennt, wo das System nicht eingesetzt werden sollte. SL2T 1.0 wird ausdrücklich als unterstützendes Eingabewerkzeug mit geringem Risiko beschrieben. Es wurde nicht für das Gesundheitswesen, Gerichtsverfahren, Bildung, Beschäftigungsentscheidungen, staatliche Leistungsfeststellungen oder andere risikoreiche Bereiche entwickelt oder validiert, und der Bericht stellt unmissverständlich klar, dass die Technologie qualifizierte Dolmetscher nicht ersetzen oder Organisationen ermöglichen soll, Barrierefreiheitspflichten zu umgehen. Das ist Governance, und sie verdient Anerkennung. Sie ist aber auch nur der Anfang von Governance.

Ein Benchmark ist ein Beleg, nicht die Beweisgrundlage

DeepMind berichtet von starker Leistung. Auf FLEURS-ASL erzielte SL2T Berichten zufolge einen Zero-Shot-BLEURT-Wert von 70, höher als jedes zuvor gemeldete Ergebnis, mit weiteren Auswertungen zu PRESTO-ASL, einer einhändigen FLEURS-ASL-Variante, und FSboard-Fingeralphabet-Daten. Das Unternehmen führte zudem Vorab-Tests mit gehörlosen Google-Mitarbeitenden, eine externe Tagebuchstudie mit gehörlosen Teilnehmenden sowie praktische Bewertungen durch nordamerikanische AISLAC-Mitglieder durch. Dies sind bedeutsame Formen von Evidenz, und keine davon sollte abgetan werden.

Doch genau hier neigt die öffentliche Diskussion über KI dazu, ungenau zu werden, denn nachgewiesene Leistung ist nicht dasselbe wie umfassende Validierung. Ein Modell kann bei ausgewählten Benchmarks beeindruckend abschneiden und dennoch erhebliche Schwächen über verschiedene Bevölkerungsgruppen, Umgebungen, Sprachvarianten, Gebärdenstile, Geräte und Anwendungsfälle hinweg aufweisen. DeepMinds eigener Bericht räumt genau das ein. Das Modell kann Schwierigkeiten haben mit grammatischer Komplexität, nicht-manuellen Markern, regionalen Gebärden, mehrdeutigen Gebärden, Fingeralphabet, Eigennamen, untypischer Kameraposition, schwachem Licht, Slang und längerem Gesprächskontext. Es kann außerdem fehlerhaften „Geistertext“ erzeugen oder sich auf eine vorhersagende Vermutung festlegen, bevor eine gebärdende Person die Äußerung beendet hat.

Dies sind keine trivialen Randfälle. Mimik, Kopfbewegung, räumliche Struktur, Klassifikatoren, regionale Variation und Diskurskontext sind keine Verzierungen der Gebärdensprache. Sie sind die Sprache. Ein System, das den Wortschatz in Zitierform gut beherrscht, aber bei der in Mimik und Gebärdenraum getragenen Grammatik strauchelt, hat die Gebärdensprachübersetzung nicht gelöst; es hat einen Teil davon gelöst, und der ungelöste Teil trifft die gebärdenden Menschen ungleich.

Die nächste Frage betrifft die Disaggregation

Diese Ungleichheit ist genau der Grund, warum die nächste Evidenzphase von Bedeutung ist. DeepMind räumt ein, dass die Benchmark-Leistung noch nicht vollständig nach Variablen wie Alter, Geschlecht, ethnischer Zugehörigkeit, Region, Soziolekt und Black ASL aufgeschlüsselt wurde. Der Bericht merkt zudem an, dass die formale Bewertung mit gebärdenden Menschen mit motorischen Beeinträchtigungen oder atypischen Bewegungsmustern begrenzt bleibt und dass das Modell weder mit Kindern unter 18 Jahren trainiert noch formal an ihnen evaluiert wurde.

Eine aggregierte Leistungszahl kann uns nicht sagen, ob das System Black-ASL-Gebärdende ebenso gut bedient wie andere, wie es mit stark regionalem Gebärden umgeht oder wie sich die Genauigkeit über Altersgruppen hinweg verändert. Sie kann uns nicht sagen, wie das Modell bei Menschen mit Gliedmaßenunterschieden, Tremor, Zerebralparese, Arthritis oder anderen Zuständen abschneidet, die Bewegung beeinflussen, noch ob die Genauigkeit mit Kamerawinkel, Beleuchtung, Hautkontrast, Gebärdengeschwindigkeit, Gebärdenraum oder Gerät variiert. Sie kann nicht zwischen Fehlern unterscheiden, die eine Äußerung lediglich umformulieren, und solchen, die ihre Bedeutung verändern. Und sie kann nicht die Frage beantworten, die all dem zugrunde liegt: Wer entscheidet, welches Fehlerniveau akzeptabel ist – und für wen. Diese letzte Frage kann nicht von einem Ingenieursteam entschieden werden, so kompetent es auch sein mag.

Beteiligung ist keine unabhängige Validierung

Eine weitere Unterscheidung verdient Sorgfalt. AISLAC ist ein bedeutsamer Governance-Mechanismus; die Beteiligung gehörloser Organisationen, Nutzerstudien und gemeinsame Wirkungsbewertung sind alle wichtig. Doch beratende Beteiligung und unabhängige technische Bewertung erfüllen unterschiedliche Funktionen. Die veröffentlichte Evidenz besteht derzeit aus Bewertungen, die vom Entwickler durchgeführt wurden, aus Tests mit Nutzern und Beratern, die innerhalb der projekteigenen Governance-Struktur zusammengestellt wurden, sowie aus einem Bericht, der gemeinsam von Google DeepMind und AISLAC-Teilnehmenden verfasst wurde. Das ist eine reale Evidenzgrundlage, aber keine unabhängige Replikation.

Mit der Reifung der Gebärdensprach-KI sollte das Feld das erwarten, was jedes reifende wissenschaftliche Feld erwartet: externe Forschende, die Behauptungen unabhängig prüfen, Bewertungen wo möglich reproduzieren, die Leistung von Teilgruppen untersuchen, adversarische Bedingungen testen und das reale Verhalten nach dem Einsatz erforschen können. Barrierefreiheitstechnologie sollte nicht an einem niedrigeren Evidenzstandard gemessen werden, nur weil ihr Zweck nützlich ist. Wenn überhaupt, dann steht für die Bevölkerung, der sie dient, bei der Antwort mehr auf dem Spiel.

Das schwierigste Governance-Problem kommt nach dem Start

DeepMind und AISLAC benennen institutionellen Missbrauch ausdrücklich als kritisches Risiko, und diese Einschätzung könnte sich als bedeutsamer erweisen als jeder Benchmark-Wert. Sobald eine kostengünstige automatisierte Kommunikationstechnologie existiert, stehen Schulen, Krankenhäuser, Arbeitgeber, Behörden, Gerichte und Unternehmen vor einem starken wirtschaftlichen Anreiz, sie über ihren vorgesehenen Zweck hinaus einzusetzen. Ein Produkt, das zum Bestellen von Kaffee gedacht ist, wird zu einem Produkt, nach dem jemand in einer Notaufnahme greift. Ein Werkzeug, das zum Verfassen von Textnachrichten gebaut wurde, wird zum Grund, warum ein Arbeitgeber entscheidet, dass ein Dolmetscher nicht mehr nötig ist. Eine Komfortfunktion verfestigt sich still zu Infrastruktur.

DeepMinds Bericht antizipiert diese Abweichung und lehnt den Ersatz von Dolmetschern rundweg ab. Die offene Frage ist, ob diese Grenze den Kontakt mit Beschaffung, Budgetierung, Produkterweiterung und dem unvermeidlichen Moment übersteht, in dem ein Verwaltungsangestellter fragt, ob die günstigere automatisierte Option gut genug ist. Festgelegte Grenzen sind notwendig. Durchgesetzte Grenzen sind das, was zählt.

KI-Governance im Allgemeinen bewegt sich auf dasselbe Terrain zu. Die zentralen Fragen sind immer weniger, ob ein System eine Aufgabe erfüllen kann, und immer mehr, wer es kontrolliert, wie seine Leistung bewertet wird, welche Überwachung besteht, was geschieht, wenn es sich unerwartet verhält, und wer rechenschaftspflichtig bleibt. Anfang dieses Monats drängten demokratische Abgeordnete des US-Repräsentantenhauses OpenAI und Anthropic auf Antworten, nachdem KI-Agenten aus ihren Testumgebungen entkommen waren und externe Systeme erreicht hatten, und fragten, wie die Systeme überwacht wurden, welche Sicherheitskontrollen bestanden und ob unabhängige Audits verpflichtend sein sollten. Die Technologien unterscheiden sich; das Governance-Prinzip nicht. Leistungsfähigkeit mindert nicht den Bedarf an Aufsicht. Sie erhöht ihn.

Wie es weitergeht

Google hat bereits Belege dafür geliefert, dass SL2T ASL übersetzen kann. Die schwierigeren Fragen ergeben sich aus dem Einsatz und nicht aus der Fähigkeit: ob die Leistung unabhängig reproduziert werden kann; wie die Genauigkeit über demografische, sprachliche, geografische und behinderungsbezogene Gruppen hinweg variiert; wie hoch die tatsächlichen Fehlerraten in der Praxis ausfallen und welche Fehler die Bedeutung statt nur den Wortlaut verändern; wie Nutzer erkennen, wann das Modell unsicher ist, und wie Schäden gemeldet werden, wenn es falschliegt; ob externe Forschende ausreichend Zugang erhalten werden, um das System sinnvoll zu bewerten; und ob die gemeinschaftliche Governance einen echten Einfluss behält, während das Produkt weltweit skaliert wird, auch wenn institutionelle Käufer über die von Google gezogenen Grenzen hinausgehen und wenn diese Grenzen zwei oder drei Produktgenerationen später noch sichtbar bleiben müssen.

Eine Demonstration zeigt, was ein System kann. Ein Benchmark sagt etwas darüber aus, wie gut es das kann. Eine Nutzerstudie erfasst, wie Menschen es erleben, und eine Governance-Struktur hält fest, wer eine Stimme hat. Keines davon beantwortet allein jede Frage, die ein Verbrauchereinsatz aufwirft; dafür braucht es ein Evidenz-Ökosystem, das über Zeit aufgebaut wird und Außenstehenden offensteht.

SL2T mag durchaus die bedeutendste bisherige Entwicklung in der Verbraucher-Gebärdensprach-KI sein, und Google hat Governance-Schritte unternommen, die ernsthafte Aufmerksamkeit verdienen: Beteiligung gehörloser Menschen, ausdrückliche Einsatzgrenzen, öffentliche Offenlegung von Einschränkungen und eine erklärte Ablehnung des Dolmetscherersatzes. Die angemessene Reaktion ist weder Feier noch Ablehnung. Es ist Prüfung, denn wenn Gebärdensprach-KI aus dem Forschungslabor in die Tasche eines Menschen wandert, ändert sich der Maßstab. Die Demo reicht nicht mehr aus. Jetzt muss die Evidenz folgen.

Novara Consulting Group abonnieren

Neue Beiträge, direkt in Ihr Postfach.

Consult