Ein am 2. September 2026 auf arXiv veröffentlichtes und für die Hauptkonferenz von EMNLP angenommenes Papier beschreibt DiscoSign, ein Framework zur Übersetzung von englischem Text in American-Sign-Language-Gloss, das dabei mitverfolgt, was bereits gesagt wurde. Seine Autoren sind Forschende von Apple und der Gallaudet University, und Aggregatoren berichteten, dass es am 11. September auf Apples Machine-Learning-Forschungsseite erschien, wo die meisten Leser außerhalb des Fachgebiets darauf gestoßen sein dürften. Die technische Behauptung ist eng gefasst und gut formuliert. Die meisten Text-zu-Gebärde-Systeme übersetzen einen Satz nach dem anderen und haben kein Gedächtnis zwischen den Sätzen, sodass ein Referent, der an einer Stelle platziert wurde, im nächsten Satz stillschweigend neu zugeordnet werden kann, dasselbe Konzept in drei aufeinanderfolgenden Sätzen durch drei unterschiedliche Gebärden wiedergegeben werden kann und die rhetorischen Strukturen, die gebärdeten Diskurs organisieren, nicht gewählt werden können, weil das System den Diskurs nicht sehen kann. DiscoSign fügt explizite Register hinzu, die über Sätze hinweg bestehen bleiben, setzt sie als Beschränkungen für das Modell durch und überprüft und korrigiert dann die Ausgabe anhand dieser Register.
Dies ist ein echter Fortschritt gegenüber einem echten Mangel, und das Papier ist offen darüber, was es nicht leistet. Die Bedeutung für die Governance liegt einen Schritt weiter. Wenn ein System Zustände über ein ganzes Dokument hinweg trägt, ist die Einheit, die versagen kann, nicht mehr der Satz. Fehler hören auf, unabhängige Ereignisse zu sein, und werden zu Eigenschaften der gesamten Passage, und die Bewertungspraktiken, die das Feld entwickelt hat und die Sätze einzeln bewerten und mitteln, können das nicht erfassen. Das Risiko besteht nicht darin, dass die Forschung sich selbst überbewertet. Es besteht darin, dass die Worte „diskursbewusst“ in Beschaffungsdokumenten auftauchen werden, lange bevor irgendjemand sich darauf geeinigt hat, wie zu prüfen ist, ob der Diskurs tatsächlich angemessen behandelt wird.
Was das Papier behauptet und was es über sich selbst sagt
DiscoSign befasst sich mit drei Phänomenen. Das erste ist die räumliche Koreferenz: In ASL werden Entitäten Orte im Gebärdenraum zugewiesen und später durch Zurückzeigen auf diese referenziert, sodass ein System sich merken muss, dass Alice links und Bob rechts platziert wurde. Das zweite sind Question-Answer Clauses, die Topic-Comment-Strukturen, bei denen ein Gebärdender eine rhetorische Frage stellt und sie sofort beantwortet, was an manchen Stellen im Diskurs angemessen und an anderen unpassend ist. Das dritte ist die Konzept-Gloss-Konsistenz, was bedeutet, dass ein Konzept, das fünfmal in einem Dokument vorkommt, jedes Mal durch dieselbe Gebärde wiedergegeben werden sollte, anstatt zwischen nahezu synonymen Varianten zu wechseln. Jedes wird von einem Modul behandelt, das ein Register führt, es dem Sprachmodell als harte Beschränkung vorgibt und dann die zurückgegebene Ausgabe prüft und Verstöße direkt korrigiert.
Das Papier berichtet, dass dies die räumliche Konsistenz und die Entitätsverfolgung im Vergleich zu satzbasierten Baselines wesentlich verbessert, während die Qualität auf Satzebene stabil bleibt, und es führt eigene Metriken ein, weil, wie es heißt, Standard-Metriken für maschinelle Übersetzung „die Qualität auf Diskursebene nicht erfassen können“. Sein Abschnitt zu den Einschränkungen ist ungewöhnlich direkt. Das Framework „befasst sich mit der manuellen Gebärdenproduktion durch Glosses, bezieht jedoch keine nicht-manuellen Marker (NMMs) wie Mimik und Prosodie ein, die in Gebärdensprachen kritische grammatische und affektive Informationen tragen.“ Einem seiner drei Datensätze „fehlen Ground-Truth-ASL-Annotationen“, sodass Teile der Bewertung auf Diskursebene auf automatischen Metriken und Rückübersetzung beruhen. Die Regel, die entscheidet, wann eine Question-Answer Clause angemessen ist, „kann die Optionalität“ einer Struktur nicht abbilden, die manchmal eine Stilfrage ist. Die Autoren geben zudem an, dass sie „mit Mitgliedern der Gebärdengemeinschaft zusammengearbeitet“ haben und Gallaudet-Mitautoren einbeziehen, was in dieser Literatur nicht die Norm ist und klar benannt werden sollte.
Konsistenz ist keine Genauigkeit
Der Mechanismus, der DiscoSign funktionieren lässt, ist auch der, der es zu einem Governance-Problem macht, und das ist der Teil, der sich nicht allein aus der Lektüre der Zusammenfassung ergibt. Ein Register sorgt dafür, dass eine früh getroffene Entscheidung durchgängig angewendet wird. Ist die Entscheidung richtig, ist die gesamte Passage kohärent. Ist die Entscheidung falsch, ist die gesamte Passage auf dieselbe Weise falsch. Ein Referent, der im zweiten Satz dem falschen Ort zugeordnet wird, erzeugt nicht einen schlechten Satz; er erzeugt ein Dokument, in dem jeder spätere Verweis zuversichtlich auf die falsche Person zeigt. Ein Konzept, das auf eine ungenaue Gebärde abgebildet wird, ist kein isolierter Ausrutscher; es ist diese Gebärde, wiederholt, wobei die Konsistenzmechanik des Systems aktiv die Korrektur verhindert, die Variation sonst hätte einbringen können. Die eigene Beschreibung der Pipeline im Papier besagt, dass „auf der Gloss-Stufe eingeführte Fehler auf Diskursebene sich durch die gesamte Pipeline fortpflanzen“.
Satzbasierte Systeme versagen laut, und lautes Versagen hat eine unterschätzte Eigenschaft: Ein Leser bemerkt es. Inkonsistenz ist als Fehler erkennbar. Ein System, das konsistent falsch liegt, sieht aus wie ein System, das es so meint. Für einen Deaf-Leser, der die Ausgabe empfängt, ohne sie mit der Quelle abzugleichen, ist ein stabil falscher Referent überhaupt nicht offensichtlich ein Fehler; es ist einfach das, was das Dokument aussagt. Dies kehrt die übliche Annahme um, dass bessere interne Kohärenz sicherer sei. Kohärenz erhöht die Kosten eines Fehlers genau in dem Moment, in dem sie dessen Sichtbarkeit verringert, und kein Durchschnitt von Satzbewertungen wird das zeigen.
Was die neuen Metriken messen und was sie validiert hat
Das Papier ist hier sorgfältig, und die Sorgfalt lohnt eine genaue Lektüre, weil sie die Obergrenze dessen setzt, was verantwortungsvoll nachgelagert behauptet werden kann. Die neuen Metriken messen die Konsistenz räumlicher Indizes, die Stabilität der Konzept-Gloss-Zuordnung und die Angemessenheit der Verwendung von Question-Answer Clauses. Zwei der drei messen, ob das System durchgängig dasselbe getan hat, was eine Eigenschaft der Ausgabe für sich genommen ist und kein Maß dafür, ob ein Deaf-Leser die Passage verstanden hat. Zur Validierung der Metriken bewerteten zwei ASL-fließende Gutachter zweiunddreißig Geschichten mit hundertzweiundfünfzig Sätzen auf einer fünfstufigen Skala. Die räumliche Konsistenz korrelierte mäßig mit ihren Urteilen. Die Konzept-Gloss-Konsistenz korrelierte. Die Angemessenheitsmetrik für Question-Answer Clauses erreichte keine Signifikanz, und das Papier führt dies darauf zurück, dass die Gutachter uneinig waren, was überhaupt als solche Klausel zählt, wobei die gewichtete Übereinstimmung zwischen ihnen als mäßig beschrieben wird.
Für einen Forschungsbeitrag, der eine neue Metrik validiert, sind zwei Expertengutachter ein vertretbares Design, und die Ehrlichkeit hinsichtlich des negativen Ergebnisses ist anerkennenswert. Als Grundlage für institutionellen Einsatz reicht es bei Weitem nicht aus, und das Papier behauptet auch nichts anderes. Drei Unterscheidungen sind wichtig, falls diese Arbeit in Beschaffungsprozesse einfließt. Erstens ist die Korrelation einer automatischen Metrik mit Expertenbewertungen derselben Eigenschaft nicht dasselbe wie die Messung, ob Deaf-Leser das Dokument verstehen, was bisher niemand auf Diskursebene getan hat. Zweitens ist „ASL-fließend“ kein Synonym für Deaf, und das Papier berichtet nicht über die Gehörlosigkeit, Zertifizierung oder den Hintergrund der Gutachter. Drittens ist ein automatisierter Score, der behauptet, die Verwendung sei angemessen gewesen, noch kein Sicherstellungsartefakt, egal welche Zahl er liefert, wenn qualifizierte Gutachter sich nicht einmal darüber einig sind, ob eine grammatische Struktur überhaupt vorliegt.
Gloss ist immer noch nicht die Sprache
Die Berichterstattung, die dies als Gebärdensprach-KI darstellt, die über die satzweise Übersetzung hinausgeht, greift weiter, als tatsächlich gebaut wurde. DiscoSign erzeugt Gloss, eine schriftliche Bezeichnungsfolge, die für manuelle Gebärden steht, und die Autoren sagen direkt, dass nicht-manuelle Marker nicht einbezogen sind. In ASL liegt ein großer Teil der Diskursstruktur, die das Papier zu bewahren versucht, genau in diesen Kanälen. Themenmarkierung, die Grenze zwischen den Frage- und Antworthälften genau der Strukturen, die das Framework modelliert, die Perspektivwechsel, die anzeigen, aus wessen Sicht gesprochen wird, der Blickkontakt, der einen Verweis mit einem Ort im Raum verknüpft: Diese werden durch Gesicht, Kopf und Körper getragen. Eine Gloss-Zeichenkette kann festhalten, dass ein Referent Index-j ist; sie kann nicht den Blick festhalten, der den Verweis verankert.
Die Autoren sehen dies und sagen etwas Nützliches dazu, nämlich dass der Zustand, den ihre Register halten, der Information nahekommt, die ein nachgelagertes visuelles System benötigen würde, um nicht-manuelle Marker zu erzeugen, und dass die Ableitung dieser Annotationen aus dem Register ein naheliegender nächster Schritt sei. Das ist eine nüchterne Beschreibung unfertiger Arbeit. Es ist nicht dasselbe wie ein System, das kohärenten gebärdeten Diskurs erzeugt, und der Abstand zwischen beidem ist die Stelle, an der ein Beschaffungsverantwortlicher, der eine Presse-Zusammenfassung liest, in die Irre geführt wird. Ein Käufer, dem gesagt wird, die Pipeline eines Anbieters sei diskursbewusst, hat das Recht zu fragen, welche Stufe damit gemeint ist und ob irgendetwas nach der Gloss-Stufe diese Eigenschaft bewahrt.
Der Datensatz, der nicht genannt wird
Das Papier führt drei Datenquellen auf: ASL STEM Wiki, Aesops Fabeln von Project Gutenberg und, in eigenen Worten, „einen lizenzierten Datensatz“. Die ersten beiden sind identifiziert und überprüfbar. Der dritte wird nicht benannt. Das ist übliche Praxis und spiegelt sehr wahrscheinlich eine kommerzielle Lizenz wider und nichts Verdächtiges, aber es lohnt sich, dies als offene Frage festzuhalten, statt darüber hinwegzugehen, denn bei gebärdensprachlicher Arbeit ist die Herkunft eines Korpus eine Frage über Menschen. Gebärdendaten werden von Gebärdenden aufgezeichnet, deren Gesichter und Körper die Daten sind. Ob diese Gebärdenden für Forschung zur maschinellen Übersetzung ihre Zustimmung gegeben haben, ob sie entschädigt wurden und was die Lizenz nachgelagert erlaubt, lässt sich nicht beantworten, wenn die Quelle nicht benannt ist. Ein Feld, das zunehmend von der Qualität und Herkunft seiner Korpora abhängt, wird irgendwann von Regulierungsbehörden und Deaf-Organisationen diese Fragen gestellt bekommen, und die Quelle zu benennen ist der günstigste denkbare Weg, darauf vorbereitet zu sein.
Was sich für die Bewertung ändert, wenn das System sich erinnert
Wenn diskursbewusste Systeme zur Norm werden, und die Entwicklungsrichtung deutet darauf hin, dass dies geschehen wird, dann benötigt jeder, der sie bewertet, Instrumente, die auf der Ebene arbeiten, auf der das System jetzt arbeitet. Aus dem, was dieses Papier zeigt, ergeben sich sechs Anforderungen. Die erste ist Persistenz über Länge: Konsistenz, gemessen über drei Sätze hinweg, sagt nichts darüber aus, ob ein System ein Dutzend Referenten über eine Textseite hinweg hält, daher müssen Tests Dokumentlänge und Referentendichte angeben, statt einen Durchschnitt zu berichten. Die zweite ist Propagation: Eine Bewertung sollte berichten, wie weit sich ein einzelner früher Fehler fortpflanzt, gemessen als betroffene nachfolgende Sätze, nicht verwässert über ein Dokument als Bruchteils-Score. Die dritte ist der Worst Case neben dem Mittelwert, denn das Risiko einer Institution wird durch die Passage bestimmt, die versagt hat, nicht durch die durchschnittliche Passage.
Die vierte ist Wiederherstellung: Ein System, das Zustände hält, sollte darauf getestet werden, ob es eine Zuweisung revidieren kann, wenn späterer Text einer früheren Schlussfolgerung widerspricht, und darauf, was passiert, wenn ein Dokument einen Referenten legitim neu zuordnet. Die fünfte ist menschliche Korrektur auf der richtigen Ebene, da ein Prüfer, der Satz für Satz kontrolliert, eine Passage genehmigen wird, deren Fehler eine Eigenschaft des Ganzen ist, was bedeutet, dass für satzbasierte Ausgabe konzipierte Prüfverfahren nicht übertragbar sind. Die sechste ist Verständlichkeit für Deaf-Leser, gemessen an ganzen Dokumenten gegen einen menschlichen gebärdeten Vergleichsmaßstab, was der einzige Beleg dafür bleibt, dass die gemessene interne Konsistenz auch tatsächlich die Person erreicht, für die sie gedacht ist. Die Position von NCG, der dieses Papier nicht widerspricht, ist, dass interne Metriken ein Input für Assurance sind und niemals ein Ersatz für validierte Ausgabe, und dass der erforderliche Nachweisumfang mit den Einsätzen des Kontexts steigt, in dem die Ausgabe verwendet wird.
Die Grenzen dieser Analyse
Diese Lesart stützt sich auf die veröffentlichte arXiv-Version des Papiers zusammen mit öffentlicher Berichterstattung über sein Erscheinen auf Apples Forschungsseite, was nicht unabhängig verifiziert wurde. DiscoSign ist Forschung, kein Produkt: Nichts hier beschreibt ein eingesetztes System, kein Anbieter stellt Behauptungen darüber auf, und kein NCG-Instrument wurde darauf angewendet. Die obige Kritik ist keine Kritik an den Autoren, die die meisten dieser Einschränkungen selbst benennen und dem Feld einen Dienst erwiesen haben, indem sie Metriken veröffentlichten, die Diskursversagen überhaupt erst messbar machen. Es geht um das, was als Nächstes geschieht, wenn ein echter Forschungsfortschritt von Menschen, die den Abschnitt zu den Einschränkungen nicht gelesen haben, zu einer Fähigkeitsbehauptung komprimiert wird.
Das Nützliche an diesem Papier ist, dass es ein verborgenes Problem sichtbar macht. Satzbasierte Systeme versagten die ganze Zeit beim Diskurs; es gab schlicht kein Instrument, das dies erkennen konnte. Jetzt gibt es den Anfang eines solchen, und er kommt mit einem Befund, der ebenso als Warnung wie als Ergebnis gelesen werden sollte. Ein System konsistent zu machen, macht es nicht korrekt. Es macht es durchgängig korrekt oder durchgängig falsch und entscheidet, bevor jemand ein Wort der Ausgabe liest, welches von beidem es sein wird.
Quellen
1. Vasileios Baltatzis, Mert Inan, Connor Gillis, Raja Kushalnagar, Lorna Quandt, Leah Findlater und Colin Lea, „DiscoSign: Discourse-Aware Text to Sign Language Gloss Translation“, arXiv:2609.02796, 2. September 2026, angenommen für die EMNLP 2026 Main Conference. https://arxiv.org/abs/2609.02796
2. DiscoSign, Volltext (HTML). https://arxiv.org/html/2609.02796
3. AI Global Wire, Bericht über das Erscheinen des Papiers auf Apple Machine Learning Research, 11. September 2026. https://aiglobalwire.com/article/discosign-discourse-aware-text-to-sign-language-gloss-translation-dbf89917-bb51-4793-be6d-29ed6727d3e0
