Artykuł opublikowany na arXiv 2 września 2026 roku i zaakceptowany do głównej konferencji EMNLP opisuje DiscoSign, ramy do tłumaczenia tekstu angielskiego na gloss amerykańskiego języka migowego (ASL) przy jednoczesnym śledzeniu tego, co zostało już powiedziane. Jego autorami są badacze z Apple i Gallaudet University, a agregatorzy informowali, że pojawił się on na stronie badań uczenia maszynowego Apple 11 września, gdzie większość czytelników spoza tej dziedziny mogła się z nim zetknąć. Techniczne twierdzenie jest wąskie i dobrze sformułowane. Większość systemów tekst-na-migowy tłumaczy jedno zdanie na raz i nie ma pamięci między zdaniami, więc odniesienie umieszczone w jednym miejscu może zostać po cichu przypisane na nowo w kolejnym, to samo pojęcie może zostać oddane trzema różnymi znakami w trzech kolejnych zdaniach, a struktury retoryczne organizujące dyskurs migowy nie mogą zostać wybrane, ponieważ system nie widzi dyskursu. DiscoSign dodaje jawne rejestry utrzymywane między zdaniami, wymusza je jako ograniczenia na modelu, a następnie weryfikuje i koryguje wynik względem nich.
To prawdziwy postęp wobec prawdziwej wady, a artykuł jest szczery co do tego, czego nie robi. Znaczenie dla zarządzania (governance) leży o krok dalej. Gdy system przenosi stan między zdaniami dokumentu, jednostką, która może zawieść, przestaje być zdanie. Błędy przestają być zdarzeniami niezależnymi i stają się właściwościami całego fragmentu, a praktyki ewaluacji, jakie wypracowała ta dziedzina — oceniające zdania i uśredniające je — nie są w stanie tego dostrzec. Ryzyko nie polega na tym, że badania przesadzają w swoich twierdzeniach. Polega na tym, że słowa „świadomy dyskursu” trafią do dokumentów zamówień publicznych na długo zanim ktokolwiek uzgodni, jak sprawdzić, czy dyskurs jest rzeczywiście obsługiwany.
Co twierdzi artykuł, a co mówi sam o sobie
DiscoSign zajmuje się trzema zjawiskami. Pierwsze to koreferencja przestrzenna: w ASL bytom przypisuje się lokalizacje w przestrzeni migowej, a później odnosi się do nich, wskazując z powrotem na te miejsca, więc system musi pamiętać, że Alicja została umieszczona po lewej, a Bob po prawej. Drugie to klauzule pytanie-odpowiedź (Question-Answer Clauses), struktury temat-komentarz, w których osoba migająca zadaje pytanie retoryczne i natychmiast na nie odpowiada, co jest odpowiednie w niektórych pozycjach dyskursu, a niezręczne w innych. Trzecie to spójność pojęcie-gloss, co oznacza, że pojęcie pojawiające się pięć razy w dokumencie powinno być oddane za każdym razem tym samym znakiem, a nie na przemian bliskoznacznymi. Każdym z nich zajmuje się moduł, który utrzymuje rejestr, przedstawia go modelowi językowemu jako twarde ograniczenie, a następnie sprawdza zwrócony wynik i koryguje naruszenia na miejscu.
Artykuł podaje, że znacząco poprawia to spójność przestrzenną i śledzenie bytów w porównaniu z bazowymi metodami na poziomie zdania, przy zachowaniu niezmienionej jakości pojedynczego zdania, i wprowadza własne metryki, ponieważ — jak stwierdza — standardowe metryki tłumaczenia maszynowego „nie oddają jakości na poziomie dyskursu”. Sekcja ograniczeń jest niezwykle bezpośrednia. Ramy „zajmują się produkcją ręcznych znaków poprzez glossy, ale nie uwzględniają znaczników niemanualnych (NMM), takich jak mimika i prozodia, które niosą kluczowe informacje gramatyczne i afektywne w językach migowych”. Jeden z trzech zbiorów danych „nie ma adnotacji ASL uznawanych za wzorcowe (ground truth)”, więc części ewaluacji na poziomie dyskursu opierają się na metrykach automatycznych i tłumaczeniu zwrotnym. Reguła decydująca o tym, kiedy klauzula pytanie-odpowiedź jest odpowiednia, „nie jest w stanie oddać opcjonalności” struktury, która czasem jest kwestią stylu. Autorzy stwierdzają również, że „współpracowali z członkami społeczności migowej” i wśród współautorów są osoby z Gallaudet, co nie jest normą w tej literaturze i warto to powiedzieć wprost.
Spójność to nie to samo co dokładność
Mechanizm, który sprawia, że DiscoSign działa, jest też tym, co czyni go problemem governance, i to jest część, która nie wynika z lektury samego streszczenia. Rejestr wymusza, by decyzja podjęta wcześnie była stosowana przez cały czas. Jeśli decyzja jest trafna, cały fragment jest spójny. Jeśli decyzja jest błędna, cały fragment jest błędny w ten sam sposób. Odniesienie przypisane do niewłaściwej lokalizacji w drugim zdaniu nie tworzy jednego złego zdania; tworzy dokument, w którym każde późniejsze odniesienie wskazuje z przekonaniem na niewłaściwą osobę. Pojęcie zmapowane na niedokładny znak nie jest odosobnionym potknięciem; to ten sam znak, powtarzany, przy czym mechanizmy spójności systemu aktywnie uniemożliwiają korektę, którą w innym wypadku mogłaby wprowadzić zmienność. Własny opis potoku przetwarzania w artykule stwierdza, że „błędy na poziomie dyskursu wprowadzone na etapie glossowania rozprzestrzeniają się przez cały potok”.
Systemy na poziomie zdania zawodzą hałaśliwie, a hałaśliwe zawodzenie ma niedocenianą właściwość: czytelnik to zauważa. Niespójność jest czytelna jako wada. System, który myli się konsekwentnie, wygląda jak system, który mówi to, co ma na myśli. Dla czytelnika Głuchego, który odbiera wynik, zamiast sprawdzać go względem źródła, stabilne błędne odniesienie wcale nie jest oczywistym błędem; jest po prostu tym, co mówi dokument. To odwraca zwykłe założenie, że lepsza wewnętrzna spójność jest bezpieczniejsza. Spójność podnosi koszt błędu w tym samym momencie, w którym obniża jego widoczność, a żadna średnia z ocen poszczególnych zdań tego nie pokaże.
Co mierzą nowe metryki i co je zwalidowało
Artykuł jest w tym miejscu ostrożny, a ta ostrożność zasługuje na uważną lekturę, ponieważ wyznacza pułap tego, co można odpowiedzialnie twierdzić na dalszych etapach. Nowe metryki mierzą spójność indeksu przestrzennego, stabilność mapowania pojęcie-gloss oraz odpowiedniość użycia klauzul pytanie-odpowiedź. Dwie z trzech mierzą, czy system robił to samo przez cały czas, co jest właściwością wyniku rozpatrywaną samą w sobie, a nie miarą tego, czy czytelnik Głuchy zrozumiał fragment. Aby zwalidować metryki, dwoje biegłych w ASL ewaluatorów oceniło trzydzieści dwie historie, sto pięćdziesiąt dwa zdania, w skali pięciopunktowej. Spójność przestrzenna korelowała umiarkowanie z ich ocenami. Spójność pojęcie-gloss korelowała. Metryka odpowiedniości dla klauzul pytanie-odpowiedź nie osiągnęła istotności statystycznej, a artykuł przypisuje to temu, że ewaluatorzy różnili się w ogóle co do tego, co liczy się jako taka klauzula, przy czym ważona zgodność między nimi została określona jako umiarkowana.
Jako wkład badawczy walidujący nową metrykę, dwoje eksperckich oceniających to rozsądny projekt, a uczciwość w kwestii negatywnego wyniku zasługuje na uznanie. Jako podstawa do wdrożeń instytucjonalnych jest to dalece niewystarczające, a artykuł nie twierdzi inaczej. Trzy rozróżnienia są istotne, jeśli ta praca przeniesie się do zamówień publicznych. Po pierwsze, korelowanie metryki automatycznej z ocenami eksperckimi tej samej właściwości to nie to samo co mierzenie, czy czytelnicy Głusi rozumieją dokument, czego nikt jeszcze nie zrobił na poziomie dyskursu. Po drugie, „biegły w ASL” nie jest synonimem „Głuchy”, a artykuł nie podaje głuchoty, certyfikacji ani pochodzenia ewaluatorów. Po trzecie, gdy wykwalifikowani oceniający nie zgadzają się co do tego, czy struktura gramatyczna w ogóle jest obecna, automatyczny wynik twierdzący, że jej użycie było odpowiednie, nie jest jeszcze artefaktem zapewnienia jakości (assurance), niezależnie od tego, jaką liczbę wygeneruje.
Gloss wciąż nie jest językiem
Relacje przedstawiające to jako sztuczną inteligencję dla języka migowego wykraczającą poza tłumaczenie zdanie po zdaniu sięgają dalej niż to, co faktycznie zbudowano. DiscoSign produkuje gloss, sekwencję pisemnych etykiet zastępującą znaki ręczne, a autorzy wprost mówią, że znaczniki niemanualne nie zostały uwzględnione. W ASL znaczna część struktury dyskursu, którą artykuł stara się zachować, mieści się właśnie w tych kanałach. Zaznaczanie tematu, granica między częścią pytającą a odpowiadającą tych samych struktur, które modeluje framework, zmiany ról sygnalizujące, czyja perspektywa jest wyrażana, kierunek wzroku wiążący odniesienie z powrotem z lokalizacją w przestrzeni — wszystko to jest przenoszone przez twarz, głowę i ciało. Ciąg glossów może zapisać, że odniesienie to index-j; nie może zapisać spojrzenia, które sprawia, że odniesienie trafia do celu.
Autorzy dostrzegają to i mówią coś użytecznego na ten temat, mianowicie że stan przechowywany przez ich rejestry jest bliski informacjom, jakich potrzebowałby system wizualny działający na dalszym etapie, aby wygenerować znaczniki niemanualne, oraz że wyprowadzenie tych adnotacji z rejestru jest naturalnym kolejnym krokiem. To trzeźwy opis niedokończonej pracy. To nie to samo, co system produkujący spójny dyskurs migowy, a odległość między tymi dwiema rzeczami to miejsce, w którym urzędnik zamówień publicznych czytający streszczenie prasowe zostanie wprowadzony w błąd. Nabywca, któremu powiedziano, że potok dostawcy jest „świadomy dyskursu”, ma prawo zapytać, który etap to opisuje i czy cokolwiek na dalszym etapie po glossie tę właściwość zachowuje.
Zbiór danych, którego nie nazwano
Artykuł wymienia trzy źródła danych: ASL STEM Wiki, Bajki Ezopa z Project Gutenberg oraz, jak to ujęto, „licencjonowany zbiór danych”. Dwa pierwsze są zidentyfikowane i możliwe do sprawdzenia. Trzeci nie jest nazwany. To zwyczajna praktyka i najprawdopodobniej odzwierciedla licencję komercyjną, a nie coś niestosownego, ale warto odnotować to jako otwarte pytanie, a nie pominąć, ponieważ w pracy nad językami migowymi pochodzenie korpusu jest pytaniem o ludzi. Dane migowe są nagrywane od osób migających, których twarze i ciała są danymi. Czy osoby te wyraziły zgodę na badania nad tłumaczeniem maszynowym, czy zostały wynagrodzone i co licencja pozwala robić na dalszych etapach — na te pytania nie da się odpowiedzieć, gdy źródło nie jest nazwane. Dziedzina coraz bardziej zależna od jakości i pochodzenia swoich korpusów w końcu zostanie zapytana o to przez regulatorów i organizacje Głuchych, a nazwanie źródła jest najtańszym możliwym sposobem, by być na to gotowym.
Co zmienia się w ewaluacji, gdy system pamięta
Jeśli systemy świadome dyskursu staną się normą, a kierunek rozwoju wskazuje, że tak się stanie, to każdy, kto je ewaluuje, potrzebuje narzędzi działających na poziomie, na jakim system obecnie funkcjonuje. Z tego artykułu wynika sześć wymagań. Pierwsze to trwałość przy długości: spójność mierzona w obrębie trzech zdań nic nie mówi o systemie utrzymującym tuzin odniesień na stronie prozy, więc testy muszą podawać długość dokumentu i gęstość odniesień, zamiast raportować średnią. Drugie to propagacja: ewaluacja powinna podawać, jak daleko rozprzestrzenia się pojedynczy wczesny błąd, mierzony jako liczba dotkniętych zdań w dalszej części, a nie rozmyty w dokumencie jako ułamkowy wynik. Trzecie to najgorszy przypadek obok średniej, ponieważ ekspozycja instytucji jest determinowana przez fragment, który zawiódł, a nie przez przeciętny fragment.
Czwarte to zdolność do naprawy (recovery): system utrzymujący stan powinien być testowany pod kątem tego, czy potrafi zrewidować przypisanie, gdy późniejszy tekst przeczy wcześniejszemu wnioskowi, oraz co się dzieje, gdy dokument w uzasadniony sposób przypisuje odniesienie na nowo. Piąte to korekta ludzka na właściwym poziomie, ponieważ recenzent sprawdzający zdanie po zdaniu zatwierdzi fragment, którego błąd jest właściwością całości, co oznacza, że procedury recenzji napisane dla wyników na poziomie zdania się nie przenoszą. Szóste to zrozumienie przez czytelników Głuchych, mierzone na całych dokumentach względem ludzkiego porównania migowego, co pozostaje jedynym dowodem na to, że jakakolwiek mierzona wewnętrzna spójność rzeczywiście dociera do osoby, dla której jest przeznaczona. Stanowisko NCG, któremu ten artykuł nie zaprzecza, jest takie, że metryki wewnętrzne są wkładem do zapewnienia jakości, a nigdy substytutem zwalidowanego wyniku, a wymagane dowody rosną wraz ze stawką kontekstu, w którym wynik jest wykorzystywany.
Ograniczenia tej analizy
Ta lektura opiera się na wersji artykułu opublikowanej na arXiv, wraz z publicznymi doniesieniami o jego pojawieniu się na stronie badawczej Apple, co nie zostało niezależnie zweryfikowane. DiscoSign to badania, nie produkt: nic tutaj nie opisuje wdrożonego systemu, żaden dostawca nie wysuwa na jego temat żadnych twierdzeń, a żadne narzędzie NCG nie zostało do niego zastosowane. Powyższe krytyki nie są krytyką autorów, którzy sami stwierdzają większość tych ograniczeń i wyświadczyli tej dziedzinie przysługę, publikując metryki, które w ogóle czynią błędy dyskursu mierzalnymi. Argument dotyczy tego, co dzieje się dalej, gdy prawdziwy postęp badawczy zostaje skompresowany do twierdzenia o możliwościach przez ludzi, którzy nie przeczytali sekcji ograniczeń.
Wartość tego artykułu polega na tym, że czyni widocznym ukryty problem. Systemy na poziomie zdania zawodziły w kwestii dyskursu przez cały czas; po prostu nie było narzędzia, które mogłoby to dostrzec. Teraz pojawia się jego początek, a przychodzi z odkryciem, które należy odczytywać w równym stopniu jako ostrzeżenie, co jako wynik. Uczynienie systemu spójnym nie czyni go poprawnym. Sprawia, że jest poprawny albo niepoprawny od początku do końca, i decyduje o tym, zanim ktokolwiek przeczyta jedno słowo wyniku, które z tych dwóch będzie prawdą.
Źródła
1. Vasileios Baltatzis, Mert Inan, Connor Gillis, Raja Kushalnagar, Lorna Quandt, Leah Findlater i Colin Lea, „DiscoSign: Discourse-Aware Text to Sign Language Gloss Translation,” arXiv:2609.02796, 2 września 2026, zaakceptowane na głównej konferencji EMNLP 2026. https://arxiv.org/abs/2609.02796
2. DiscoSign, pełny tekst (HTML). https://arxiv.org/html/2609.02796
3. AI Global Wire, doniesienie o pojawieniu się artykułu na Apple Machine Learning Research, 11 września 2026. https://aiglobalwire.com/article/discosign-discourse-aware-text-to-sign-language-gloss-translation-dbf89917-bb51-4793-be6d-29ed6727d3e0
