Un artículo publicado en arXiv el 2 de septiembre de 2026 y aceptado en la conferencia principal de EMNLP describe DiscoSign, un marco para traducir texto en inglés a glosa de lengua de signos americana (ASL) mientras se mantiene un registro de lo que ya se ha dicho. Sus autores son investigadores de Apple y de Gallaudet University, y los agregadores informaron de su aparición en el sitio de investigación de aprendizaje automático de Apple el 11 de septiembre, que es donde la mayoría de los lectores ajenos al campo lo habrán encontrado. La afirmación técnica es acotada y está bien formulada. La mayoría de los sistemas de texto a signos traducen una frase cada vez y no tienen memoria entre frases, por lo que un referente ubicado en un lugar puede reasignarse silenciosamente en la siguiente, el mismo concepto puede representarse mediante tres signos distintos en tres frases consecutivas, y las estructuras retóricas que organizan el discurso signado no pueden elegirse porque el sistema no puede ver el discurso. DiscoSign añade registros explícitos que persisten entre frases, los impone como restricciones al modelo y, después, verifica y corrige la salida conforme a ellos.
Se trata de un avance real sobre un defecto real, y el artículo es sincero acerca de lo que no hace. La relevancia en materia de gobernanza está un paso más allá. Cuando un sistema mantiene un estado a lo largo de un documento, la unidad que puede fallar deja de ser la frase. Los errores dejan de ser sucesos independientes y pasan a ser propiedades del pasaje entero, y las prácticas de evaluación que el campo ha construido, que puntúan frases y las promedian, no pueden verlo. El riesgo no es que la investigación exagere sus resultados. Es que las palabras “consciente del discurso” lleguen a los documentos de contratación mucho antes de que nadie haya acordado cómo comprobar si el discurso realmente se está gestionando.
Lo que afirma el artículo, y lo que dice de sí mismo
DiscoSign aborda tres fenómenos. El primero es la correferencia espacial: en ASL, a las entidades se les asignan ubicaciones en el espacio de signado y después se hace referencia a ellas señalando de nuevo hacia esos lugares, de modo que un sistema debe recordar que Alice fue ubicada a la izquierda y Bob a la derecha. El segundo son las Cláusulas de Pregunta-Respuesta, las estructuras de tópico-comentario en las que quien signa formula una pregunta retórica y la responde de inmediato, apropiadas en algunas posiciones del discurso e incómodas en otras. El tercero es la coherencia entre concepto y glosa, es decir, que un concepto que aparece cinco veces en un documento debería representarse mediante el mismo signo cada vez, en lugar de alternar entre cuasi-sinónimos. Cada uno se gestiona mediante un módulo que mantiene un registro, lo plantea al modelo de lenguaje como una restricción estricta y, después, comprueba la salida devuelta y corrige las infracciones in situ.
El artículo informa de que esto mejora sustancialmente la consistencia espacial y el seguimiento de entidades frente a las líneas base a nivel de frase, sin perjudicar la calidad de frases individuales, e introduce sus propias métricas porque, como afirma, las métricas estándar de traducción automática “no logran captar la calidad a nivel de discurso”. Su apartado de limitaciones es inusualmente directo. El marco “aborda la producción manual de signos mediante glosas, pero no incorpora marcadores no manuales (MNM) como expresiones faciales y prosodia, que portan información gramatical y afectiva crítica en las lenguas de signos”. Uno de sus tres conjuntos de datos “carece de anotaciones de ASL de referencia (ground truth)”, por lo que partes de la evaluación a nivel de discurso se apoyan en métricas automáticas y en retrotraducción. La regla que decide cuándo es apropiada una Cláusula de Pregunta-Respuesta “no puede representar la opcionalidad” de una estructura que a veces es cuestión de estilo. Los autores también afirman que “colaboraron con miembros de la comunidad signante” e incluyen coautores de Gallaudet University, algo que no es la norma en esta literatura y que conviene señalar con claridad.
La consistencia no es exactitud
El mecanismo que hace funcionar a DiscoSign es también lo que lo convierte en un problema de gobernanza, y esta es la parte que no se deduce de la lectura del resumen. Un registro impone que una decisión tomada al principio se aplique en todo el documento. Si la decisión es correcta, todo el pasaje es coherente. Si la decisión es incorrecta, todo el pasaje es incorrecto de la misma manera. Un referente asignado a la ubicación equivocada en la segunda frase no produce una sola frase mala; produce un documento en el que cada referencia posterior apunta con confianza a la persona equivocada. Un concepto mapeado a un signo impreciso no es un desliz aislado; es ese signo, repetido, con la maquinaria de consistencia del sistema impidiendo activamente la corrección que la variación de otro modo podría haber introducido. La propia descripción del proceso que hace el artículo afirma que “los errores a nivel de discurso introducidos en la etapa de glosa se propagan por todo el proceso”.
Los sistemas a nivel de frase fallan de forma ruidosa, y el fallo ruidoso tiene una propiedad infravalorada: el lector lo nota. La inconsistencia se percibe como un defecto. Un sistema que se equivoca de manera consistente parece un sistema que lo dice en serio. Para un lector Sordo que recibe la salida en lugar de compararla con la fuente, un referente erróneo pero estable no resulta en absoluto un error evidente; es sencillamente lo que dice el documento. Esto invierte el supuesto habitual de que una mayor coherencia interna es más segura. La coherencia eleva el coste de un error en el mismo momento en que reduce su visibilidad, y ningún promedio de puntuaciones por frase lo mostrará.
Qué miden las nuevas métricas, y qué las validó
El artículo actúa aquí con cautela, y merece la pena leer esa cautela con atención porque establece el límite de lo que se puede afirmar razonablemente en fases posteriores. Las nuevas métricas miden la consistencia del índice espacial, la estabilidad del mapeo entre concepto y glosa, y la idoneidad del uso de las Cláusulas de Pregunta-Respuesta. Dos de las tres miden si el sistema hizo lo mismo de principio a fin, lo cual es una propiedad de la salida considerada en sus propios términos y no una medida de si un lector Sordo comprendió el pasaje. Para validar las métricas, dos evaluadores fluidos en ASL puntuaron treinta y dos historias, ciento cincuenta y dos frases, en una escala de cinco puntos. La consistencia espacial correlacionó moderadamente con sus valoraciones. La consistencia entre concepto y glosa también correlacionó. La métrica de idoneidad para las Cláusulas de Pregunta-Respuesta no alcanzó significación, y el artículo lo atribuye a que los evaluadores no coincidían sobre qué cuenta siquiera como tal cláusula, describiéndose el acuerdo ponderado entre ellos como moderado.
Para una contribución de investigación que valida una nueva métrica, dos evaluadores expertos es un diseño razonable, y la honestidad respecto al resultado negativo es encomiable. Como base para una implantación institucional, dista mucho de ser suficiente, y el artículo no afirma lo contrario. Hay tres distinciones que importan si este trabajo llega a la contratación pública. Primera, correlacionar una métrica automática con las valoraciones de expertos sobre la misma propiedad no es lo mismo que medir si los lectores Sordos comprenden el documento, algo que nadie ha hecho todavía a nivel de discurso. Segunda, “fluido en ASL” no es sinónimo de Sordo, y el artículo no informa sobre la sordera, certificación o formación de los evaluadores. Tercera, cuando evaluadores cualificados discrepan sobre si una estructura gramatical está siquiera presente, una puntuación automatizada que afirma que su uso fue apropiado todavía no constituye un artefacto de garantía, sea cual sea el número que produzca.
La glosa todavía no es la lengua
La cobertura que presenta esto como una IA de lengua de signos que supera la traducción frase por frase va más allá de lo que realmente se ha construido. DiscoSign produce glosa, una secuencia de etiquetas escritas que representa los signos manuales, y los autores afirman directamente que los marcadores no manuales no están incluidos. En ASL, buena parte de la estructura del discurso que el artículo intenta preservar reside precisamente en esos canales. La marcación de tópico, el límite entre las mitades de pregunta y respuesta de las propias estructuras que el marco modela, los cambios de rol que indican de quién es la perspectiva que se está expresando, la mirada que vincula una referencia a una ubicación en el espacio: todo esto lo portan el rostro, la cabeza y el cuerpo. Una cadena de glosa puede registrar que un referente es index-j; no puede registrar la mirada que hace que la referencia dé en el blanco.
Los autores son conscientes de ello y dicen algo útil al respecto, a saber, que el estado que mantienen sus registros está cerca de la información que un sistema visual posterior necesitaría para producir marcadores no manuales, y que derivar esas anotaciones a partir del registro es un siguiente paso natural. Se trata de una descripción sobria de un trabajo inacabado. No es lo mismo que un sistema que produce un discurso signado coherente, y es en la distancia entre ambas cosas donde un responsable de contratación que lea un resumen de prensa puede llevarse una idea equivocada. Un comprador al que se le dice que el proceso de un proveedor es “consciente del discurso” tiene derecho a preguntar a qué etapa se refiere eso, y si algo posterior a la glosa lo preserva.
El conjunto de datos que no se nombra
El artículo enumera tres fuentes de datos: ASL STEM Wiki, las Fábulas de Esopo del Proyecto Gutenberg y, en sus propias palabras, “un conjunto de datos con licencia”. Las dos primeras están identificadas y son comprobables. La tercera no se nombra. Esto es práctica habitual y muy probablemente refleja una licencia comercial y no algo indebido, pero merece registrarse como una cuestión pendiente en lugar de pasarse por alto, porque en el trabajo con lenguas de signos la procedencia de un corpus es una cuestión sobre personas. Los datos signados se registran a partir de signantes cuyos rostros y cuerpos son los datos. Si esos signantes dieron su consentimiento para investigación en traducción automática, si fueron compensados y qué permite la licencia en fases posteriores son preguntas sin respuesta cuando la fuente no está identificada. Un campo que depende cada vez más de la calidad y la procedencia de sus corpus acabará recibiendo estas preguntas por parte de reguladores y de organizaciones de Sordos, y nombrar la fuente es la forma más económica posible de estar preparado para ello.
Qué cambia en la evaluación cuando el sistema recuerda
Si los sistemas conscientes del discurso se convierten en la norma, y la dirección de avance sugiere que así será, entonces quienes los evalúen necesitan instrumentos que operen al nivel al que ahora opera el sistema. De lo que muestra este artículo se derivan seis requisitos. El primero es la persistencia a lo largo de la extensión: la consistencia medida en tres frases no dice nada sobre si un sistema mantiene una docena de referentes a lo largo de una página de prosa, por lo que las pruebas deben especificar la extensión del documento y la densidad de referentes en lugar de informar de un promedio. El segundo es la propagación: una evaluación debería informar hasta dónde viaja un único error temprano, medido como frases posteriores afectadas, no diluido en todo el documento como una puntuación fraccionaria. El tercero es el peor caso junto con la media, porque la exposición de una institución la determina el pasaje que falló, no el pasaje promedio.
El cuarto es la recuperación: un sistema que mantiene un estado debería probarse en cuanto a si puede revisar una asignación cuando un texto posterior contradice una inferencia anterior, y en cuanto a qué ocurre cuando un documento reasigna legítimamente un referente. El quinto es la corrección humana en el nivel adecuado, ya que un revisor que compruebe frase por frase aprobará un pasaje cuyo error es una propiedad del conjunto, lo que significa que los procedimientos de revisión escritos para salidas a nivel de frase no son trasladables. El sexto es la comprensión por parte de lectores Sordos, medida sobre documentos completos frente a un comparador humano signado, que sigue siendo la única evidencia de que algo de la consistencia interna que se está midiendo llega realmente a la persona a la que va dirigida. La postura de Novara Consulting Group, que este artículo no contradice, es que las métricas internas son un insumo para la garantía y nunca un sustituto de la salida validada, y la evidencia requerida aumenta con lo que está en juego en el contexto en que se usa la salida.
Los límites de este análisis
Esta lectura se basa en la versión de arXiv del artículo tal como fue publicada, junto con la cobertura pública de su aparición en el sitio de investigación de Apple, que no ha sido verificada de forma independiente. DiscoSign es investigación, no un producto: nada de esto describe un sistema implantado, ningún proveedor está haciendo afirmaciones sobre él, y no se le ha aplicado ningún instrumento de Novara Consulting Group. Las críticas anteriores no lo son hacia los autores, que exponen ellos mismos la mayoría de estas limitaciones e hicieron un servicio al campo al publicar métricas que hacen medible, siquiera, el fallo del discurso. El argumento trata de lo que ocurre después, cuando un auténtico avance de investigación se comprime en una afirmación de capacidad por parte de personas que no leyeron el apartado de limitaciones.
Lo útil de este artículo es que hace visible un problema oculto. Los sistemas a nivel de frase venían fallando en el discurso todo este tiempo; simplemente no existía un instrumento capaz de verlo. Ahora existe el comienzo de uno, y llega con un hallazgo que debería leerse tanto como advertencia cual resultado. Hacer que un sistema sea consistente no lo hace correcto. Lo hace correcto o incorrecto de principio a fin, y decide, antes de que nadie lea una sola palabra de la salida, cuál de las dos cosas será.
Fuentes
1. Vasileios Baltatzis, Mert Inan, Connor Gillis, Raja Kushalnagar, Lorna Quandt, Leah Findlater y Colin Lea, “DiscoSign: Discourse-Aware Text to Sign Language Gloss Translation,” arXiv:2609.02796, 2 de septiembre de 2026, aceptado en la Conferencia Principal de EMNLP 2026. https://arxiv.org/abs/2609.02796
2. DiscoSign, texto completo (HTML). https://arxiv.org/html/2609.02796
3. AI Global Wire, informe sobre la aparición del artículo en Apple Machine Learning Research, 11 de septiembre de 2026. https://aiglobalwire.com/article/discosign-discourse-aware-text-to-sign-language-gloss-translation-dbf89917-bb51-4793-be6d-29ed6727d3e0
