*Traducción confiada errónea en los sistemas de lengua de signos a texto, y los parámetros de referencia que no pueden verla*
El 9 de septiembre de 2026, el medio tecnológico chino Quantum Bit informó de un método de vivo AI Lab llamado CAPO-SLT, procedente de un artículo titulado «CAPO-SLT: Confidence-Aware Policy Optimization for Stable Sign Language Translation Generation», publicado en OpenReview, donde los artículos permanecen mientras están en revisión por pares. El problema que señala es el que debería preocupar a cualquiera que compre esta tecnología. Un sistema de traducción puede producir una frase fluida, gramatical y del todo plausible sin ningún respaldo en lo que el signante realmente hizo, y como la frase se lee bien, nada en ella anuncia el error. Como lo expresa el reportaje, una sola palabra localmente plausible pero carente de respaldo visual puede desviar toda una traducción, con el error acumulándose a lo largo de la frase. El método ajusta los límites dentro de los cuales el aprendizaje por refuerzo puede actualizar el modelo, token por token, según cuán segura fuera la política anterior: límites más estrechos donde la confianza es alta, cerca de 0,2, y más amplios donde es baja, hasta 0,3, con topes adicionales en los tokens que tienen ventaja negativa. El objetivo es evitar que el modelo se aferre a conjeturas seguras y dejar margen para que las inciertas sean corregidas hacia la evidencia visual.
Los resultados reportados son más limitados de lo que sugiere el enfoque del titular, y la diferencia importa. En el parámetro de referencia chino CSL-Daily, las ganancias reportadas se miden frente a dos sistemas nombrados que también trabajan a partir de datos de pose: aproximadamente 1,26 BLEU-4 sobre Geo-Sign y 3,07 BLEU-4 sobre Uni-Sign, siendo la afirmación que se trata de las mejores puntuaciones entre los sistemas basados únicamente en pose, y no las mejores del campo en general. En el parámetro de referencia de lengua de signos americana How2Sign, las cifras reportadas son 41,4 BLEU-1, 15,2 BLEU-4 y 34,9 ROUGE-L, ganancias de alrededor de un punto o menos frente a Uni-Sign. El propio artículo no pudo leerse para este análisis, porque el repositorio que lo aloja exige un paso de verificación del navegador, así que lo que sigue examina el problema que el trabajo señala, la dirección de traducción en la que opera y el tipo de evidencia que se ofrece, en lugar de evaluar el sistema. Vale la pena examinar esos aspectos por sí mismos, porque el problema es real, la dirección es la que las instituciones manejan con menos cuidado, y el tipo de evidencia no puede demostrar aquello que se le pide que demuestre.
En qué sentido va la traducción
La mayor parte del debate público sobre la IA de las lenguas de signos concierne a la salida hacia personas Deaf: un avatar en un panel de salidas, un vídeo con signos en un sitio web, un robot en un aula. La traducción de signos a texto va en sentido contrario. La entrada es una persona Deaf signando y la salida es texto que todos los demás leen, y eso cambia lo que significa un error. Cuando un avatar signa mal, una persona Deaf recibe una traducción deficiente y por lo general puede notar que algo va mal. Cuando un sistema de signos a texto fabrica una frase fluida, las palabras de la persona Deaf han sido reemplazadas por palabras que no dijo, y esas palabras llegan a un clínico, un gestor de casos, un investigador o un taquígrafo judicial, que no tiene forma de saber que algo ha ocurrido.
La asimetría es el problema de gobernanza. La única persona en la sala capaz de detectar el error es aquella cuyo significado fue reemplazado, y a menudo esa persona es la que nunca ve la salida. El texto producido de esta manera no se evapora: se escribe en una nota de admisión, una declaración, una evaluación de desempeño, un expediente. Una vez allí, adquiere la autoridad del registro en lugar del estatus de una traducción automática, y la persona Deaf debe impugnar un documento que pretende citarla. Un error fluido en este sentido no es una adaptación de acceso fallida. Es una atribución, y las instituciones apenas tienen mecanismos para retractarse de una.
La métrica no puede ver el fallo
Cada cifra reportada para este método, y para prácticamente cualquier sistema similar, es BLEU o ROUGE. Ambos funcionan comparando la salida de la máquina con una traducción de referencia y midiendo la coincidencia de secuencias de palabras. Se crearon para la traducción automática de lenguas habladas y miden el parecido con una referencia, lo cual no es lo mismo que la fidelidad a lo que el signante expresó. Una frase fabricada que resulta compartir una fraseología común con la referencia obtiene buena puntuación. Una traducción correcta expresada de otra manera obtiene mala puntuación. El modo de fallo que este método está diseñado para corregir, una salida fluida sin respaldo en la evidencia visual, es precisamente el fallo que estas métricas son menos capaces de detectar, porque la fluidez es lo que recompensan.
Esto no es una queja externa al campo. Un artículo del Centre for Vision, Speech and Signal Processing de la Universidad de Surrey, publicado este mes, evalúa seis sistemas de traducción y concluye que «las ganancias en BLEU-4 no son por sí solas evidencia de una mejor comprensión de la lengua de signos», señalando que el entorno multimodal de bajos recursos «permite a los modelos explotar correlaciones espurias y prioridades del lenguaje hablado, en lugar de aprender representaciones más sólidas de los signos». Su protocolo alternativo, que comprueba si el contenido del pasaje se conservó, reordena el campo y revela una brecha entre sistemas que BLEU-4 no podía ver en absoluto. Leído junto a este hallazgo, una mejora reportada en BLEU-4 es evidencia de que la salida se asemeja más a las referencias. Todavía no es evidencia de que el sistema comprendiera los signos, y desde luego no es evidencia de que la fabricación confiada se haya reducido.
El tamaño de la ganancia reportada también importa aquí. Mejoras de aproximadamente uno a tres puntos BLEU-4 frente a líneas de base nombradas son un progreso incremental ordinario, y se están ofreciendo como evidencia de que un sistema fabrica menos. Leído frente al hallazgo de Surrey, esa es la parte más débil del argumento: una ganancia de unos pocos puntos en una métrica que el propio campo dice que no rastrea la comprensión de la lengua de signos no puede establecer que la fabricación confiada se haya reducido. La afirmación puede seguir siendo cierta. Demostrarlo requeriría un instrumento distinto, y el artículo, que está en revisión y no publicado, es donde tendría que encontrarse esa demostración.
La confianza es una señal de entrenamiento, no una divulgación
Lo más interesante del enfoque, tomado al pie de la letra, es que trata la propia incertidumbre del modelo como información sobre la que vale la pena actuar. Ese es el instinto correcto y apunta a lo que la contratación pública debería exigir, aunque no exactamente en la forma que ofrece el método. Un valor de confianza utilizado dentro del entrenamiento cambia cómo aprende el modelo. No llega a la persona que lee la salida, y no cambia el aspecto de la salida cuando el modelo está incierto. El sistema sigue produciendo una frase fluida, porque producir frases fluidas es lo que hace. Nada en el texto indica que tres de sus palabras fueron conjeturas.
Dos cosas cambiarían eso, y ninguna es exótica. La primera es la abstención: el sistema debería poder negarse. Un sistema de signos a texto capaz de decir «este pasaje no se captó con claridad» y marcar el vacío es considerablemente más seguro que uno que siempre devuelve una frase completa, porque un vacío visible invita a un humano a completarlo, mientras que una invención fluida no lo hace. La segunda es la exposición: la confianza, cuando el sistema la tiene, debería ser visible en el punto de uso, y los tramos de baja confianza deberían marcarse en el texto que llega al lector. Un proveedor que afirma un 95 por ciento de precisión describe un promedio, y un promedio no le dice nada al comprador sobre la naturaleza del cinco por ciento restante. Un cinco por ciento de ruido es una molestia. Un cinco por ciento de fabricación confiada, distribuido de manera impredecible en un historial médico o una declaración de testigo, es un producto completamente distinto, y la única cifra que la mayoría de los proveedores publica no puede distinguir entre ambos.
Lo que la entrada de pose transmite y lo que no
El sistema reportado trabaja a partir de datos de pose, es decir, puntos clave corporales rastreados en lugar de vídeo en bruto. Hay una ventaja real de privacidad en ello, ya que los puntos clave son menos identificativos que el metraje del rostro de un signante, y esto importa en un campo donde los datos son el cuerpo de una persona. Pero también plantea una pregunta que no puede responderse sin el artículo: qué puntos clave. Las lenguas de signos llevan gramática en el rostro. Un movimiento de cabeza puede negar la frase que acompaña, la posición de las cejas puede marcar la diferencia entre una afirmación y una pregunta, y los patrones de la boca desambiguan signos que las manos representan de forma idéntica. Si un conjunto de puntos clave muestrea el rostro de forma escasa, un sistema puede ser estructuralmente incapaz de ver los rasgos que invierten un significado, y el fallo que esto produce es del tipo fluido: una frase declarativa limpia donde el signante negó, o una afirmación donde el signante preguntó. En un entorno clínico o legal, la diferencia entre una frase y su negación es todo el contenido.
Los parámetros de referencia no son despliegues
CSL-Daily es un corpus de lengua de signos china grabado en un laboratorio sobre temas cotidianos. How2Sign es un amplio conjunto de vídeos instructivos de lengua de signos americana. Ambos son recursos de investigación serios y ninguno se asemeja a las condiciones en las que una institución realmente usaría la conversión de signos a texto: una persona con dolor, signando desde una cama de hospital en un ángulo para el que la cámara no fue diseñada, en una variedad regional, con una mano inmovilizada por una cánula, interrumpida, angustiada o cambiando de registro. La cifra reportada de How2Sign, 15,2 BLEU-4, merece tenerse en cuenta por esa razón. En el más abierto de los dos parámetros de referencia, en condiciones favorables, el estado de este campo produce una salida cuya coincidencia con una traducción de referencia humana sigue siendo modesta. Ese es un resultado de investigación, y razonable. No es una base sobre la cual debería confiarse nada para registrar lo que dijo un paciente Deaf.
Qué debería exigir un comprador
De ello se derivan seis requisitos, específicos de este sentido de traducción. El primero es la abstención con un vacío visible, de modo que la incertidumbre aparezca como un vacío y no como prosa. El segundo es el marcado de confianza en el texto entregado, disponible para el lector y no solo para el modelo. El tercero es la retrotraducción hacia el signante antes de registrar nada, de modo que la persona Deaf vea, en su propia lengua, lo que el sistema está a punto de decir en su nombre, y pueda detenerlo. El cuarto es la procedencia en el registro: el texto derivado de traducción automática debería etiquetarse como tal dondequiera que se almacene, conservando la fuente, de modo que una disputa posterior verse sobre la salida de una máquina y no sobre la credibilidad de la persona.
El quinto es una vía de corrección que llegue al propio registro y no solo al servicio de atención del proveedor, porque una frase no corregida en un expediente sobrevive a cualquier ticket. El sexto es evidencia adecuada a la afirmación: fidelidad semántica medida mediante protocolos que comprueben si el contenido se conservó, pruebas adversarias sobre negación, preguntas y cambio de rol, desagregación por variedad de signos y condiciones de captura, y comprensión verificada con signantes Deaf en lugar de inferida a partir de la coincidencia con la referencia. La posición de NCG es que la evidencia exigida aumenta con lo que está en juego en el entorno, y que un sistema cuyos errores entran en un registro oficial atribuido a una persona se sitúa en lo más alto de esa escala, no en el medio.
Cómo la afirmación llegó al inglés
Hay una segunda historia aquí, y pertenece a una pieza sobre evidencia. El informe de Quantum Bit está debidamente fundamentado: nombra el método, describe lo que hace, reporta ganancias frente a líneas de base nombradas y enlaza el artículo. Para cuando esto llegó a los lectores de habla inglesa, había pasado por un sitio cuya firma es un «departamento editorial de IA», que se describe a sí mismo como un portal de optimización para motores generativos, es decir, contenido escrito para ser recuperado y repetido por herramientas de búsqueda de IA, y que puntúa sus propios artículos por calidad. Esa versión eliminó el enlace al artículo y convirtió las ganancias medidas frente a líneas de base concretas en puntuaciones absolutas planas. Nada de ello es fraudulento. Es simplemente un resumen de un resumen, optimizado para ser recogido por máquinas, y lo que eliminó silenciosamente fue el camino de regreso a la evidencia.
Vale la pena señalar esto porque así es como la mayoría de los responsables de contratación se encontrarán ahora con afirmaciones sobre esta tecnología. La afirmación de un proveedor entra en la literatura como un artículo presentado, es reportada con precisión por un medio especializado, es reescrita por un agregador para su recuperación, es recuperada por un asistente y llega a una nota informativa con las cifras endurecidas y la cita desaparecida. Cada paso es defendible por sí solo. El resultado es una cifra sin denominador, sin línea de base y sin documento detrás, presentada con más confianza de la que reclamaron los autores originales. La disciplina que protege aquí a un comprador es la misma que este artículo exige a la tecnología: rastrear la afirmación hasta aquello de lo que procede, y decir con claridad qué no se pudo leer.
Los límites de este análisis
El relato de CAPO-SLT aquí se basa en el reportaje comercial en chino sobre el trabajo, que nombra el artículo y lo enlaza. El propio artículo, alojado en un repositorio que exige un paso de verificación del navegador, no pudo leerse para este análisis, así que las cifras citadas son las reportadas, no verificadas contra la fuente, y nada de lo anterior debe leerse como una evaluación del sistema ni de vivo AI Lab, cuyo problema declarado es el correcto y cuyo método bien puede hacer lo que dice. El argumento se sostiene sobre el planteamiento del problema, que el campo ha nombrado ahora abiertamente, y sobre el trabajo publicado por otros acerca de lo que los parámetros de referencia estándar pueden y no pueden mostrar. No se ha aplicado a este sistema ningún instrumento de NCG, y el argumento más amplio no depende en absoluto de este método concreto.
Vale la pena terminar con lo alentador que hay aquí, porque lo hay. Un laboratorio de investigación comercial ha identificado públicamente la fabricación confiada como el defecto central de la traducción de signos a texto, en lugar de reportar otra ganancia incremental y dejar el fallo sin nombrar. Esa es la versión honesta del problema, y nombrarlo es la condición previa para medirlo. El riesgo ahora es el conocido: que el nombrar viaje, que la solución se dé por sentada, y que en algún lugar una institución escriba una frase fluida en el expediente de una persona Deaf creyendo que un artículo que nunca leyó resolvió el problema.
Fuentes
1. Quantum Bit vía 36kr, «CAPO-SLT logra las mejores puntuaciones en tres métricas chinas», informando sobre el método de vivo AI Lab, 9 de septiembre de 2026. https://36kr.com/p/3975775861813507
2. vivo AI Lab, «CAPO-SLT: Confidence-Aware Policy Optimization for Stable Sign Language Translation Generation», OpenReview (en revisión; no leído para este análisis). https://openreview.net/forum?id=l4bCsrSkYx
3. Zgeo (departamento editorial de IA), relato reescrito de lo anterior, 9 de septiembre de 2026. https://www.zgeo.com.cn/news/capo-slt-sign-language-translation-vivo-ai-lab
4. Oline Ranum, Edward Fish, Simon Hadfield y Richard Bowden, «Beyond BLEU: A Case for Redefining Sign Language Translation Benchmarks», Universidad de Surrey (CVSSP), arXiv:2609.03734, septiembre de 2026. https://arxiv.org/abs/2609.03734
5. «RVLF: A Reinforcing Vision-Language Framework for Gloss-Free Sign Language Translation», arXiv:2512.07273 (resultados reportados sin glosa en CSL-Daily). https://arxiv.org/abs/2512.07273
