Skip to content
Ir directamente al texto

Gobernanza de IA liderada por Deaf

AI puede traducir. Pero, ¿quién traduce el riesgo?

Descargar PDF

Heather M. Grizzle Novara Consulting Group 17 de agosto de 2026

A principios de este mes escribí sobre la investigación de traducción de lengua de señas de Google DeepMind y argumenté que una demostración no es lo mismo que una evidencia. La respuesta me reveló algo útil. Casi nadie discrepó de que la distinción importa. Muchas personas hicieron, en cambio, la pregunta de seguimiento obvia: si una demostración no es suficiente, ¿quién debe decidir cuándo un sistema es lo bastante bueno para implementarse, y quién responde por ello cuando no lo es?

Esa pregunta no es específica de la lengua de señas. Es el problema central sin resolver en la gobernanza de la IA en este momento, y tiene un nombre que vale la pena usar sin rodeos. Llamémoslo la brecha de rendición de cuentas.

¿Qué es la brecha de rendición de cuentas en la IA?

La brecha de rendición de cuentas en la IA es la distancia entre lo que un sistema es capaz de hacer y aquello de lo que cualquier parte identificable responde cuando lo hace mal. Se abre siempre que una organización implementa un sistema de IA más rápido de lo que construye los medios para verificar su producción, escuchar a las personas afectadas por ella y corregir o detener la implementación cuando la producción es errónea.

La brecha no es principalmente un problema técnico. Los modelos fallan de maneras predecibles, y los ingenieros suelen ser francos sobre esos modos de fallo. La brecha es un problema institucional. Las organizaciones están adquiriendo sistemas cuya producción no pueden evaluar, implementándolos en entornos donde los errores tienen consecuencias, y sin conservar ningún mecanismo práctico para averiguar si el sistema está funcionando.

Capacidad, fiabilidad y rendición de cuentas son tres tipos distintos de evidencia

La mayoría de las conversaciones de adquisición tratan esto como una sola cosa. No lo es, y separarlas es el movimiento más útil que puede hacer un comprador institucional.

La evidencia de capacidad muestra que un sistema puede realizar una tarea bajo condiciones seleccionadas por el proveedor. Las demostraciones, las puntuaciones de referencia y las grabaciones piloto son evidencia de capacidad. Responden a la pregunta “¿es esto posible?”.

La evidencia de fiabilidad muestra cómo se desempeña el sistema en el rango de personas, entornos y condiciones que el comprador realmente encontrará, incluidas las que el proveedor no eligió. Los datos de desempeño desagregados, las pruebas independientes y las tasas de error en la implementación real son evidencia de fiabilidad. Responden a la pregunta “¿con qué frecuencia se equivoca, y para quién?”.

La evidencia de rendición de cuentas muestra qué ocurre cuando el sistema falla. Nombra quién supervisa el desempeño, quién recibe las quejas, quién tiene autoridad para suspender la implementación, qué se le debe a la persona afectada y cómo se hace cumplir todo ello. Responde a la pregunta “¿quién es responsable?”.

Los proveedores compiten en evidencia de capacidad porque es la más barata de producir y la más persuasiva de observar. La evidencia de fiabilidad es costosa y poco halagadora. La evidencia de rendición de cuentas no le corresponde realmente producirla al proveedor, porque describe la propia gobernanza del comprador, y la mayoría de los compradores no la ha construido.

Una organización que acepta la evidencia de capacidad como si resolviera las otras dos cuestiones no ha tomado una decisión de compra. Ha hecho una suposición y la ha pagado.

Por qué las leyes de divulgación no cierran la brecha

La respuesta regulatoria más visible al riesgo de la IA en este momento es la transparencia. Según el artículo 50 de la Ley de IA de la UE (Unión Europea, Ley de Inteligencia Artificial), las obligaciones que entraron en vigor el 2 de agosto de 2026 exigen que los proveedores marquen el contenido sintético en formato legible por máquina y que los implementadores divulguen las deepfakes y ciertos textos generados por IA sobre asuntos de interés público, con sanciones que llegan hasta 15 millones de euros o el tres por ciento de la facturación anual mundial total. La Comisión Europea concedió un período de gracia hasta el 2 de diciembre de 2026 para los sistemas generativos ya comercializados.

Este es un trabajo significativo y lo apoyo. También vale la pena precisar qué hace exactamente. El artículo 50 es un régimen de procedencia. Le dice a una persona que una máquina intervino. No le dice si la máquina acertó.

Para gran parte de los medios sintéticos, la procedencia es toda la cuestión. Si la preocupación es un video fabricado de una figura pública, saber que el video es sintético la resuelve. Pero para los sistemas de IA que median la comunicación, proporcionan información o influyen en una decisión sobre una persona, la procedencia es la mitad fácil. Una etiqueta que diga “esta traducción fue generada por IA” deja al receptor exactamente donde estaba, es decir, incapaz de saber si el contenido es preciso.

La mitad de responsabilidad legal del enfoque europeo ha avanzado en dirección opuesta. La propuesta de Directiva de Responsabilidad por IA de la Comisión, que habría aliviado la carga de la prueba para las personas perjudicadas por sistemas de IA, fue retirada formalmente en octubre de 2025. La transparencia avanzó. La reparación no lo hizo.

El patrón se repite en Estados Unidos a nivel estatal. Colorado aprobó la primera ley estatal integral sobre IA en 2024, y luego la derogó y sustituyó por la SB 26-189, firmada el 14 de mayo de 2026, cuyas obligaciones sustantivas para desarrolladores e implementadores se aplican a partir del 1 de enero de 2027. La sustitución eliminó los programas obligatorios de gestión de riesgos, las evaluaciones de impacto algorítmico y el deber independiente de diligencia razonable frente a la discriminación algorítmica. Lo que sobrevivió fue el aviso previo al uso, una divulgación en lenguaje sencillo dentro de los treinta días posteriores a una decisión adversa, la conservación de registros durante tres años y el derecho a solicitar una revisión humana significativa.

No estoy argumentando que esas obligaciones supervivientes carezcan de valor. El aviso y la conservación de registros son reales. Pero el aviso te dice que se usó un sistema. Los registros te dicen qué hizo. Ninguno establece que la salida fue precisa, y ninguno asigna responsabilidad por las consecuencias si no lo fue. La dirección del recorrido regulatorio en los últimos dos años ha sido hacia informar a las personas de que la IA intervino y alejarse de exigir que alguien responda por lo que produjo.

Asimetría de verificación: el problema estructural subyacente

Aquí está la parte que considero poco examinada, y es donde el caso de la lengua de señas deja de ser un ejemplo marginal y se convierte en la ilustración más clara disponible de una condición general.

En la mayoría de las implementaciones de IA, la persona mejor posicionada para detectar un error no tiene autoridad para actuar sobre él, y la parte con autoridad para actuar no tiene los medios para detectarlo. Yo lo llamaría asimetría de verificación, y es el mecanismo que produce la brecha de rendición de cuentas.

Considere lo que ve una institución oyente cuando implementa un sistema automatizado de lengua de señas. Ve que el sistema produjo una salida. El personal observa un avatar haciendo señas o aparecen subtítulos. Desde ese punto de vista, la transacción parece completa.

Ahora considere lo que experimenta la persona Deaf. Recibe una salida que no puede comparar con la fuente, entregada por un sistema que no eligió, en un entorno donde la institución ya ha concluido que se proporcionó acceso. Si la interpretación omite una negación, aplana una condicional, coloca mal una referencia espacial u omite los marcadores no manuales que llevan significado gramatical, la persona puede no saberlo. Si nota que algo está mal, se encuentra en la posición de tener que impugnar la propia conclusión de la institución de que la comunicación tuvo éxito.

Eso no es una queja sobre tecnología. Es una distribución de poder. La institución tiene la autoridad para determinar si hubo acceso y carece de la capacidad lingüística para evaluarlo. La persona Deaf tiene la capacidad lingüística y carece de la autoridad. El error, si lo hay, no tiene dónde salir a la luz.

Una vez que se ve la forma que tiene, se encuentra casi en todas partes. Un paciente no puede evaluar una recomendación de triaje asistida por IA. Un solicitante no puede inspeccionar el modelo que lo descartó. Un beneficiario de prestaciones no puede auditar la determinación de elegibilidad. Una persona que recibe instrucciones legales traducidas por máquina en cualquier idioma no puede verificar la traducción sin la fluidez que la traducción existe para suplir. En cada caso, la parte afectada absorbe un riesgo que no puede medir, y la institución que implementa registra una transacción completada.

Lo que hace que la lengua de señas sea un caso particularmente agudo son las consecuencias asociadas al contenido. El lenguaje en entornos institucionales conlleva consentimiento, testimonio, diagnóstico, instrucción y efecto legal. Una traducción errónea no es una experiencia de usuario degradada. Es un formulario de consentimiento defectuoso, un historial médico inexacto o una declaración tergiversada en un procedimiento.

La ley de accesibilidad ya respondió parte de esto, y lo estamos desaprendiendo

Ya existe una respuesta viable en la práctica de accesibilidad, lo que hace más difícil de disculpar su descuido actual.

Según la normativa del Departamento de Justicia en 28 CFR 35.160, una entidad pública debe dar consideración primordial a la ayuda o servicio auxiliar solicitado por la persona con discapacidad. La norma para los establecimientos públicos privados en 28 CFR 36.303 es más débil, pues exige consulta pero deja la decisión final en manos del proveedor, y esa diferencia en sí misma es instructiva sobre dónde tiende a erosionarse la autoridad de verificación. Las normas mínimas de la Asociación Nacional de Sordos (National Association of the Deaf) para la interpretación remota por video en entornos médicos plantean el principio subyacente de forma directa: una persona sorda o con dificultades auditivas sabe mejor que nadie qué ayuda o servicio auxiliar logrará una comunicación efectiva. Esas mismas normas van más allá y exigen que el intérprete de video le indique al proveedor que finalice la sesión remota y obtenga un intérprete presencial cuando el intérprete determine que el arreglo remoto no está logrando una comunicación efectiva.

Léalo como un diseño de gobernanza en lugar de una norma de accesibilidad, y resulta inusualmente bien construido. Sitúa el juicio de verificación en la persona que realmente puede emitirlo. Otorga a un profesional presente la autoridad para detener una implementación en pleno uso. Trata la efectividad como algo que se determina en contexto, en lugar de asumirse por la mera presencia del equipo.

Los sistemas automatizados tienden a eliminar ambas características. No hay un intérprete cualificado posicionado para ordenar un alto, porque el intérprete es precisamente lo que el sistema reemplazó. Y el juicio de la persona afectada sobre si la comunicación funcionó se degrada silenciosamente de una norma legal a una simple retroalimentación de cliente.

La Federación Mundial de Sordos (World Federation of the Deaf) y la Asociación Mundial de Intérpretes de Lengua de Señas (World Association of Sign Language Interpreters) establecieron un límite sobre los avatares de señas ya en 2018. Su postura fue que los avatares son inapropiados para información en vivo, compleja o significativa, y que el contenido estático preregrabado puede ser aceptable cuando personas Deaf asesoraron sobre el material y no se requiere interacción en vivo. Esa declaración tiene ocho años. La tecnología ha avanzado considerablemente desde entonces. El límite de implementación que trazó no ha sido reemplazado por nada más riguroso, y sigue siendo la línea más clara disponible.

Por qué la demostración del proveedor no puede ser el registro de gobernanza

La demostración está diseñada para ser persuasiva. Esa es su función, y no hay nada indebido en ello. El problema es que, en ausencia de una evaluación independiente, la demostración se convierte por defecto en la base probatoria de una decisión de adquisición, porque es el único documento presente.

Una demostración establece la posibilidad bajo condiciones seleccionadas. No puede establecer el desempeño en toda la población a la que sirve el comprador, el comportamiento fuera de condiciones controladas, la seguridad en entornos de altas consecuencias, ni la rendición de cuentas cuando ocurren errores. Esas son propiedades de una implementación, no propiedades de un modelo.

La política federal ya reconoce esto en principio. La guía de la OMB (Oficina de Administración y Presupuesto, Office of Management and Budget) emitida en abril de 2025 define la IA de alto impacto como los sistemas cuya salida sirve como base principal para decisiones o acciones con un efecto legal, material, vinculante o significativo sobre derechos o seguridad, y el memorando enumera ámbitos que incluyen derechos civiles, acceso a la educación, vivienda, empleo, beneficios y servicios gubernamentales, y salud. Para esos usos exige pruebas previas a la implementación, evaluaciones de impacto de la IA antes de la implementación y periódicamente después, supervisión humana adecuada, y revisión humana oportuna con posibilidad de apelación para las personas afectadas. Las agencias que no puedan cumplir esos mínimos deben interrumpir el uso de forma segura. El memorando complementario sobre adquisiciones exige cláusulas contractuales que otorguen a la agencia la capacidad de monitorear y evaluar regularmente el desempeño, los riesgos y la efectividad del sistema.

Sea cual sea la opinión que se tenga sobre los detalles, la estructura de esa guía es correcta. Trata la rendición de cuentas como algo especificado en el contrato, probado antes del lanzamiento, monitoreado después del lanzamiento y exigible mediante la suspensión. Eso es una capa de verificación. La mayoría de las instituciones que compran IA fuera del sistema federal de adquisiciones no tienen nada equivalente.

Añadiría una advertencia sobre asumir que la capacidad llegará según lo previsto y cerrará la brecha por sí sola. En abril de 2026, el Departamento de Justicia retrasó los plazos de cumplimiento de la norma de accesibilidad web del Título II de la ADA (Ley para Estadounidenses con Discapacidades, Americans with Disabilities Act) en aproximadamente un año para cada categoría de entidad, moviendo a las entidades públicas grandes al 26 de abril de 2027 y a las más pequeñas al 26 de abril de 2028. Entre las razones que dio el Departamento estaba que había sobreestimado las capacidades, tanto de personal como de tecnología, de las entidades cubiertas, y afirmó claramente que la tecnología avanzada, como la IA generativa, todavía no automatiza de forma fiable la remediación de contenido inaccesible a gran escala. Eso es un regulador federal dejando constancia de que las afirmaciones sobre la capacidad de la IA superaron su cumplimiento real en un contexto de accesibilidad. Vale la pena detenerse en ello antes de tratar cualquier calendario de un proveedor como un plan de gobernanza.

Lo que las instituciones deberían exigir antes de la implementación

Las preguntas que siguen no son exóticas. Son las preguntas que un comprador competente haría sobre cualquier sistema que conlleve consecuencias, y son respondibles.

¿Quién evaluó este sistema, y era independiente del proveedor y del comprador?

¿Qué poblaciones, dialectos, variantes regionales y entornos se incluyeron en las pruebas, y cuáles fueron los resultados para cada uno en lugar de en conjunto?

¿Con qué datos se entrenó el sistema, bajo qué licencia, y con qué consentimiento de las personas cuyo lenguaje capturó?

¿Cuál es la tasa de error medida en condiciones similares a las nuestras, y qué ocurre con esa tasa cuando las condiciones empeoran?

¿Quién en nuestra organización tiene la autoridad para suspender esta implementación, y qué activa esa autoridad?

¿Cómo reporta una persona afectada que el resultado fue incorrecto, quién recibe ese reporte, y qué cambia como resultado?

¿Qué tenemos derecho contractual a saber sobre el rendimiento después de la puesta en marcha, y cuál es nuestro recurso si el rendimiento disminuye?

Una organización que no puede responder estas preguntas no ha evaluado un sistema. Lo ha aceptado. Novara Consulting Group creó el Sign Language Access Trust Index para hacer que estas preguntas sean respondibles en una forma que las adquisiciones puedan realmente utilizar, con estándares de evidencia definidos, puntuación a nivel de indicador, y una distinción entre lo que un proveedor afirma y lo que una parte independiente puede confirmar. El instrumento es específico para la IA de lenguaje de señas. La disciplina subyacente no lo es.

La siguiente etapa de la IA es la verificación

La conversación pública sobre la IA se ha organizado en torno a la capacidad durante tres años. Puede escribir, puede razonar, puede ver, puede actuar, puede interpretar la comunicación humana. Esas preguntas se están respondiendo rápidamente, y a menudo de forma afirmativa.

La pregunta que determina si algo de esto es confiable es diferente. Es si las instituciones que implementan estos sistemas pueden saber cuándo los sistemas están equivocados, y si las personas afectadas por ellos tienen alguna posición para decirlo.

En este momento, en la mayoría de las implementaciones, la respuesta a ambas es no. El riesgo no ha sido traducido. Ha sido transferido a quien tiene menos capacidad de verlo.

Cerrar esa brecha no es cuestión de esperar mejores modelos. Requiere una evaluación independiente del proveedor, estándares de evidencia que sobrevivan al contacto con las adquisiciones, autoridad para detener una implementación situada en alguien presente, y un canal a través del cual el juicio de la persona afectada cuente para algo. Nada de eso es técnicamente difícil. Es institucionalmente inconveniente, lo cual es un problema diferente y más manejable.


Preguntas frecuentes

¿Qué es la brecha de responsabilidad de la IA? La brecha de responsabilidad de la IA es la distancia entre lo que un sistema de IA es capaz de hacer y de qué es responsable cualquier parte identificable cuando lo hace mal. Aparece cuando las organizaciones implementan IA más rápido de lo que construyen la capacidad de verificar su resultado, recibir quejas de las personas afectadas, y suspender la implementación cuando falla.

¿Es la transparencia de la IA lo mismo que la responsabilidad de la IA? No. Las reglas de transparencia, incluido el Artículo 50 de la Ley de IA de la UE, generalmente establecen la procedencia, es decir, informan a las personas de que el contenido fue generado o manipulado por IA. La responsabilidad establece quién es responsable de la exactitud de ese contenido y qué se le debe a la persona afectada cuando está equivocado. Un sistema puede estar completamente etiquetado y aun así no ser responsable.

¿Quién es legalmente responsable cuando un sistema de IA causa daño? En la mayoría de las jurisdicciones esto sigue sin resolverse. La Comisión Europea retiró su propuesta de Directiva de Responsabilidad por IA en octubre de 2025, y varios marcos estatales de Estados Unidos se han reducido hacia obligaciones de notificación y mantenimiento de registros en lugar de deberes sustantivos de cuidado. En la práctica, la responsabilidad se determina por los términos contractuales, la legislación específica del sector como los estatutos de discapacidad y derechos civiles, y la doctrina general de responsabilidad, en lugar de por reglas específicas de IA.

¿Por qué la IA de lenguaje de señas es un caso de prueba útil para la gobernanza de la IA? Porque hace visible la asimetría de verificación. La institución que implementa el sistema generalmente no puede evaluar el resultado, y la persona Deaf que puede evaluarlo generalmente no tiene autoridad para cuestionar la conclusión de la institución de que se proporcionó acceso. La misma estructura opera en la IA médica, de contratación y de beneficios, pero es más difícil de observar.

¿Qué debería exigir una organización antes de implementar un sistema de IA que afecta a las personas? Evaluación independiente en lugar de demostración del proveedor, datos de rendimiento desglosados por población y entorno, procedencia divulgada de los datos de entrenamiento, una persona designada con autoridad para suspender la implementación, un canal de quejas funcional para las personas afectadas, y derechos contractuales para monitorear el rendimiento después del lanzamiento.

¿Qué es el SLAT Index? El Sign Language Access Trust Index es el instrumento de evaluación de Novara Consulting Group para sistemas de IA de lenguaje de señas. Establece estándares de evidencia definidos a través de los dominios de gobernanza, lingüístico, transparencia, accesibilidad e implementación, puntúa los sistemas a nivel de indicador, y distingue la afirmación del proveedor del hecho confirmable de forma independiente, de modo que las decisiones de adquisición se basen en evidencia en lugar de en demostración.


Heather M. Grizzle es la fundadora de Novara Consulting Group, que asesora a instituciones sobre la gobernanza y adquisición de tecnología de accesibilidad de IA. Es la autora del SLAT Index Evaluation Standard.

Lectura relacionada: The Demo Is Not the Evidence: What Google DeepMind’s Sign Language AI Must Prove Next


Fuentes

Citar esto
Grizzle, H. M. (2026, August 17). AI Can Translate. But Who Translates the Risk?. Novara Consulting Group. https://www.novaracg.com/2026/08/17/ai-can-translate-but-who-translates-the-risk/

Suscríbete a Novara Consulting Group

Nuevas publicaciones, directamente en tu bandeja de entrada.

Consult