Skip to content
Ir directamente al texto

Comercio Agéntico

Acusado por Perplexity: la detección de IA como sistema de decisión automatizada sin validar en la educación de posgrado

Descargar PDF

El consejo que todos dan está equivocado respecto al mecanismo

La orientación habitual que se da a los estudiantes de posgrado sobre la inteligencia artificial es, más o menos, la siguiente: úsala como herramienta y no como sustituto, piensa por ti mismo, y entiende que el profesorado es perceptivo y con el tiempo notará un trabajo que carece de profundidad. Las dos primeras afirmaciones son acertadas. La tercera es falsa, y su falsedad importa, porque describe un proceso de juicio humano que en gran medida ha sido reemplazado.

La mayoría de las instituciones no detectan el uso de inteligencia artificial mediante el criterio de lectores experimentados. Lo detectan, o creen detectarlo, mediante clasificadores automatizados integrados en las plataformas de entrega de trabajos, que asignan una puntuación de probabilidad a un documento y la remiten a un proceso de integridad académica. La pregunta que enfrenta una estudiante de posgrado no es, por tanto, si un profesor notará un pensamiento superficial. Es si un clasificador estadístico marcará su escrito, y qué le ocurrirá si eso sucede.

La posición de Novara Consulting Group es que la detección de IA en la educación superior es un sistema de decisión automatizado que produce decisiones con consecuencias reales para las personas, que se despliega con menos validación de la que las instituciones exigen a casi cualquier otro instrumento que afecte la situación académica de un estudiante, y que su distribución de errores recae con mayor peso sobre los escritores multilingües y con discapacidad. El problema de gobernanza es institucional. Las consecuencias son individuales.

Lo que mide el detector

Un detector de escritura por IA no identifica la autoría. Estima cuán estadísticamente inusual es un texto, principalmente mediante la perplejidad, que mide cuán predecible es cada palabra dado el texto que la precede, y la variabilidad (burstiness), que mide la variación en la estructura y longitud de las oraciones a lo largo de un documento. Un texto altamente predecible y estructuralmente uniforme recibe una puntuación que indica mayor probabilidad de haber sido generado por una máquina.

Ese es todo el mecanismo, y exponerlo con claridad hace visible el problema. El detector no está midiendo si una persona escribió algo. Está midiendo si la escritura es inusual, y tratando esa inusualidad como evidencia de humanidad. Un escrito cuidadoso, sencillo, estructuralmente consistente y léxicamente conservador recibe una puntuación de tipo maquinal, porque eso es precisamente lo que el modelo utiliza como sustituto de lo maquinal.

Esto produce una población específica y predecible de acusaciones falsas, y no es una población aleatoria.

Las tasas de error, y quién las soporta

Una investigación publicada en Patterns en julio de 2023 por Liang y colegas de Stanford encontró que los detectores marcaron aproximadamente el sesenta y uno por ciento de los ensayos de TOEFL escritos por hablantes no nativos de inglés como generados por IA, frente a tasas de falsos positivos cercanas a cero para escritos comparables de hablantes nativos de inglés, en los siete detectores evaluados. Se trataba de ensayos escritos por seres humanos que habían presentado un examen estandarizado para demostrar competencia en inglés. Los autores identificaron el mecanismo directamente: los detectores se basaban en la perplejidad del texto, y escribir en una segunda lengua produce una perplejidad más baja.

Las pruebas independientes han fracasado reiteradamente en respaldar las afirmaciones de precisión de los proveedores. Weber-Wulff y colegas, publicando en el International Journal for Educational Integrity en diciembre de 2023, evaluaron una variedad de herramientas de detección en múltiples tipos de documentos y concluyeron que no eran ni precisas ni fiables. Los proveedores, por su parte, generalmente se niegan a publicar una tasa de falsos positivos para sus productos, lo que significa que una institución que adopte uno no puede indicar la tasa de error de un instrumento que está utilizando en procedimientos disciplinarios.

Las instituciones han comenzado a actuar al respecto. Vanderbilt University desactivó la función de detección de IA de Turnitin en agosto de 2023, publicando el cálculo que hizo sencilla la decisión: una tasa de falsos positivos del uno por ciento aplicada a setenta y cinco mil trabajos entregados produce aproximadamente setecientas cincuenta acusaciones erróneas al año. Otras instituciones han seguido este ejemplo, y la orientación de las directrices universitarias publicadas desde entonces se ha inclinado hacia tratar la puntuación de un detector como un motivo para indagar, y no como un hallazgo concluyente.

Un hecho adicional del mercado merece formar parte de cualquier evaluación institucional. Varios proveedores que comercializan herramientas de detección también comercializan productos «humanizadores» diseñados para burlar la detección, incluida la de sus propias herramientas. En cualquier otro contexto de garantía de calidad, un proveedor que vende tanto la prueba como el medio para superarla quedaría descalificado para suministrar cualquiera de las dos.

En cualquier otro contexto de garantía de calidad, un proveedor que vende tanto la prueba como el medio para superarla quedaría descalificado para suministrar cualquiera de las dos.

La población a la que esto afecta, y por qué es la equivocada

La disparidad documentada afecta a los escritores no nativos de inglés, y la explicación es mecánica más que misteriosa. La detección basada en perplejidad penaliza el vocabulario más simple y la construcción gramatical más regular. Un escritor que trabaja en una segunda lengua produce exactamente ese perfil, no porque el texto haya sido generado por una máquina, sino porque construir un fraseo inusual en una segunda lengua es más difícil que construir un fraseo correcto.

El mismo mecanismo afecta a una población que casi no ha recibido atención, y es precisamente aquella que esta firma existe para considerar.

Una persona Sorda cuya primera lengua es ASL está escribiendo en inglés como segunda lengua, y el conservadurismo sintáctico que se deriva de ello es exactamente lo que el detector puntúa como maquinal. Una estudiante con dislexia que utiliza predicción de texto, asistencia gramatical o apoyo estructurado para la escritura —todas ellas adaptaciones ordinarias y a menudo formalmente aprobadas— produce un texto que ha sido regularizado por la herramienta de asistencia. Un estudiante con una discapacidad motriz que redacta mediante voz a texto produce un texto moldeado por el propio modelo lingüístico del software de dictado. Un estudiante que utiliza asistencia de traducción produce un resultado que lleva la firma estadística del sistema de traducción.

En cada caso, la adaptación es lo que provoca la alerta. La estudiante que utiliza el apoyo aprobado por su institución tiene más probabilidades de ser acusada que la estudiante que no lo necesitó, y la acusación llega acompañada de un número, sin explicación alguna sobre lo que ese número mide. Después se le exige demostrar que escribió su propio trabajo, lo cual es exigir una prueba negativa, precisamente a la persona menos capacitada para satisfacerla.

Una institución que ha aprobado una adaptación de tecnología asistiva y, al mismo tiempo, utiliza un detector que penaliza su resultado ha incorporado una contradicción en su propio proceso disciplinario. Es poco probable que se haya percatado de ello, porque la oficina de servicios para personas con discapacidad y la oficina de integridad académica no suelen revisar los instrumentos de la otra. Las instituciones postsecundarias tienen obligaciones bajo la Ley para Personas con Discapacidad (Americans with Disabilities Act) y la Sección 504 de la Ley de Rehabilitación de proporcionar ajustes académicos y de evitar prácticas que excluyan a estudiantes con discapacidad. Una práctica de detección que marca sistemáticamente los productos de adaptaciones aprobadas se sitúa en tensión incómoda con ambas.

El estándar probatorio es más bajo que el de cualquier cosa comparable

Considérese lo que una institución exigiría antes de actuar a partir de cualquier otro instrumento automatizado que afecte la situación académica de un estudiante.

Un examen de admisión necesitaría evidencia publicada de validez, fiabilidad establecida, rendimiento documentado en distintos grupos demográficos y un punto de corte defendible. Una herramienta de supervisión de exámenes que active una remisión por integridad requeriría, como mínimo, que la grabación pudiera revisarse. Una determinación de discapacidad requeriría documentación y un responsable de decisión identificado. Se entendería, por lo general, que una institución que toma una decisión con consecuencias basándose en una puntuación numérica no explicada, producida por un instrumento cuya tasa de error el proveedor se niega a revelar, ha actuado de manera arbitraria.

Las puntuaciones de detección de IA se tratan de manera diferente, y la razón parece ser de género antes que de principio. Llegan integradas en una herramienta antiplagio en la que las instituciones ya confían, se parecen al índice de similitud junto al que aparecen, y fueron adoptadas mediante un proceso de contratación en lugar de mediante gobernanza académica. El índice de similitud al menos señala un documento fuente que el estudiante puede inspeccionar y refutar. La puntuación de IA no señala nada. No hay fuente, ni pasaje, ni comparación, ni mecanismo alguno mediante el cual el estudiante pueda examinar el fundamento de la acusación.

La mejor práctica institucional trata el resultado de un detector como un filtro de clasificación y no como evidencia: un motivo para iniciar una conversación en la que la estudiante explique su argumento, recorra su proceso de redacción y comente sus fuentes. Esa es la postura correcta, y vale la pena notar lo que ello concede. Si el resultado del detector es solo una razón para mirar con más atención, y es esa mirada la que en realidad determina el resultado, entonces el detector es un mecanismo para decidir qué estudiantes son investigados. Dada la distribución de errores descrita anteriormente, es un mecanismo para decidir que los estudiantes multilingües y con discapacidad sean investigados con más frecuencia.

Lo que un estudiante de posgrado debería realmente hacer

El consejo útil no es esforzarse más por sonar humano, algo tan denigrante como inalcanzable. Es conservar el registro, por la misma razón por la que cualquier institución que enfrente una determinación automatizada no explicada debería conservar el registro: la acusación es infalsable sin evidencia de proceso, y la evidencia de proceso debe crearse antes de que sea necesaria.

Redacta en un entorno que conserve el historial de versiones, y no lo desactives. Un documento con un historial de revisiones de dos meses es concluyente de una manera que ningún argumento sobre el estilo de escritura podrá igualar jamás. Conserva notas de investigación, fuentes anotadas y esquemas, y ponles fecha. Cuando se utilice una herramienta de asistencia o apoyo lingüístico, decláralo con antelación conforme a la política establecida del curso, en lugar de hacerlo después de recibir una alerta, porque la divulgación previa convierte una defensa en un registro. Cuando una adaptación implique apoyo a la escritura, asegúrate de que la oficina de servicios para personas con discapacidad la haya documentado, y entiende que esa documentación es ahora también documentación de integridad. Y ten la capacidad de explicar el argumento en voz alta, no porque la percepción de un profesor sea la salvaguarda, sino porque es en la conversación estructurada donde estos asuntos realmente se resuelven.

Nada de esto tiene que ver con el engaño. Es lo que cualquier persona debería hacer cuando un sistema que no puede ser inspeccionado puede formular una afirmación sobre ella que se le pedirá que refute.

Lo que una institución debería establecer

Cuatro preguntas que una oficina de integridad académica debería poder responder antes de que el resultado de un detector llegue a un estudiante.

  1. ¿Cuál es la tasa de falsos positivos del instrumento, en qué población, y quién la estableció? Si el proveedor se niega a indicarla, ese es el hallazgo, y debería registrarse como tal en lugar de tratarse como una ausencia de información.
  2. ¿Cuál es el rendimiento desagregado en las poblaciones a las que sirve la institución, incluidos los estudiantes multilingües, los estudiantes internacionales y los estudiantes que utilizan tecnología asistiva aprobada? Una institución que atiende a estas poblaciones y no puede responder no ha evaluado la herramienta para su propio contexto.
  3. ¿Qué peso probatorio se asigna al resultado, expresado por escrito, y depende de él algún hallazgo adverso? Si una puntuación por sí sola puede iniciar un procedimiento, la institución ha adoptado un instrumento sin validar como desencadenante de una medida disciplinaria.
  4. ¿Quién revisa la interacción entre las adaptaciones aprobadas y los resultados de detección? Si nadie lo hace, la institución debería asumir que la interacción es adversa, porque el mecanismo lo garantiza.

Conclusión

El consejo de que los estudiantes de posgrado deben pensar por sí mismos, defender sus propias ideas y desarrollar conocimiento especializado en lugar de atajos es correcto, y lo sería en cualquier época. Sin embargo, no responde al riesgo que los estudiantes realmente enfrentan, que no es que se les considere superficiales, sino que un clasificador que mide la inusualidad estadística los marque y se les pida demostrar una negativa.

Ese riesgo se distribuye de manera desigual, y su distribución es lo contrario de lo que la política de integridad debería producir. Los estudiantes con mayor probabilidad de ser acusados injustamente son quienes escriben en una segunda lengua, quienes se comunican mediante lengua de señas como primera lengua, y quienes utilizan las adaptaciones que sus instituciones aprobaron formalmente. Se les investiga con mayor frecuencia no porque sean más propensos a hacer trampa, sino porque un indicador sustitutivo de la escritura maquinal resulta ser, en realidad, un indicador de la escritura bajo restricción.

Las instituciones no eligieron este resultado. Lo adquirieron, mediante una decisión de contratación tomada sin evidencia de validación, y seguirán produciéndolo hasta que alguien formule las preguntas que deberían haberse formulado antes de su despliegue.

Referencias

Liang, Weixin, Mert Yuksekgonul, Yining Mao, Eric Wu y James Zou. “GPT Detectors Are Biased Against Non-Native English Writers.” Patterns 4, n.º 7 (julio de 2023).

Weber-Wulff, Debora, et al. “Testing of Detection Tools for AI-Generated Text.” International Journal for Educational Integrity 19 (diciembre de 2023).

Centro de Enseñanza de la Universidad de Vanderbilt, declaración sobre la desactivación de la función de detección de IA de Turnitin, agosto de 2023.

Ley para Estadounidenses con Discapacidades de 1990 y Sección 504 de la Ley de Rehabilitación de 1973, según se aplican a las instituciones postsecundarias y los ajustes académicos.

Suscríbete a Novara Consulting Group

Nuevas publicaciones, directamente en tu bandeja de entrada.

Consult