Las afirmaciones y las mediciones que se necesitarían para respaldarlas
El argumento comercial estándar para la inteligencia artificial en recursos humanos se ha estabilizado en torno a cinco afirmaciones: contratación más rápida y mejor, menor costo administrativo, planificación predictiva de la fuerza laboral, mejor retención y cumplimiento normativo automatizado. Estas afirmaciones se repiten con suficiente consistencia en los materiales de los proveedores, la programación de conferencias y los comentarios profesionales que ahora funcionan como una suposición de fondo en lugar de como proposiciones que requieren evidencia.
Requieren evidencia, y el obstáculo para producirla no es la tecnología. Recursos humanos entró en este período con la infraestructura de medición más débil de cualquier función corporativa importante. Finanzas cuenta con estados auditados. Operaciones tiene tasas de rendimiento y de defectos. Recursos humanos cuenta con un conjunto de métricas que están definidas de manera variable, rara vez validadas, pocas veces establecidas como línea base antes de una intervención y con frecuencia producidas por el mismo proveedor cuyo producto se está evaluando. Una organización que no pudo medir el desempeño de su proceso de contratación antes de implementar una herramienta automatizada no puede medir la mejora después, y lo que reporta como retorno es generalmente la diferencia entre dos números que nunca fueron comparables.
La posición de Novara Consulting Group es que el problema central de los argumentos comerciales de inteligencia artificial en recursos humanos no es que los retornos estén ausentes. Algunos son reales, y se describen a continuación. El problema es que los retornos se afirman con un nivel de precisión que la medición subyacente no puede sostener, mientras que los costos que los compensarían se excluyen por completo del modelo. Un cálculo construido de esa manera no es un análisis de inversión. Es un documento de promoción con un símbolo de moneda incluido.
Es un documento de promoción con un símbolo de moneda incluido.
Lo que realmente se puede medir, y cuánto vale
Las cinco afirmaciones estándar se dividen claramente en dos categorías, y esa separación es más instructiva que las propias afirmaciones.
La primera categoría contiene efectos que son genuinamente medibles y comparativamente modestos. El tiempo de ciclo en la contratación es medible, tiene una línea base establecida en la mayoría de los sistemas de seguimiento de candidatos, y sí responde a la automatización de la programación, el filtrado y la correspondencia. El costo administrativo por transacción en nómina y administración de beneficios es medible, y también lo son las tasas de error en esos procesos. Las organizaciones que automatizan estas funciones generalmente logran ahorros, y esos ahorros pueden sustentarse.
Dos matices importan. El primero es que la mayoría de los ahorros documentados en nómina y administración de beneficios provienen de la automatización de flujos de trabajo y del procesamiento basado en reglas, tecnologías que preceden por décadas a la generación actual de inteligencia artificial y que con frecuencia se reetiquetan como IA en el posicionamiento de los proveedores y en los argumentos comerciales construidos sobre esa base. Atribuir ahorros de una automatización de procesos ya establecida a una compra reciente de IA infla el retorno medido de esa compra y, de manera más consecuente, atribuye erróneamente el mecanismo causal, lo que significa que la organización aprende la lección equivocada sobre qué produjo el beneficio. El segundo matiz es que estos ahorros son, en términos absolutos, poco espectaculares. No justifican por sí solos los compromisos empresariales que se están asumiendo ahora.
La segunda categoría contiene efectos que serían sustanciales si fueran reales y que actualmente no se pueden medir: mejor calidad de contratación, mejor retención y mejor planificación de la fuerza laboral. Estas son las afirmaciones que sostienen el argumento comercial, y lo sostienen precisamente porque su magnitud no está restringida por la medición.
La calidad de contratación no es una métrica
La calidad de contratación es la afirmación que carga el peso en casi todos los argumentos comerciales de tecnología de reclutamiento, y no cuenta con una definición común validada. Según la organización, se operacionaliza como calificación de desempeño en el primer año, retención a noventa días, retención a doce meses, satisfacción del gerente de contratación, tiempo hasta la productividad, o un compuesto de varios de estos, cada uno con propiedades de medición diferentes y ninguno con validez de constructo establecida como medida de la eficacia de la contratación.
La consecuencia es que cualquier mejora afirmada en la calidad de contratación es en gran medida un artefacto de la elección definitoria. Una organización que define la calidad de contratación como retención a noventa días y despliega una herramienta que filtra candidatos parecidos a empleados anteriores de larga permanencia observará una mejora. No ha aprendido que la contratación mejoró. Ha aprendido que un sistema optimizado para un indicador sustituto movió ese indicador sustituto. Cuando el proveedor suministra tanto la herramienta como el marco de medición, algo común, el hallazgo se acerca más a una tautología que a una evidencia.
Esto importa mucho más allá de la higiene metodológica. Según las Directrices Uniformes sobre Procedimientos de Selección de Empleados (Uniform Guidelines on Employee Selection Procedures) en 29 C.F.R. Parte 1607, se espera que un empleador cuyo proceso de selección muestre un impacto adverso produzca evidencia de que el procedimiento es válido para el puesto. La validación relacionada con el criterio requiere una medida defendible del desempeño laboral. Una organización que no puede decir con precisión qué significa la calidad de contratación para sus propios puestos, y que no puede demostrar que su medida de criterio es en sí misma imparcial, no cuenta con la evidencia que el marco contempla. La debilidad de medición que infla el argumento comercial es la misma debilidad que socava la defensa legal, lo cual es un caso inusual en el que un problema metodológico y un problema de responsabilidad legal son el mismo problema.
La predicción de la rotación y la brecha de precisión
La planificación predictiva de la fuerza laboral merece un tratamiento aparte, porque aquí es donde la distancia entre el rendimiento publicado y el rendimiento real en el despliegue es más amplia y la exposición legal es menos comprendida.
La literatura académica sobre la predicción de la rotación de empleados reporta habitualmente cifras de precisión superiores al noventa por ciento. Esas cifras se generan abrumadoramente a partir de un pequeño número de conjuntos de datos de referencia, principalmente el conjunto IBM HR Analytics de aproximadamente 1,470 registros y un conjunto de recursos humanos de Kaggle ampliamente difundido de aproximadamente 15,000 registros, y típicamente después de un balanceo sintético de clases mediante técnicas de sobremuestreo como SMOTE (Synthetic Minority Over-sampling Technique). Estas son elecciones metodológicas legítimas para comparar algoritmos entre sí. No son estimaciones del desempeño real en campo sobre la propia fuerza laboral de un empleador, y nunca deberían aparecer en un argumento comercial como si lo fueran. La evaluación práctica de los profesionales sobre la precisión realista en campo de los modelos de riesgo de fuga es considerablemente más baja, en el rango del setenta al ochenta por ciento, y los analistas del sector han expresado un escepticismo sostenido hacia las afirmaciones de los proveedores por encima del noventa por ciento.
La brecha entre el ochenta por ciento y cifras superiores al noventa por ciento no es una diferencia de redondeo en esta aplicación, porque la tasa base es baja. La rotación voluntaria en la mayoría de las organizaciones está muy por debajo del veinte por ciento anual, lo que significa que un modelo con una precisión general aparentemente fuerte puede seguir produciendo falsos positivos que superan sustancialmente a los verdaderos positivos. En un modelo de rotación, un falso positivo es un empleado identificado incorrectamente como propenso a irse.
La cuestión de gobernanza surge de inmediato, y el enfoque de retorno de inversión la oscurece. ¿Qué hace la organización con ese nombre? Si la respuesta es nada, el modelo no ha producido ningún retorno. Si la respuesta es cualquier cosa, ya sean ofertas diferenciales de retención, inversión alterada en desarrollo, exclusión de asignaciones a largo plazo o consideración cambiada de sucesión, entonces la organización ha tomado una decisión de empleo diferencial sobre un individuo con base en una predicción. Eso es una acción de empleo, y su legalidad depende de qué impulsó la puntuación. Las guías para construir estos modelos habitualmente recomiendan incluir datos demográficos del empleado, con la edad y la antigüedad mencionadas entre las variables que dan contexto al modelo. Un empleador que introduce la edad en un modelo, usa el resultado para asignar inversión en desarrollo y no puede reconstruir por qué un empleado en particular fue puntuado de esa manera ha creado una exposición bajo la Ley de Discriminación por Edad en el Empleo (Age Discrimination in Employment Act) y la ha registrado en el balance como un beneficio.
El cumplimiento automatizado no descarga la obligación de cumplimiento
La afirmación de que la inteligencia artificial garantiza el cumplimiento de la legislación laboral y de las políticas internas debería eliminarse por completo de los argumentos comerciales, y no porque las herramientas sean inútiles. Los sistemas de monitoreo que señalan descansos omitidos, umbrales de horas extra, anomalías de clasificación o errores en la administración de licencias pueden ser genuinamente valiosos, y el argumento operativo a su favor es razonable.
La palabra que falla es garantiza. Un sistema de monitoreo no descarga una obligación legal; produce resultados que el empleador luego posee. Si el sistema señala una posible infracción y nadie actúa, la organización ha creado un registro interno fechado que establece notificación previa, lo cual es materialmente peor que no haber monitoreado. Si el sistema no señala una infracción que ocurrió, el empleador no ha adquirido ninguna defensa, porque depender de una herramienta de un proveedor no es una excusa reconocida para el incumplimiento bajo la Ley de Normas Laborales Justas (Fair Labor Standards Act) o los estatutos que hace cumplir la Comisión para la Igualdad de Oportunidades en el Empleo (Equal Employment Opportunity Commission, EEOC). Si las determinaciones del sistema son erróneas de manera sistemática, el empleador ha automatizado el error y lo ha escalado.
Los sucesos de enero de 2025 empeoran esto en lugar de mejorarlo. Cuando la EEOC retiró de su sitio web su orientación sobre inteligencia artificial, incluida la asistencia técnica de mayo de 2022 sobre la Ley de Estadounidenses con Discapacidades (Americans with Disabilities Act) y la asistencia técnica de mayo de 2023 sobre el Título VII, los empleadores perdieron el material interpretativo que les indicaba qué prácticas consideraba problemáticas la agencia. Los estatutos no cambiaron. Una herramienta de cumplimiento configurada conforme a una orientación que desde entonces ha sido retirada ahora opera sin un estándar de referencia declarado, y el empleador, no el proveedor, carga con esa brecha.
La automatización del cumplimiento, por lo tanto, añade una obligación de documentación y respuesta en lugar de eliminarla. Esa obligación tiene un costo, el costo es real, y pertenece al lado de los costos del modelo.
Los costos que el modelo omite
La mayoría de los argumentos comerciales de IA en recursos humanos contienen un lado de costos compuesto por tarifas de licencia, servicios de implementación y alguna asignación para capacitación. Ese es el costo de adquisición del software. No es el costo de operar un sistema automatizado de decisiones de empleo, que además incluye, como mínimo, lo siguiente.
Trabajo de validación, es decir, el análisis que establece que lo que puntúa cada sistema corresponde a un requisito documentado del puesto, junto con la revalidación requerida cuando el sistema o el puesto cambian. Operación de la vía de adaptación, es decir, la capacidad permanente de proporcionar una evaluación alternativa a solicitud, con responsables de decisión designados, un plazo de respuesta definido y un proceso interactivo funcional en lugar de un formulario. Capacidad de retención y reproducción de registros, es decir, la capacidad de producir la puntuación, las variables de entrada y la configuración del sistema vigente para cualquier decisión individual durante todo el período de conservación contemplado por 29 C.F.R. Parte 1602. Monitoreo, es decir, pruebas periódicas de los resultados en lugar de depender de un resumen del proveedor. Cooperación del proveedor en procesos de descubrimiento e investigaciones administrativas, lo cual es costoso, está ausente de los términos comerciales estándar a menos que se negocie, y se cobra al empleador cuando se necesita. Y la propia función de gobernanza interna, es decir, la persona identificada responsable de lo anterior, que en la mayoría de las organizaciones actualmente no existe y debe crearse o contratarse.
Junto a estos costos operativos hay un pasivo contingente que prácticamente ningún argumento comercial calcula, y ya no es hipotético. En agosto de 2023 la EEOC llegó a un acuerdo con iTutorGroup por $365,000 por un software configurado para rechazar a solicitantes por encima de ciertas edades, lo cual es una cifra concreta para una decisión de configuración simple. En julio de 2024 el Distrito Norte de California permitió que avanzaran reclamos contra un proveedor de software de filtrado bajo la teoría de que el proveedor actuó como agente de los empleadores que usaban sus herramientas, lo cual desestabiliza la suposición común de que la responsabilidad recae por completo en el empleador o en el proveedor y puede asignarse limpiamente por contrato. En marzo de 2025 la Unión Estadounidense por las Libertades Civiles (American Civil Liberties Union, ACLU), la ACLU de Colorado, Public Justice y Eisenberg and Baum presentaron una queja ante la División de Derechos Civiles de Colorado y la EEOC en nombre de un empleado Deaf e indígena en relación con una entrevista automatizada por video y una adaptación de subtitulado denegada, un asunto que ambas empresas niegan. Ese reclamo es individualizado, no requiere estadísticas comparativas y es económico de presentar.
El tratamiento correcto no es adivinar una cifra de acuerdo. Es declarar explícitamente la exposición, señalar que los reclamos de práctica sistémica frecuentemente quedan fuera de la cobertura de las pólizas estándar de responsabilidad por prácticas de empleo, y exigir que los controles de gobernanza que reducen la exposición se financien como parte del despliegue en lugar de posponerse.
Una organización que añada estas líneas frecuentemente encontrará que la inversión sigue teniendo sentido. Ese es un buen resultado y no es el punto. El punto es que el número resultante puede defenderse ante una junta directiva, un auditor y eventualmente un tribunal, algo que el número actual no puede hacer.
Una estructura defendible
Lo siguiente produce un argumento comercial que resiste el escrutinio y que puede ser construido por una función existente de recursos humanos y finanzas.
- Establecer la línea base antes del despliegue, no después: tiempo de ciclo, costo por contratación, costo administrativo por transacción, tasas de error y rotación por segmento, cada uno medido durante al menos cuatro trimestres previos.
- Separar los ahorros de automatización de los ahorros de IA. Declarar qué beneficios afirmados provienen del procesamiento de flujos de trabajo basado en reglas que estaría disponible sin la compra de IA, y calcular el precio de esos por separado.
- Definir explícitamente la calidad de contratación para los propios puestos antes de medir cualquier cambio en ella, declarar la medida de criterio y declarar sus limitaciones. Si no se puede definir, no afirmar una mejora en ella.
- Rechazar las cifras de precisión derivadas de datos de referencia para cualquier modelo predictivo. Exigir el rendimiento real en campo sobre los propios datos de la organización, con la tasa base declarada y el volumen de falsos positivos expresado en número de empleados en lugar de en porcentaje.
- Para cualquier modelo que produzca puntuaciones a nivel individual, documentar qué acción se deriva de la puntuación antes del despliegue, y hacer que esa acción se revise como una decisión de empleo en lugar de como un resultado analítico.
- Calcular el precio de las obligaciones operativas mencionadas anteriormente como un costo recurrente, no como una implementación única.
- Declarar el pasivo contingente como una partida revelada junto con los controles que lo reducen, se le asigne o no una cifra en dólares.
- Exigir evidencia de validación, datos de desempeño en campo y capacidad de reproducción como condiciones contractuales en el momento de la adquisición. Conservar cualquier negativa, la cual es en sí misma información sobre lo que la organización sabe.
Conclusión
Existe un caso de negocio real para la inteligencia artificial en recursos humanos, y es más modesto y más defendible que el que circula actualmente. Se basa en el tiempo de ciclo, el costo de transacción y la reducción de errores en los procesos administrativos, todo lo cual puede sustentarse. No se basa en la calidad de contratación, la retención ni en afirmaciones de precisión predictiva que la práctica de medición de la función no puede respaldar y que conllevan una responsabilidad que el modelo no cotiza.
Las organizaciones que reportarán un retorno duradero de estos sistemas no son las que los adoptaron primero ni las que más compraron. Son las que midieron antes de implementar, las que pueden decir qué puntúa cada sistema y por qué eso importa para el puesto, y las que trataron el aparato de gobernanza como parte del costo de propiedad y no como un gasto que evitar. Un retorno que depende de un beneficio no medido y un riesgo no cotizado no es retorno. Es un pronóstico, y la diferencia se hace evidente en el momento en que alguien pide ver el trabajo detrás.
Referencias
- American Civil Liberties Union, ACLU de Colorado, Public Justice, y Eisenberg & Baum LLP. Demanda presentada ante la División de Derechos Civiles de Colorado y la Comisión para la Igualdad de Oportunidades en el Empleo de EE. UU., 19 de marzo de 2025.
- EEOC v. iTutorGroup, Inc., No. 1:22-cv-02565 (E.D.N.Y.), decreto de conciliación, agosto de 2023.
- Mobley v. Workday, Inc., No. 3:23-cv-00770 (N.D. Cal.), resolución sobre moción de desestimación, julio de 2024.
- Society for Human Resource Management. «The Dangers of Using Predictive Analytics to Gauge Employee Flight Risk». 2023.
- U.S. Equal Employment Opportunity Commission. The Americans with Disabilities Act and the Use of Software, Algorithms, and Artificial Intelligence to Assess Job Applicants and Employees, EEOC-NVTA-2022-2, 12 de mayo de 2022, y Select Issues: Assessing Adverse Impact in Software, Algorithms, and Artificial Intelligence Used in Employment Selection Procedures Under Title VII, 18 de mayo de 2023. Ambos retirados del sitio web de la agencia el 27 de enero de 2025.
- Uniform Guidelines on Employee Selection Procedures, 29 C.F.R. Parte 1607; requisitos de mantenimiento de registros, 29 C.F.R. Parte 1602.

