El human-in-the-loop obligatorio en cada flujo de IA se ha convertido silenciosamente en el mayor impuesto sobre el valor de la IA empresarial, y casi nadie lo está nombrando así.
No es una afirmación cauta. Es contundente, y la voy a defender. Después de 17 años dentro de grandes modelos operativos, he visto repetirse un patrón específico en aprovisionamiento, siniestros, revisión de contratos, moderación de contenido, KYC y despacho. El modelo es bueno. El modelo es, de hecho, a menudo mejor que el revisor humano mediano. Entonces se atornilla una regla de flujo que dice que cada salida, sin importar la confianza, sin importar la materialidad, debe ser firmada por una persona antes de actuar. El volumen escala. La atención del revisor no. Para el mes seis, los humanos están firmando todo automáticamente. Para el mes nueve están de baja por estrés o han pasado silenciosamente al modo "muestreo," que es la forma educada de decir que nadie lee nada. Los marcadores van a una cola que, en la práctica, es una carpeta. El rastro de auditoría es real. La auditoría no.
El despliegue no ha fracasado. Ha tenido éxito en el objetivo equivocado. Ha entregado teatro de gobernanza en lugar de valor. Y como la deuda técnica, el coste se acumula en la oscuridad. Este artículo trata sobre por qué emergió ese patrón, por qué HITL tiene las mismas propiedades acumulativas que la deuda técnica, y el movimiento de cuatro pasos para retirarlo sin perder confianza.
De Dónde Vino el Reflejo HITL
El patrón "humano en el bucle" no se inventó para la IA generativa. Vino de tres mundos más antiguos, y cada uno tenía sentido en su contexto original.
El primer mundo fue el aprendizaje automático regulado en finanzas y salud. Decisiones de crédito, adjudicación de reclamaciones, marcado diagnóstico. Allí, el regulador no solo permitió la supervisión humana, la exigió. El modelo era un recomendador, el humano era el decisor, y el rastro de auditoría era el entregable. Ese patrón funcionaba porque el volumen estaba acotado, las decisiones ya las adjudicaban humanos, y el modelo era demostrablemente menos preciso que los mejores profesionales.
El segundo mundo fue el aprendizaje automático en producción a escala de consumo. Detección de spam, reglas de fraude, sistemas de recomendación. Allí, el humano en el bucle era normalmente offline y estadístico. Revisaban muestras etiquetadas, reentrenaban el modelo y desplegaban una nueva versión. Nadie supervisaba salidas individuales en tiempo real. Eso habría colapsado la economía unitaria en una semana.
El tercer mundo fue el testing de UX en IA pre-LLM. Asistentes de voz, chatbots, clasificadores de documentos. El humano en el bucle era un bucle de aseguramiento de calidad, no una puerta de producción. Mejoraba el sistema con el tiempo. No lo bloqueaba.
Cuando llegó la IA generativa en 2023, cada presentación de consultora colapsó esas tres tradiciones en una única receta. "Mantenga siempre un humano en el bucle." Sonaba responsable. Sonaba seguro. Sonaba a la cosa natural que decir a un consejo nervioso por las alucinaciones y el riesgo reputacional. Así que se convirtió en lo predeterminado.
El problema es que la opción por defecto nunca se diseñó. Nadie preguntó, "¿qué tipo de humano, en qué tipo de bucle, con qué tipo de autoridad, sobre qué tipo de decisiones, con qué volumen, con qué tipo de señal de feedback?" La frase hizo el trabajo de una arquitectura sin ser una.
El Impuesto Sobre el Exceso de Supervisión
Aquí está la curva que cada ejecutivo necesita poder dibujar.
En el eje X, la intensidad de supervisión. En el eje Y, la productividad del sistema. La curva sube de forma pronunciada con el primer poco de supervisión, alcanza un pico temprano, y luego colapsa en una larga cola plana. Pasado el pico, cada reunión adicional de revisión, cada puerta adicional de aprobación, cada "déjame solo comprobar esto" adicional es un impuesto sobre la ganancia. No es gratis. Se paga en tres monedas, y las tres se componen.
La primera moneda es el rendimiento. Un modelo que puede revisar un contrato en 12 segundos no es más rápido que un humano si cada salida está en una cola de aprobación de 72 horas. El tiempo de ciclo del flujo se convierte en el tiempo de ciclo del humano, y la ganancia de productividad desaparece en la cola.
La segunda moneda es la carga cognitiva, y esta es la que Harvard Business Review nombró en su pieza de septiembre de 2025 sobre lo que llamó "workslop." Salidas generadas por IA que parecen terminadas pero que en secreto transfieren la carga cognitiva de vuelta al revisor. El revisor ahora tiene que leer, reconstruir el razonamiento del modelo, decidir si confía en él, y o bien firmar de forma automática o reescribir. La versión honesta de esa carga es a menudo mayor que si hubieran redactado el documento ellos mismos.
La tercera moneda es la atrofia de habilidad. La investigación sobre la Trampa de la Aumentación en MIT, trabajo de Caosun y Aral entre otros, muestra que cuando los humanos descargan cognitivamente en la IA pero luego sobre-supervisan el resultado, erosionan la propia experiencia de la que la supervisión depende. Dos años después, el equipo es más lento que antes, menos hábil que antes y más dependiente del modelo que antes. El "humano" en "humano en el bucle" ya no es el experto senior que podía detectar los casos límite del modelo. Es un junior que solo vio la salida del modelo y ahora no puede recordar cómo era lo bueno antes.
Lo que hace que este impuesto sea especialmente caro en 2026 es la segunda mitad de la imagen. El reporte METR Time Horizon de enero de 2026 muestra que la complejidad de tareas de IA se duplica aproximadamente cada tres meses. Los sistemas frontera están resolviendo ahora problemas con los que los humanos lucharon durante años. Sostenga ambos hechos al mismo tiempo. La tecnología está mejorando demostrablemente en problemas difíciles más rápido que cualquier tecnología en memoria viva. Y la mayoría de las organizaciones están gastando su presupuesto de IA haciendo que humanos relean correos generados por IA.
Eso es lo que quiero decir cuando digo que HITL es la nueva deuda técnica. No es visible en el balance. Se acumula silenciosamente. Se compone. Y cada trimestre que no la refactoriza, el coste de refactorizarla sube.
Cuándo HITL Sigue Teniendo Sentido
Quiero ser preciso sobre esto, porque el reflejo cuando alguien ataca HITL es asumir que quiere un modelo libre sin supervisión. Ese no es el argumento.
Hay un conjunto pequeño e importante de decisiones donde HITL no es solo aceptable sino obligatorio. Comparten tres propiedades.
Son genuinamente irreversibles. Enviar una transferencia bancaria. Despedir a un empleado. Emitir una declaración pública. Presentar un escrito legal. Una vez tomada la acción, no hay marcha atrás. Para estas, HITL es una característica.
Están reguladas por una autoridad externa. Decisiones de préstamo en banca. Decisiones de tratamiento en entornos clínicos. Suscripción en seguros. La mayoría de las jurisdicciones requieren explícitamente un humano nombrado responsable del resultado. Para estas, HITL es un requisito de cumplimiento.
Llevan un riesgo reputacional o de seguridad asimétrico. Cualquier cosa que pueda poner en riesgo a un cliente. Cualquier cosa que pueda poner en riesgo a un colega. Cualquier cosa donde el peor escenario sea cualitativamente peor que el mejor escenario. Para estas, HITL es un control de riesgo.
Esa es la lista. No es larga. No incluye "redacta un correo interno a mi equipo." No incluye "resume una reunión." No incluye "responde a una pregunta frecuente de un visitante de la web." No incluye "marca una cláusula contractual inusual para un revisor que no ha abierto el rastro de auditoría en seis meses." Cuando convierte HITL en la opción por defecto para todo, lo devalúa en los lugares donde realmente importa. Nadie se toma en serio la puerta cuando la puerta está en todas partes.
Cubrí la misma dinámica fundamental, enmarcada de forma distinta, en Por Qué la Mayoría de las Organizaciones Fracasan con la IA y en La Era de la Orquestación. El reflejo de supervisar todo es el mismo reflejo que produce cuarenta chatbots en Teams y cero agentes en el P&L.
Los Cuatro Antipatrones
En la práctica, cuando HITL se exige como opción por defecto, colapsa en uno de cuatro antipatrones. He visto los cuatro muchas veces. Ninguno produce la seguridad que dice producir.
Revisión de sello de goma. El volumen de salidas del modelo excede lo que cualquier humano puede revisar de forma significativa, así que los revisores aprueban todo por defecto. La firma en el rastro de auditoría dice "revisado por." La realidad es que nadie lo leyó. Este es el ejemplo del contrato de aprovisionamiento de Basilea. El rastro de auditoría parece sano. El sistema no está supervisado en nada más que el nombre.
Revisión defensiva. El revisor lee la salida pero su incentivo es rechazar cualquier cosa ambigua. ¿Por qué? Porque es responsable si algo sale mal e irrelevante si todo está bien. Los incentivos asimétricos producen comportamiento asimétrico. El resultado es que los casos límite de alto valor del modelo, los que un experto humano habría dado la bienvenida, son sistemáticamente bloqueados. El sistema regresa a la media del revisor más cauteloso.
Revisión de teatro. La revisión existe para la auditoría, el regulador o la diapositiva. El revisor lee la salida, pero el flujo no le da autoridad real para alterarla. Puede aprobar o escalar. No puede editar, redirigir o mejorar. El "bucle" está cerrado en forma y abierto en sustancia. El cliente nunca ve la diferencia.
Revisión por fatiga. El revisor empezó preocupándose. Después de seis meses de decisiones idénticas, paró. Después de doce, promediaba diez segundos por elemento. Después de dieciocho, estaba de baja. El sistema ahora depende de la peor versión de la atención humana, aplicada al mayor volumen de decisiones. Este es el antipatrón más peligroso de los cuatro porque parece que todo está funcionando hasta que de repente no lo hace.
Si su despliegue de IA tiene cualquiera de estos cuatro patrones, no tiene un humano en el bucle. Tiene un humano pegado al bucle sin función útil. El modelo lo habría hecho mejor, y posiblemente más seguro, solo.
El Modelo de Reemplazo
El reemplazo no es "quitar al humano." Ese es el espantapájaros que los defensores reflejos de HITL siempre invocan. El reemplazo es poner al humano en una posición fundamentalmente distinta respecto al bucle.
Hay cuatro patrones que he visto funcionar consistentemente. No son excluyentes. Se componen.
Human-on-the-loop. El humano no está en cada decisión. Está observando el sistema, vigilando deriva, anomalías y casos límite. Tiene autoridad para detener, reentrenar o revertir. No aprueba salidas individuales. Es dueño del comportamiento del sistema en el tiempo. Este es el mismo cambio que ocurrió en las cabinas de aviación cuando llegó el fly-by-wire. Los pilotos dejaron de volar cada entrada. Empezaron a volar el sistema que volaba las entradas. El resultado fue más seguro, no menos.
Escalado por excepción. El modelo maneja la rutina. El propio modelo clasifica su propia confianza. Por debajo de un umbral definido, la salida se escala a un humano, con contexto completo y una decisión recomendada. La mayoría de las salidas nunca ven a un humano. Las pocas que sí, ven a un humano enfocado con tiempo para revisar adecuadamente. El rendimiento se mantiene alto. La atención se mantiene aguda.
Auditoría posterior. Una muestra aleatoria estadísticamente significativa de salidas se revisa después del hecho, por un revisor senior, con el propósito explícito de encontrar fallos del modelo. La auditoría mejora el sistema. No bloquea el sistema. El cliente es servido a velocidad de máquina. La mejora ocurre en un reloj más lento.
Revisión adversaria por IA. Un segundo modelo, con una arquitectura o conjunto de entrenamiento distinto, revisa las salidas de alto riesgo del primer modelo. El desacuerdo entre los dos es la señal que escala a un humano. El acuerdo entre los dos es la señal que envía. Este es el patrón que los laboratorios frontera están usando ahora en sus propias salidas de modelo. Escala de una forma que la revisión humana no puede.
En los cuatro patrones, el humano es el arquitecto de la puerta, no la puerta misma. El rol es más senior, no menos. La compensación es más alta, no más baja. Hay menos de ellos, pero cada uno tiene una superficie de impacto mucho mayor. Esto es lo que el buen diseño organizacional siempre ha parecido, aplicado a una nueva tecnología.
Un Movimiento de Cuatro Pasos para Retirar HITL de Forma Segura
Si quiere dejar atrás un viernes como el de Basilea, aquí está la secuencia que recomiendo, en este orden, sin saltarse pasos.
Paso uno: clasifique sus decisiones, no sus flujos. Tome cada uno de sus despliegues de IA y desglóselo al nivel de decisiones individuales. Para cada decisión, marque si es genuinamente irreversible, externamente regulada o asimétricamente arriesgada. La mayoría no lo serán. Las que sí lo sean se quedan en HITL, a propósito. Todo lo demás es ahora candidato a uno de los cuatro patrones de reemplazo.
Paso dos: instrumente antes de quitar. Antes de sacar a un humano de cualquier bucle, instrumente el bucle. Registre qué estaba aprobando el humano, qué estaba rechazando y bajo qué criterios. Seis semanas de esos datos le dicen los criterios reales de toma de decisión, separados de las afirmaciones de la política. En la mayoría de los casos, los criterios son mucho más simples que la política. A veces son inexistentes. Ambos hallazgos son útiles.
Paso tres: pase al escalado por excepción como opción por defecto. Una vez instrumentado, fije el umbral de confianza del modelo deliberadamente, no por intuición. Las salidas por encima del umbral envían. Las salidas por debajo escalan, con contexto, a un humano que tiene el tiempo para revisarlas adecuadamente. Mida el volumen de escalados. Si es alto, el umbral está demasiado apretado. Si es cero, el umbral está demasiado suelto. Esta es una superficie de control. Úsela.
Paso cuatro: construya revisión adversaria para el residuo de alto riesgo. Para el pequeño número de decisiones que se quedan irreversibles, reguladas o asimétricas, use un segundo modelo con un linaje distinto para desafiar al primero. El desacuerdo escala. El acuerdo envía, con un rastro registrado de segunda opinión. El humano se convierte en el árbitro del desacuerdo, no en el revisor de cada salida. Esto es más riguroso que HITL, no menos. También es dramáticamente más escalable. La Revisión de Resistencia al Cambio le ayuda a examinar dónde la organización puede oponerse a esta transición antes de que se entere por las malas.
Si hace esos cuatro pasos en ese orden, el impuesto de supervisión colapsa, el sistema se vuelve más seguro, y los revisores humanos pasan al rol arquitectónico senior en el que deberían haber estado desde el principio.
La Pregunta Real Sobre la Mesa
Sigo volviendo a esa directora de aprovisionamiento en Basilea. Su organización no había fallado por un mal modelo. El modelo era excelente. Habían fallado porque el modelo operativo que rodeaba al modelo trataba al revisor humano como una característica de seguridad cuando, en el mes siete, el revisor humano era la fuente del riesgo.
Los modelos frontera no se están ralentizando. El impuesto sobre el exceso de supervisión no se está abaratando. Y las organizaciones que retiran HITL deliberadamente, lo reemplazan con algo más riguroso y rearquitectan el rol humano alrededor del manejo de excepciones, la auditoría y la revisión adversaria, se separarán de las que mantienen la opción por defecto en su lugar por costumbre.
Así que aquí está la pregunta que pondría al próximo equipo ejecutivo que me pregunte cómo escalar IA de forma segura.
Para cada paso de su flujo de IA donde un humano está aprobando actualmente una salida, ¿están realmente haciendo trabajo, o solo están absorbiendo responsabilidad?
La respuesta honesta a esa pregunta es también la respuesta a si su organización estará en el 5% o en el 95%.