El control que se evapora cuando la máquina funciona bien
El martes conté en la newsletter que quien dirige un equipo ya dirige binomios de una persona y uno o varios agentes trabajando juntos. Hacia el final metí un párrafo con tres palabras: observabilidad, predictibilidad y dirigibilidad. Dije de pasada que se publicaron en 2014. Ese párrafo era una puerta entornada y hoy la cruzo, porque detrás hay mucho más que una fecha llamativa.
Detrás de esa puerta existe una disciplina entera. El problema de dirigir a una persona que trabaja con una máquina autónoma lleva décadas estudiado con otro nombre, en la «ingeniería de factores humanos», con revisiones de literatura publicadas y muchos experimentos hechos. De esa literatura salen tres cosas que el discurso de este año sobre liderazgo e inteligencia artificial no recoge por ninguna parte. Una es de 2014, otra de 2010 y la tercera se publicó hace siete meses.
Las tres tienen consecuencias prácticas para quien tiene que gobernar agentes en una organización real.
Quién depende de quién
En 2014, un equipo de investigadores encabezado por Matthew Johnson publicó en el Journal of Human-Robot Interaction un artículo titulado «Coactive Design: Designing Support for Interdependence in Joint Activity«. Lo escribieron con un objetivo declarado que hoy suena a titular de esta semana: querían que los robots dejaran de comportarse como herramientas teleoperadas o autómatas independientes y empezaran a hacerlo como compañeros de equipo interdependientes. El principio que formularon cabe en una línea: la interdependencia debe dar forma a la autonomía.
Merece hablar más sobre ello porque parece una obviedad académica y no lo es. Lo que dice ese principio es que la cantidad de autonomía que le das a una máquina no se decide mirando a la máquina. Se decide mirando a quién depende de ella: quién se queda parado si no entrega, quién tiene que enterarse de que ha entregado algo raro y en cuánto tiempo. La capacidad técnica del sistema entra en la cuenta bastante después.
En 2026 la decisión se toma al revés. Se delega lo que el agente es capaz de hacer. Sale un modelo nuevo, alguien comprueba en una prueba de concepto que resuelve la tarea, y la tarea pasa a ser suya. La pregunta que se hace en la sala es «¿esto lo sabe hacer?», cuando la pregunta de 2014 era «¿quién se queda colgado si esto falla y cuánto tarda en darse cuenta?». Son dos conversaciones distintas. Solo la segunda deja por escrito quién sufre el fallo cuando llegue.
De ese principio salen los tres requisitos que cité el martes. Observabilidad, que cada parte haga visible su estado y lo que va sabiendo de la tarea. Predictibilidad, que se pueda anticipar de forma razonable qué va a hacer la otra parte. Dirigibilidad, que se pueda influir en su conducta mientras actúa, redirigirla o detenerla. Los tres se resuelven cuando se diseña el despliegue. Si aparecen después del primer susto, llegan tarde y encima llegan como problemas.
Cuando todavía eran robots
El diseño coactivo no está solo. Pertenece a un campo con nombre propio, el human-autonomy teaming, que estudia equipos en los que uno o varios miembros no son personas. Viene de la aviación, de la defensa y del control de procesos industriales, sitios donde el coste de equivocarse con una máquina autónoma se conocía mucho antes de que existiera el primer agente conversacional.
En 2022, O’Neill, McNeese, Barron y Schelble publicaron en Human Factors una revisión y análisis de la literatura empírica del campo. Lo más importante es anbalizar la lista de variables que aparecen cuando se mide de verdad qué mueve el rendimiento de un equipo mixto: las características del agente, la composición del equipo, las características de la tarea, las diferencias individuales de las personas, la formación y la comunicación. La capacidad del agente es una de seis. Comparte tabla con asuntos que se parecen bastante a un plan de gestión de personas.
Hay un detalle de esa revisión que me parece el más elocuente de todo el artículo. La mayor parte de la literatura estudia equipos de una persona y un agente, con la persona ejerciendo de líder. Es decir, el campo se pasó años midiendo justo la unidad de la que ahora hablamos como si acabara de inventarse. Cuando Microsoft describe en su Work Trend Index 2026 la figura del agent boss, la de quien dirige a uno o varios agentes, le está poniendo nombre de oficio a la configuración experimental favorita de una rama de la ingeniería que llevaba años midiéndola.
No lo cuento para repartir medallas académicas. Tiene una consecuencia práctica: hay resultados publicados y revisados sobre cómo se comporta un binomio, y no hace falta descubrirlos otra vez a base de incidentes propios. El más incómodo viene ahora.
El vigilante que deja de mirar
En 2010, Raja Parasuraman y Dietrich Manzey publicaron en Human Factors una integración de décadas de investigación sobre dos fenómenos con nombre técnico: la complacencia y el sesgo de automatización. Voy a citar lo que dicen, sin estirarlo, porque es de esos hallazgos a los que apetece sacarles punta.
La complacencia aparece cuando el operador tiene varias tareas a la vez y las tareas manuales compiten por su atención. Nada que ver con la desidia del que vigila. Le ocurre a cualquiera que sostiene carga de trabajo mientras supervisa un sistema que casi siempre acierta: la atención se reasigna sola hacia lo que parece necesitarla más. Dos detalles de ese trabajo deberían estar en cualquier comité que apruebe un despliegue de agentes. El primero nos dice que se da igual en participantes novatos y en expertos. El segundo es que no se supera con simple práctica, así que la idea de que el analista veterano está vacunado no se sostiene con los datos delante.
El sesgo de automatización es el hermano de al lado. Cuando la ayuda a la decisión es imperfecta, produce errores por omisión, lo que la máquina no señaló y la persona tampoco miró, y errores por comisión, lo que la máquina propuso y la persona ejecutó aun teniendo delante información que lo contradecía. Los autores señalan que no se previene con formación ni con instrucciones. Avisar a la gente de que el sistema falla a veces no arregla el problema.
Si trabajas en un centro de operaciones de seguridad, acabas de leer la descripción de tu turno. Un analista con cola de alertas, con tres cosas abiertas a la vez, revisando lo que ha triado un sistema que acierta casi siempre, es la condición experimental exacta de ese estudio. «Poner a un humano a revisar» describe una intención, no un control. El humano está, mira al principio, y conforme la máquina demuestra que suele tener razón, mira menos. Ese es el hallazgo, medido y repetido desde antes de que existieran los agentes.
Una casilla que se marca sola
Aquí es donde esto deja de ser interesante y pasa a ser un problema de gobierno. El artículo 14 del Reglamento Europeo de Inteligencia Artificial, el 2024/1689, regula la supervisión humana de los sistemas de alto riesgo, y pide más de lo que suele reconocérsele: que el sistema se diseñe para que personas físicas puedan vigilarlo de manera efectiva mientras está en uso, que quien lo vigile entienda sus capacidades y sus limitaciones, que pueda decidir no usarlo o revertir su salida, y que exista un botón de parada o un procedimiento equivalente que lo detenga de forma segura.
Hay un apartado de ese artículo que me hizo levantar la vista de la pantalla. El 4, letra b), nombra el sesgo de automatización con todas las letras, el mismo fenómeno que Parasuraman y Manzey integraron en 2010. Lo que exige es que las personas encargadas de vigilar el sistema puedan
«ser conscientes de la posible tendencia a confiar automáticamente o en exceso en los resultados de salida generados por un sistema de IA de alto riesgo («sesgo de automatización»), en particular con aquellos sistemas que se utilizan para aportar información o recomendaciones con el fin de que personas físicas adopten una decisión»
Que un texto legal llame al problema por su nombre técnico me parece un gran trabajo. La investigación de 2010 añade el matiz incómodo: esa conciencia por sí sola no basta, porque el sesgo no se previene con formación ni con instrucciones. El artículo 14 no se queda ahí, que para eso pide también revertir la salida y detener el sistema. Lo que se cae es el escalón de abajo, el de la implantación. De todas esas obligaciones, en el documento de riesgos suele acabar escrita una sola línea, «hay revisión humana», y esa línea se degrada precisamente cuando el agente funciona bien. Con uno que acierta nueve de cada diez veces, la décima llega cuando el supervisor ya ha aprendido que no hace falta mirar.
De ahí salen dos consecuencias a analizar más detalladamente. La primera es que la supervisión humana no cuenta como control a menos que puedas decir quién la ejerce, con qué carga de trabajo encima y sobre qué muestra. Un revisor que además atiende tres colas rellena la casilla del documento de riesgos y poco más. La segunda es que la revisión no puede caer solo sobre los casos que el propio sistema marca como dudosos, porque entonces heredas su criterio y los errores por omisión quedan fuera del muestreo por construcción. Una parte de lo que se revisa tiene que salir al azar de lo que el agente dio por bueno. Esto último es propuesta mía sobre cómo aterrizarlo, no un hallazgo del artículo.
La conclusión de fondo es la misma que llevaba dentro el diseño coactivo. Observabilidad, predictibilidad y dirigibilidad se construyen una vez y siguen funcionando a las tres de la mañana del turno de guardia. La supervisión humana hay que sostenerla cada día, y quien la sostiene lleva seis horas mirando una pantalla que casi nunca se equivoca.
El rebaño del laboratorio
Falta el hallazgo de este año. Hasta aquí hemos hablado de personas que dirigen agentes. En febrero de 2026 se publicó un experimento que le da la vuelta a la pregunta: ¿y si el que dirige es el agente?
El trabajo se titula «Can an AI agent lead human teams?» y lo firman Simpson, Patil y otros diez autores. Montaron equipos de personas jugando a Desert Herding, un videojuego de conducir un rebaño hasta un corral, y los pusieron a trabajar la mitad de las partidas bajo un operador humano y la otra mitad bajo un agente. En el primer experimento fueron 32 equipos, 96 participantes y ocho partidas cada uno, con diseño intrasujeto para que cada equipo fuera su propio grupo de control.

Los resultados tienen dos partes. La primera es que tanto un modelo heurístico simple como un modelo de lenguaje ajustado se pueden desplegar como líderes de un equipo humano y funcionan, lo cual ya es más de lo que yo habría apostado. La segunda es que los equipos dirigidos por inteligencia artificial rindieron algo peor que los dirigidos por un operador humano. Los autores sitúan los retos de diseño en la comunicación flexible y en la conciencia social, no en la capacidad de cálculo del agente. Encontraron además un detalle que dice bastante de nosotros y poco de la máquina: el género percibido del agente influye en cómo el equipo evalúa su liderazgo.
Antes de que nadie construya una política encima de esto, la salvedad, que es grande. Es fuente única, es un experimento de laboratorio y lo que se dirige es un videojuego con noventa y seis voluntarios. No prueba nada general sobre organizaciones ni sobre tu equipo. Tan sólo es una señal temprana que apunta a un sitio concreto: cuando el mando pasa a la máquina, lo primero que se resiente es la conversación. He leído por ahí que los agentes fallaron al introducir niebla en el juego. La niebla servía para manipular la dificultad reduciendo la visibilidad de los jugadores de tierra, y no hay confirmación de que el rendimiento del agente se hundiera con ella, así que no se da por bueno.
¿Dónde queda la autorealización del trabajo?
El martes propuse cuatro competencias comprobables para quien ya dirige un binomio. Releídas con estos tres hallazgos encima, somos capaces de profundizar un poco más:
- «Sabe fijar el objetivo y el límite en la misma frase» es predictibilidad, y 2014 añade de dónde sale ese límite. El límite se calcula contando quién depende del resultado y con qué urgencia. La capacidad del agente entra después.
- «Sabe qué no se delega» es el principio de interdependencia aplicado con nombres y apellidos. Lo que compromete a un cliente, lo que mueve dinero, lo que toca producción y lo que habrá que justificar ante un regulador tiene una cadena de gente detrás esperando el resultado. Esa cadena es la que fija la respuesta, no lo bien que el modelo resuelva el caso de prueba.
- «Sabe parar» es dirigibilidad, y el estudio de 2010 le pone una condición que el martes no estaba: quien tiene el botón no puede ser la misma persona que está atendiendo otras tres cosas. Si el único que puede detener al agente es el analista con la cola llena, el botón está escrito en el procedimiento y nadie va a pulsarlo a las cuatro de la tarde de un viernes.
- «Exige poder reconstruir el camino» es observabilidad, y aquí la revisión de 2022 aporta el matiz que más me interesa. La comunicación aparece entre las variables que mueven el rendimiento del equipo, así que el rastro no vale solo para el día del postmortem. Vale para que la persona sepa mientras trabaja qué está haciendo su compañero de silicio, que es la única forma de que el binomio se comporte como un equipo.
Hay una quinta que el martes no estaba. Quien dirige un binomio tiene que desconfiar de su propia supervisión: saber que la atención se le va a ir, más cuanto mejor funcione el agente, y montar el trabajo contando con eso. Recuerdo la cifra de Gartner del martes: más de cuatro de cada diez proyectos de inteligencia artificial agéntica se cancelarán antes de que acabe 2027, y uno de los tres motivos que da la analista es que los controles de riesgo no llegaron. Esta es una de las formas concretas de no llegar.
La pata que no se puede desatornillar
En el libro, «Las celdas vacías» uso una imagen para explicar la seguridad, la del taburete de tres patas: personas, herramientas y metodologías. Aguanta mientras las tres estén y tengan la misma altura. Le he dado muchas vueltas esta semana, porque ha envejecido de una manera que no me esperaba.
Durante veinte años, la gracia de esa imagen fue que las tres patas se podían mirar por separado. Después de un incidente te sentabas a repartir: aquí falló la herramienta, que no detectó; aquí falló la persona, que no escaló; aquí falló el procedimiento, que no decía nada de este caso. Con un binomio, la persona y la herramienta comparten pata, y cuando la cosa sale mal te encuentras un postmortem sin sitio por donde agarrar. ¿No vio la alerta o el agente no la generó? ¿No la escaló o el agente la cerró antes? ¿Decidió mal o firmó lo que le pusieron delante?
Eso es justo lo que los tres requisitos de 2014 devuelven. Observabilidad, predictibilidad y dirigibilidad son lo que te permite volver a separar de qué mitad de la pata vino el fallo, y sin ellas la tercera pata, la de la metodología, acaba sujetando sola un mueble que ya no tiene tres puntos de apoyo claros.
Lo que no me quito de la cabeza, después de leerme estos tres trabajos seguidos, es lo poco que hemos aprovechado el adelanto que teníamos. Teníamos las condiciones publicadas doce años antes de necesitarlas, la advertencia sobre el supervisor distraído dieciséis años antes, y un campo entero llevaba años midiendo el binomio con otro vocabulario. Nada de eso ha entrado en las presentaciones de despliegue que se están enseñando este mes.
De un agente concreto de los que ya están trabajando en tu organización, ¿sabes ahora mismo qué está haciendo, qué va a hacer a continuación y cuánto tarda en detenerse si alguien lo pide? ¿Sabes además quién es ese alguien y qué tiene entre manos ahora mismo?
Fuentes
Diseño coactivo y el principio de que la interdependencia da forma a la autonomía (2014)
- Johnson, Bradshaw, Feltovich, Jonker, van Riemsdijk y Sierhuis, «Coactive Design: Designing Support for Interdependence in Joint Activity», Journal of Human-Robot Interaction, vol. 3 núm. 1, pp. 43 a 69, 2014 (ACM Digital Library)
- Ficha del mismo artículo en el repositorio de TU Delft
Revisión de la literatura empírica sobre equipos de personas y sistemas autónomos (2022)
- O’Neill, McNeese, Barron y Schelble, «Human-Autonomy Teaming: A Review and Analysis of the Empirical Literature», Human Factors, vol. 64 núm. 5, pp. 904 a 938, 2022 (SAGE)
- Referencia en PubMed
Supervisión humana de los sistemas de alto riesgo y mención expresa del sesgo de automatización: artículo 14 del Reglamento (UE) 2024/1689
- Artículo 14 en la edición anotada del Reglamento Europeo de Inteligencia Artificial
- Texto oficial consolidado en EUR-Lex
- Publicación oficial recogida en el BOE
Complacencia y sesgo de automatización (2010)
- Parasuraman y Manzey, «Complacency and Bias in Human Use of Automation: An Attentional Integration», Human Factors, 2010 (SAGE)
- Referencia en PubMed
Un agente dirigiendo equipos humanos (2026). Fuente única, experimento de laboratorio
- Simpson, Patil, Stening, Bin Kamruddin, Somerville, Seage, Nalepka, Dras, Hosking, Kallen, Richardson y Richards, «Can an AI agent lead human teams?», febrero de 2026 (ScienceDirect)
- Sin segunda fuente independiente localizada. La salvedad se dice en el cuerpo del artículo.
Frontier Firm, agent boss y la proporción entre personas y agentes
Cancelación de proyectos de IA agéntica antes de 2027
Pieza propia de la que sale esta entrada
El taburete de tres patas
Descubre más desde El sentido de la seguridad
Suscríbete y recibe las últimas entradas en tu correo electrónico.






