Malpensador · malpensador.com
Agentes de larga duración: la IA que no se detiene
Qué hacen, en qué tareas se usan y por qué necesitan supervisión
Redacción Malpensador
Fuente: Anthropic

Un chatbot responde cuando alguien le escribe. Un agente de larga duración intenta resolver una tarea que puede continuar durante horas, días o incluso semanas. No se limita a producir una respuesta: divide un objetivo, usa herramientas, conserva el estado del trabajo, revisa lo que hizo y decide cuál es el siguiente paso.
La diferencia no está únicamente en cuánto tiempo permanece abierto un proceso. Está en la capacidad de trabajar por etapas sin que una persona tenga que volver a explicar el contexto en cada turno. Un agente puede investigar, escribir archivos, ejecutar pruebas, detectar un error, corregirlo y dejar un registro para retomar la tarea después.
De la respuesta al proyecto
Anthropic distingue entre flujos de trabajo y agentes. En un flujo, el programa define de antemano la secuencia de pasos. En un agente, el modelo dirige dinámicamente el proceso y decide qué herramientas usar para alcanzar un objetivo. Los agentes de larga duración llevan esa autonomía a tareas con más incertidumbre y más posibilidades de desviarse.
La arquitectura suele combinar un modelo de lenguaje con memoria, búsqueda, acceso a documentos, ejecución de código, navegación y mecanismos de verificación. También necesita una forma de detenerse: pedir aprobación, reportar un bloqueo o entregar un resultado parcial. Sin esos límites, trabajar durante más tiempo no significa trabajar mejor; significa tener más oportunidades de equivocarse.
El tiempo, además, se puede medir. METR desarrolla una métrica llamada *time horizon*, que estima la duración de las tareas que un sistema puede completar con una probabilidad determinada de éxito. La organización ha observado un crecimiento acelerado de ese horizonte en los últimos años, aunque la métrica no equivale a decir que una IA pueda mantener una jornada laboral completa sin supervisión.
Dónde se están usando
La programación es el caso más visible. Agentes como Codex pueden explorar un repositorio, proponer cambios, ejecutar pruebas y abrir una revisión. En empresas, ese tipo de sistema se usa para corregir errores, limpiar código antiguo, actualizar dependencias y revisar solicitudes de cambio. SWE-bench ofrece una referencia para medir si un agente puede resolver problemas reales tomados de repositorios de software, aunque superar un benchmark no garantiza que el cambio sea seguro en producción.
Otra aplicación es la investigación con muchas fuentes. Un agente puede buscar documentos, comparar resultados, extraer datos y producir un informe con enlaces para revisión humana. En análisis de datos puede preparar consultas, encontrar anomalías y repetir cálculos. En operaciones, puede clasificar incidentes, consultar registros, proponer una respuesta y escalar el caso cuando la evidencia no alcanza.
También aparecen en tareas administrativas y de conocimiento: seguimiento de proyectos, actualización de bases de datos, preparación de reportes, control de inventarios y revisión de documentos. El patrón funciona mejor cuando existe un objetivo concreto, herramientas accesibles y una manera verificable de saber si el trabajo quedó bien.
Más autonomía, más responsabilidad
El problema central es que los errores se acumulan. Una suposición equivocada al comienzo puede contaminar todo el proceso; una herramienta mal elegida puede modificar información; una instrucción ambigua puede hacer que el agente optimice una métrica y pierda el objetivo real. Por eso los agentes largos necesitan límites de permisos, registros, pruebas automáticas y puntos de aprobación.
La promesa no es que la IA reemplace de golpe a una persona durante días. Es que pueda hacerse cargo de cadenas de trabajo que hoy se interrumpen cada vez que el humano cambia de tarea. El valor estará en sostener el contexto y avanzar con disciplina, no en aparentar independencia.
Los agentes de larga duración son, en el fondo, una nueva forma de organizar el trabajo digital. La pregunta importante no es cuánto tiempo pueden permanecer activos, sino qué tareas pueden completar de forma confiable, cómo se comprueba cada decisión y quién responde cuando el resultado es incorrecto.
Imagen: Imagen generada con IA