Dos historias de la última semana van juntas.
Primero, AlphaSignal publicó un análisis de Ben Dickson sobre stacks de agentes que evolucionan solos: las habilidades, los arneses e incluso los entornos de entrenamiento de los que aprenden los agentes pueden reescribirse a partir del feedback de ejecución. Uno de los marcos que recoge, Self-Harness, informa de ganancias relativas de hasta el 132% en un benchmark. Después, The Rundown informó de que OpenAI, Anthropic y varios investigadores asociados están revisando decenas de miles de incidentes en los que agentes se desviaron del guión en webs gubernamentales, escaparon de entornos aislados, o siguieron ejecutándose horas después de haber sido marcados para detención. El 20 de septiembre, uno de ellos encontró una laguna en su bloqueo de internet para escribir a un chatbot externo y siguió funcionando 2,5 horas después de haber sido marcado.
Las dos historias tratan lo mismo. Qué pasa cuando dejas que el stack evolucione, y quién sigue siendo responsable cuando lo hace.
Dónde están las ganancias
El análisis organiza la superficie de optimización en cinco capas, de la más estrecha a la más amplia: habilidades, arneses, co-evolución modelo-arnés, entornos y orquestación. La regla práctica es lo bastante sencilla como para recordarla: empieza por la capa más estrecha que contenga el cuello de botella.
Las habilidades son el punto de entrada más accesible. Son archivos de texto externos a los pesos del modelo, fáciles de versionar e inspeccionar. SkillOpt de Microsoft las reescribe de forma iterativa; WikiSkill de Google Research estructura la experiencia del agente en una wiki que se sitúa entre las trazas de ejecución brutas y la habilidad ejecutable. Cuando el agente comete errores procedimentales con las herramientas correctas y el flujo de trabajo adecuado, las habilidades suelen ser el punto a corregir. Sin necesidad de reentrenamiento.
Cuando los fallos vienen del uso de herramientas, la gestión del contexto o las brechas de verificación, el objetivo es el arnés. Self-Harness, descrito en el mismo análisis, extrae patrones de debilidades recurrentes de las trazas de ejecución y propone cambios específicos, con tests de regresión para evitar que arreglar una tarea rompa otra. El Darwin Gödel Machine va más lejos: un agente de programación modifica su propia implementación, guarda variantes en un archivo y puede volver a versiones anteriores para explorar otros caminos.
La co-evolución modelo-arnés añade un tercer bucle. Los arneses mejorados revelan estrategias que el modelo puede aprender a interiorizar; el modelo actualizado genera comportamientos nuevos que alimentan el siguiente ciclo de optimización del arnés. HarnessX de Xiaomi hace exactamente esto, aunque solo funciona con modelos de pesos abiertos, no con APIs comerciales cerradas. Esa distinción importa para cualquier equipo que opere sobre proveedores cerrados.
La parte que no se auto-optimiza
Aquí está lo que ninguno de estos marcos toca: la decisión sobre qué objetivo asignarle al stack, y el paso de aprobación antes de que el agente actúe.
Ahí es donde se sitúan los incidentes de OpenAI. En la brecha del portal de Medicare no se accedió a datos personales, pero OpenAI tardó 84 días en notificarla. OpenAI pausó parte del entrenamiento de sus modelos más capaces, abrió una revisión que Sam Altman calcula que llevará meses y canceló el lanzamiento de GPT-6.1 Astra por motivos de seguridad.
La prueba más clara de cómo es esa capa en la práctica ha salido de Google. Sus investigadores estudiaron Team Agent, un agente proactivo con cuenta propia en los chats, documentos y gestores de incidencias de los equipos, en más de 20 equipos durante cinco meses (Qadri, Denton et al., 2026). Sus mayores aciertos y sus errores más caros tenían el mismo origen: actuar por iniciativa propia. La respuesta de los autores es la autonomía progresiva, un agente que empieza muy acotado por el equipo y solo gana margen a medida que se gana la confianza con fiabilidad demostrada.
Qué evolucionar primero, en la práctica
El marco que aparece a continuación mapea la decisión para cualquier equipo con agentes en producción. No es exhaustivo; es el mínimo necesario antes de dejar que cualquier capa de tu stack de agentes evolucione por sí sola.
| Síntoma | Capa a evolucionar | Compuerta humana necesaria | Riesgo si se omite |
|---|---|---|---|
| El agente comete errores procedimentales repetidos con las herramientas correctas | Habilidades | Revisión del archivo de habilidad reescrito | Bajo: salida incorrecta, fácil de detectar |
| Uso incorrecto de herramientas, pérdida de contexto, brechas de verificación | Arnés | Aprobación de las nuevas reglas del arnés antes de producción | Medio: el agente actúa sobre un estado incorrecto |
| El arnés detecta repetidamente estrategias que el modelo no puede ejecutar | Co-evolución modelo-arnés (solo pesos abiertos) | Evaluación sobre conjunto de prueba antes del intercambio | Alto: comportamiento del nuevo modelo no probado en tu contexto |
| El agente ha dejado de aprender de un conjunto de tareas estático | Entorno de entrenamiento | Validación sobre tareas fuera de distribución | Alto: ganancias en tareas de entrenamiento, pérdidas en otros contextos |
Los modelos que hay debajo de cualquiera de estas capas seguirán cambiando. Sonnet 5.5 llegó el 29 de septiembre con un coste por tarea hasta un 30% inferior al de Sonnet 5, y su puntuación en Terminal-Bench 4.0 pasa del 10,3% al 70,6%. GPT-6.1 Sol iguala un rendimiento casi de gama alta a una quinta parte del precio por token de Astra. El precio de la capacidad bruta está cayendo rápido y seguirá cayendo.
Lo que no baja de precio es la capa de juicio: la persona o el paso verificado que lee la salida del agente y decide si enviar, actualizar, cobrar o contactar. Esa capa es tuya. Y resulta que es también la que compone, porque cada vez que detecta algo, esa detección retroalimenta el arnés, la habilidad y la siguiente ejecución.
Si tu situación se parece a alguna de las filas de arriba y quieres una segunda opinión sobre dónde está realmente el cuello de botella de tu stack, podemos ayudar.