Radar · 06/08/2026 · ocurrido el 04/08/2026 · investigación

Prime Agent, OneDayAgent y Self-Evolving Coding Agents: la auto-evolución se vuelve medible

Tres trabajos publicados en pocos días convergen en el mismo punto: medir qué sucede cuando un agente IA mejora de sus propios errores entre una sesión y otra. Prime Intellect lanza Prime Agent, un harness open source donde el agente puede reescribir sus propios prompts, sus skills y su memoria durante la ejecución. OneDayAgent, paper del team ZJUNLP en arXiv, formaliza la persistencia cross-environment sobre 104 tareas y cinco backends diferentes, con una puntuación general de 0.821 en GLM-5.2. Un tercer paper, Self-Evolving Coding Agents, documenta cómo los agentes de programación pueden acumular experiencia de los ciclos de prueba y reparación en lugar de reiniciar desde cero cada vez.

Por qué te importa. Hasta ayer, un agente que fallaba recibía una corrección y en el siguiente turno reiniciaba con la memoria vacía. La mejora automática era especulación de demo. Ahora tres equipos independientes la miden con benchmarks repetibles: el agente que falla y luego recuerda obtiene mejores puntuaciones en tareas reales, no en escenarios construidos. Para quienes usan agentes en su trabajo, la diferencia está entre repetir cada vez las mismas instrucciones y tener un asistente que acumula experiencia en tu contexto específico.

Es el mismo territorio que explorábamos el 5 de agosto con tres benchmarks convergentes en la progresión de agentes en el tiempo: la pregunta entonces era si un agente que recuerda también se convierte en un agente que aprende. Estos tres trabajos aportan los primeros números concretos a esa pregunta.

En detalle

El problema de partida es el mismo para los tres trabajos. Los harnesses de agentes actuales, desde coding agents hasta general assistants, son estáticos: prompts, skills, memoria y sub-agentes se configuran una sola vez en el design time y no cambian más. Cuando el modelo falla, corrige el output individual, pero la experiencia no se acumula. La sesión siguiente reinicia desde cero.

Prime Agent aborda el problema con dos abstracciones. El Recursive Language Model (RLM) trata el contexto como una variable: el agente accede a su propio historial, a los sub-agentes y a las herramientas como si fueran llamadas de función en un kernel IPython persistente. El Continual Harness va más allá: el agente puede crear, leer, actualizar y eliminar sus propios prompts, skills, memoria y sub-agentes durante la ejecución. Si descubre que cierto prompt funciona mejor para un tipo de tarea, lo reescribe por sí solo. Es open source, instalable con un script, y funciona con modelos frontier tanto abiertos como cerrados.

OneDayAgent toma un camino más medible. El team ZJUNLP construyó un harness para tareas long-horizon, cross-environment y multimodales: solicitudes abiertas que atraviesan trabajo, estudio y vida cotidiana, donde el agente debe mantener objetivos y restricciones a través de muchos pasos y herramientas heterogéneas. La evaluación en AgentIF-OneDay cubre 104 tareas y cinco backends LLM de tres familias de modelos. Con GLM-5.2 como backend, OneDayAgent alcanza 0.881 como puntuación general (nuevo estado del arte en el benchmark). El dato relevante es que el mismo harness se ejecuta en los cinco backends sin recalibración, aunque cada modelo induce estilos de ejecución diferentes bajo el mismo flujo de trabajo.

Self-Evolving Coding Agents (paper en arXiv) documenta el caso específico de agentes de programación. El desarrollo de software es un entorno dinámico y rico en retroalimentación: los repositorios evolucionan, las dependencias cambian, las pruebas fallan, los intentos de reparación dejan experiencia reutilizable. El argumento del paper es que los agentes actuales ignoran esta experiencia por construcción, y que recopilarla de manera estructurada mejora el desempeño en las tareas posteriores.

Los tres trabajos se complementan más de lo que divergen. Prime Agent muestra la arquitectura (el agente que se reescribe a sí mismo), OneDayAgent aporta la medición rigurosa sobre múltiples tareas y backends, Self-Evolving Coding Agents formaliza el dominio de aplicación más maduro para este enfoque.

Los límites. Ninguno de los tres es un producto terminado. Prime Agent es un harness de investigación, pensado para quienes escriben código, no para el usuario final. OneDayAgent tiene 104 tareas: una cifra útil pero no amplia. Las puntuaciones dependen del backend, y el 0.821 con GLM-5.2 no significa que todos los modelos obtengan el mismo resultado. Self-Evolving Coding Agents sigue siendo un paper, con números que verificar en repositorios reales y no solo en benchmarks de laboratorio. El salto de “el agente mejora en un benchmark” a “el agente aprende en tu caso específico” aún requiere infraestructura y tiempo.

Para quienes siguen la línea de la memoria agentica, estos trabajos se ubican donde los dejamos con la Experience Distillation de julio: la idea de fijar en los pesos o en el estado lo que el agente aprende. La diferencia es que ahora existe un benchmark para medirlo.

Escribe para buscar en curso, playbooks, skills, papers…