Gestión de contexto en agentes: cinco primitivas para memoria y costo
Un paper en arXiv le pone nombre a un problema que quien usa agentes en producción encuentra cada día: la gestión del contexto. El contexto de un agente, compuesto por el historial de conversación, definiciones de herramientas y outputs de tools, se acumula turno tras turno. El costo en tokens crece de manera cuadrática respecto a la duración de la sesión, y el agente pierde información justo cuando la necesitaría.
Gaurav Dadhich define esta disciplina como Agentic Context Management (ACM) y la descompone en cinco primitivas: arquitectura, ingesta, alcance, anticipación y compactación. La tesis central es que el contexto debe tratarse como un ciclo de vida. Se decide qué recordar, se estructura, se elige el almacén correcto para cada tipo de dato, se consolida y se olvida preservando la trazabilidad, se anticipa qué será necesario en el siguiente turno y se compacta dentro de un presupuesto sin perder lo que importa.
Por qué te importa. Si has visto un agente degradarse después de veinte turno o pagado una factura de API desproporcionada por una sesión que podía cerrarse en cinco pasos, el paper ofrece un marco para entender dónde se rompe. Es el mismo patrón que Anthropic publica entre sus recetas internas para agentes y que el playbook De chat interminable a sesión nueva te permite aplicar hoy, incluso sin infraestructura.
En detalle
Qué había antes.
El enfoque dominante para la memoria de agentes es RAG: guardas los datos en una base de datos vectorial y los recuperas con búsqueda por similaridad cuando los necesitas. Funciona para documentos estáticos, pero falla cuando el “documento” es la conversación misma, que crece y cambia en cada turno. El paper parte de aquí: tratar la memoria como almacenamiento y recuperación es demasiado limitado.
El marco propuesto.
ACM trata el contexto como un ciclo de vida con cinco fases:
- Arquitectura: decidir la estructura de la memoria antes de comenzar. Qué tipos de datos van dónde (historial reciente en contexto, hechos consolidados en un almacén estructurado, outputs sin procesar en un archivo separado).
- Ingesta: extraer y estructurar lo que vale la pena recordar, en lugar de guardarlo todo.
- Alcance: filtrar por relevancia y por ámbito organizacional. Un agente en producción sirve a una jerarquía de alcances (personal, equipo, organización), porque el contexto relevante para un usuario puede ser innecesario o dañino para otro.
- Anticipación: predecir qué se necesitará en el próximo turno y preparar su recuperación, en lugar de esperar la solicitud explícita.
- Compactación: reducir el contexto a un presupuesto prefijado sin perder lo que importa. Es la fase más delicada, porque aquí se juega el compromiso entre costo y precisión.
El caso económico.
El argumento más útil del paper es la matemática del costo. Si acumulas contexto sin gestionarlo, el costo en tokens crece cuadráticamente: cada turno relee todo el historial. Si resumes brutalmente al final de cada turno, el costo se vuelve lineal pero la precisión se desmorona más allá de cierto punto, lo que el paper llama accuracy cliff. La compactación validada, en cambio, mantiene el costo lineal y preserva la fidelidad, porque elige qué comprimir basándose en lo que realmente se necesita.
Para quien no construye infraestructura, la lección práctica es simple: de vez en cuando tienes que compactar el contexto de un agente, pero con criterio. Un resumen ciego corta todo de la misma manera y pierde los detalles que importan.
Los números.
La implementación de referencia, Maximem Synap, marca 92% en LongMemEval y 93,2% en LoCoMo (datos reportados en el paper, sección 6, julio 2026). Son benchmarks de memoria larga que evalúan si un agente recuerda información atravesando conversaciones extensas. Los números son del autor, en configuraciones específicas. El código y los datos de evaluación están enlazados en el paper, pero aún no hay una réplica independiente disponible.
Limitaciones.
El paper es una propuesta de marco, con una implementación de referencia de soporte. Los benchmarks miden precisión de recuperación, pero el paper mismo señala qué los benchmarks actuales no capturan: latencia, eficiencia de tokens y resistencia a la degradación del contexto con el tiempo. El salto entre una implementación de referencia y un sistema multi-tenant en producción es grande, y el paper lo reconoce. Para quien lo lee, el valor principal está en el vocabulario y el marco: tener un nombre para las cinco fases te ayuda a razonar sobre dónde tu agente se rompe, incluso sin implementar Maximem Synap.