Agentes de IA ganan a Slay the Spire 2 reemplazando logs de chat con memoria estructurada
El proyecto AgenticSTS hizo ganar a un agente de IA al videojuego Slay the Spire 2, donde los modelos frontier usados en modo clásico (prompts con logs de conversación cada vez más largos) nunca habían completado una partida. La diferencia no está en el modelo — todos usan Gemini 3.1 Pro — sino en la arquitectura: el agente nunca ve su propio log de chat, reconstruye cada decisión desde cinco espacios de memoria separados (instrucciones fijas, esquema del estado actual, reglas recuperadas bajo demanda, resúmenes de partidas anteriores, librería de estrategias para situaciones recurrentes). La tasa de victoria se duplica cuando la librería de estrategias está activa, y con memoria persistente entre partidas el agente alcanza niveles de dificultad A6-A8, donde sin memoria se detiene en A2-A4.
Por qué te importa. Un agente que acumula logs de conversación crece en costo y latencia en cada paso, hasta saturar la ventana de contexto o diluir la atención del modelo entre cientos de miles de tokens. AgenticSTS demuestra que una arquitectura con memoria estructurada externa consume 90 veces menos tokens por punto obtenido en comparación con agentes tradicionales, y completa partidas en una cuarta parte del tiempo. Es el mismo patrón que usamos en el curso cuando hablamos de dar memoria a los agentes: el log no es el estado, y si lo tratas como tal pagas un precio en cada decisión.
En detalle
El problema del log que crece
Los agentes clásicos como ReAct o Reflexion encolan cada observación, llamada a herramienta y auto-reflexión al siguiente prompt. Funciona para tareas cortas, pero una partida a Slay the Spire 2 dura cientos de decisiones (cartas a elegir, rutas en el mapa, combates a planificar). Los modelos frontier probados en AGI-Eval nunca ganaron una partida en cinco configuraciones diferentes. El log crece hasta saturar la ventana o hacer perder la atención del modelo en lo que realmente importa.
Los cinco espacios de memoria
AgenticSTS invierte el patrón. Cada decisión comienza desde cero: sin log acumulado, pero cinco espacios independientes rellenados bajo demanda.
- L1: instrucciones fijas del protocolo, siempre iguales.
- L2: esquema del estado actual con las acciones válidas (cartas en mano, enemigos, estadísticas).
- L3: reglas del juego recuperadas cuando se necesitan.
- L4: resúmenes de partidas anteriores, actualizados entre sesiones.
- L5: librería de estrategias para situaciones recurrentes (skills), generadas o escritas manualmente.
Qualquier cosa que el agente quiera llevar del paso anterior debe primero terminar en uno de estos espacios. El prompt permanece corto independientemente de la duración de la partida, y cada capa se puede aislar para entender qué realmente mejora.
Los números
El equipo probó cinco configuraciones con diez partidas cada una en el nivel de dificultad más bajo, A0. Sin memoria, el agente gana 3 de 10 partidas. Con la librería de estrategias activa (L5), la tasa sube a 6 de 10, tanto con skills escritas manualmente como generadas desde plantillas. Los investigadores reconocen que con solo diez partidas la varianza podría explicar el duplicado, pero el salto es evidente.
La memoria episódica (L4) no ayuda en A0, pero se vuelve decisiva cuando el agente enfrenta dificultades crecientes: con memoria persistente alcanza A6-A8, sin ella se detiene en A2-A4. La prueba de transferibilidad muestra que la memoria construida por Gemini 3.1 Pro no se transfiere a otros modelos: Qwen 3.6-27B mejora un 84,5%, Deepseek V4-Pro cae un 18,1%, y ninguno de los dos gana nunca.
La comparación con agentes de log creciente
La comparación más interesante no es interna sino con dos agentes públicos que usan el log acumulado: STS2MCP y CharTyr. Los tres agentes usan Gemini 3.1 Pro para decisiones estratégicas. Los dos competidores nunca ganan en las cinco partidas probadas, y por cada punto obtenido envían de 66 a 90 veces más tokens al modelo que los que usa AgenticSTS. En STS2MCP, una única llamada al modelo hacia el final de la partida llega a 527.000 tokens porque todo el historial se reenvía en cada nueva decisión. AgenticSTS mantiene el prompt real alrededor de 5.000 tokens durante toda la duración de la partida.
La acumulación también cuesta tiempo: los agentes tradicionales tardan cuatro veces más en alcanzar el mismo puntaje, y según los logs del proveedor el 96% de la diferencia proviene de la latencia del modelo, no del software de control.
Qué queda abierto
El paper no dice si los cinco espacios son universales o específicos para el videojuego. La memoria construida por un modelo no se transfiere a otros, y esto limita su reutilización. La tasa de victoria en el nivel más bajo sigue siendo inferior al 60%, y los investigadores admiten que diez partidas por configuración dejan margen para la varianza. Pero el patrón — memoria externa estructurada en lugar de log acumulado — es el mismo que aparece en sistemas agentivos reales y en el paper sobre memory agent, y aquí lo ves funcionando en una tarea con cientos de decisiones encadenadas.