Radar · 18/07/2026 · ocurrido el 11/07/2026 · coding

Ollama 0.32.1: tool calling más robusto y memory leak resuelto para agentes locales

Ollama 0.32.1 corrige un memory leak que afectaba a quienes ejecutan agentes locales en segundo plano y mejora el tool calling en razonamientos multi-turno. Es un lanzamiento de mantenimiento: sin features nuevas, dos correcciones que hacen estable lo que antes se rompía en sesiones largas.

Como contamos cuando salió la 0.32.0, Ollama apuntó a la experiencia con agentes: lanzas el comando y te encuentras en un chat que busca en la web, escribe código y delega tareas. La 0.32.1 ajusta la puntería precisamente en ese modo de usar la herramienta.

El memory leak era el problema serio. Si dejabas un agente en segundo plano durante sesiones prolongadas, la memoria ocupada crecía sin liberarse. Quienes usan modelos open-weight para tareas recurrentes, como un agente que procesa correo cada mañana o un mini-radar que agrega feeds RSS, se encontraban con procesos que se ralentizaban hasta detenerse. La corrección resuelve el comportamiento.

El tool calling mejorado se refiere al razonamiento multi-turno: cuando el agente invoca una herramienta, lee el resultado, y basándose en eso decide la siguiente llamada. Antes podía perder el hilo o repetir la misma llamada sin resultado. Ahora la secuencia se mantiene mejor.

Por qué te afecta. Si usas Ollama para agentes locales, es una actualización para hacer de inmediato. No cambia tu workflow, pero hace confiable lo que antes se trababa después de media hora. Si aún no usas agentes locales, este no es el lanzamiento que te hace empezar: el valor está en la estabilidad, no en las novedades.

La fuente es el changelog oficial en GitHub, publicado el 11 de julio de 2026.

En detalle

Qué había antes.

La versión 0.32.0, lanzada el 11 de julio de 2026, cambió la forma en que se presenta Ollama. Antes ejecutabas ollama y tenías un shell para descargar y ejecutar modelos. Ahora ejecutas el mismo comando y te encuentras con una interfaz de agente que ofrece chat, coding y delegación de tareas, con búsqueda web integrada. El modelo predeterminado para esta experiencia es glm-5.2:cloud.

La 0.32.0 también introdujo una advertencia de deprecación para modelos agénticos más antiguos: CodeLlama, Qwen2.5 (incluyendo la variante coder), Llama 3.x, Mistral, StarCoder y los tags base de DeepSeek-R1. Si intentas ejecutar uno con el comando de agente, Ollama te avisa antes de continuar. Es una señal clara: las herramientas locales se están orientando hacia modelos diseñados para agentes, no hacia aquellos genéricos entrenados hace años.

Qué cambia con la 0.32.1.

La 0.32.1 es una release de corrección que afecta dos puntos concretos de la experiencia con agentes introducida en la versión anterior.

El memory leak se manifestaba cuando un agente permanecía activo en segundo plano durante sesiones prolongadas. La memoria asignada para gestionar el contexto, los resultados de las herramientas y el estado de la conversación no se liberaba entre turnos. El proceso crecía en RAM hasta saturar los recursos de la máquina, con ralentizaciones progresivas y, en los peores casos, crashes. Para quienes usan Ollama en un laptop con 16 o 32 GB de RAM, donde el modelo en sí ya ocupa gran parte de la memoria disponible, el problema aparecía después de 20-30 minutos de actividad con agentes.

La corrección soluciona la gestión del ciclo de vida de los objetos de contexto, liberando memoria entre turnos cuando ya no es necesaria.

El tool calling multi-turno se refiere a la capacidad del agente de encadenar llamadas a herramientas externas. En un flujo típico, el agente invoca una herramienta de búsqueda, lee el resultado, y decide si invocar otra herramienta o responder. Antes de la 0.32.1, en secuencias largas podía perder la pista del estado o repetir llamadas ya realizadas. La mejora toca la lógica de enrutamiento entre los resultados de las herramientas y el siguiente paso del razonamiento.

Cuánta confianza tener.

El changelog es verificable en el repositorio oficial de Ollama en GitHub. Las notas de la 0.32.0 son públicas y detalladas. Para la 0.32.1, las correcciones descritas son coherentes con los problemas reportados por la comunidad en los issue trackers en las semanas previas, pero las notas de lanzamiento específicas de la 0.32.1 deben verificarse directamente en el tag correspondiente.

No hay benchmarks numéricos asociados a la mejora del tool calling: se trata de una corrección de estabilidad, no de un salto de rendimiento medible.

Implicaciones prácticas.

Si tienes agentes locales que se ejecutan en schedule (una clasificación de correo matutina, una reseña de feeds, un monitor de página), la 0.32.1 los hace confiables en sesiones largas sin necesidad de reinicios manuales. Si en cambio usas Ollama solo para chats interactivos breves, el memory leak probablemente no te afectó y la actualización es opcional pero recomendada por seguridad.

Para construir agentes locales estables, el playbook sobre cómo delegar una tarea multi-paso a un agente sigue siendo válido: la corrección de Ollama resuelve la infraestructura, pero la calidad del resultado siempre depende de cómo escribas el brief.

Escribe para buscar en curso, playbooks, skills, papers…