Radar · 18/07/2026 · ocurrido el 16/07/2026 · coding

Ollama 0.32.1: Gemma 4 y tool calling mejorados, cache leak resuelto

Ollama 0.32.1 se lanzó el 16 de julio con dos correcciones que importan para quién ejecuta modelos locales en contextos agentivos. La primera: tool calling mejorado en Gemma 4, con continuaciones tool-response más confiables en razonamientos multi-turn. Si usas Gemma 4 con herramientas, esta versión reduce los casos en que el modelo pierde el hilo entre una llamada y la siguiente.

La segunda, crítica: se resolvió un memory leak recurrente en la caché de los modelos MLX que aumentaba el uso de memoria a través de las solicitudes. Si notaste que Ollama crecía en RAM sin motivo, era esto.

Por qué te afecta. Si ejecutas agentes locales o flujos que llaman herramientas múltiples veces en la misma sesión, esta actualización cambia la estabilidad del sistema. El leak no era solo una molestia: bajo cargas repetidas, podía enviar a swap o crashear el agente. La corrección llega con mejores rendimientos en los snapshots de caché MLX.

Dos notas menores: la carga de modelos MLX ahora respeta OLLAMA_LOAD_TIMEOUT, y los agentes con búsqueda web o fetch ahora te dicen claramente que ejecutes ollama signin cuando se necesita autenticación, en lugar de fallar en silencio. Quién trabaja con agentes en local sabe cuánto valen estos mensajes de error claros.

Si quieres probarlo. Descarga la v0.32.1 desde la página de release en GitHub (enlace en las fuentes), y si habías reportado problemas de memoria o continuaciones tool inestables en Gemma 4, prueba con los mismos casos.

En detalle

El contexto: Ollama como runtime local para agentes.

Ollama es el runtime local más usado para ejecutar modelos open-weight en hardware propio, sin enviar los prompts a una API externa. La versión 0.32, lanzada hace pocos días, había introducido una interfaz agente y advertencias para modelos antiguos: la señal era clara, Ollama se posiciona como infraestructura para agentes self-hosted.

Esta 0.32.1 no añade funcionalidades nuevas: corrige dos problemas que hacían 0.32 inestable en producción.

El memory leak MLX: qué lo causaba.

MLX es el framework Apple para inferencia en Silicon. Ollama lo usa cuando ejecutas modelos en Mac. El leak documentado en el issue vinculado al release era recurrente: la caché de modelos MLX no liberaba memoria entre solicitudes, y cada nueva solicitud añadía asignación sin liberar la anterior.

En un agente que funciona durante horas, esto significaba crecimiento constante de RAM hasta swap o crash. La 0.32.1 resuelve el leak y mejora los rendimientos de los snapshots de caché, lo que se traduce en cargas de modelo más rápidas después de la primera ejecución.

Gemma 4 y tool calling: el problema de las continuaciones.

Gemma 4 es uno de los modelos open-weight que Ollama soporta para tool calling. El problema resuelto aquí concierne razonamientos multi-turn con herramientas: el modelo llama una herramienta, recibe la respuesta, y debe continuar el razonamiento incorporando esa respuesta. En algunos casos, la continuación se rompía: el modelo perdía el contexto de la llamada anterior o no integraba la respuesta en el paso siguiente.

La release note dice “more reliable tool-response continuations”, y esta es la frase clave para quién construye agentes: si tu flujo prevé múltiples llamadas tool concatenadas, este fix reduce los casos en que el agente “olvida” qué acaba de hacer.

Las otras correcciones.

OLLAMA_LOAD_TIMEOUT ahora funciona también para modelos MLX: antes se ignoraba, lo que creaba timeouts inesperados en modelos grandes. Y los agentes con capacidades de búsqueda web o fetch ahora reportan explícitamente cuándo se necesita ollama signin, en lugar de fallar con un error genérico. Detalles pequeños, pero quién ha debuggeado un agente sabe cuánto cuenta un mensaje de error que dice lo correcto.

Implicaciones para quién usa agentes en local.

Si ejecutas agentes en Ollama en contextos donde estabilidad y memoria cuentan (por ejemplo un agente que monitorea feeds o procesa archivos durante horas), la 0.32.1 es la actualización que elimina el riesgo de fallo silencioso. No es un release que añada features: es un release que hace confiable lo que 0.32 prometía.

Para quién evalúa si portar un agente a self-hosted, esta es una buena noticia: el runtime local más extendido está madurando en casos de uso agentivos reales, no solo en demostraciones.

Escribe para buscar en curso, playbooks, skills, papers…