Radar · 18/07/2026 · survenu le 16/07/2026 · coding

Ollama 0.32.1 : Gemma 4 et tool calling améliorés, fuite mémoire résolue

Ollama 0.32.1 est sortie le 16 juillet avec deux correctifs qui comptent pour ceux qui exécutent des modèles locaux dans des contextes agentiques. Le premier : tool calling amélioré sur Gemma 4, avec des continuations tool-response plus fiables dans les raisonnements multi-tour. Si tu utilises Gemma 4 avec des outils, cette version réduit les cas où le modèle perd le fil entre un appel et le suivant.

Le deuxième, critique : résolution d’une fuite mémoire récurrente dans le cache des modèles MLX qui augmentait l’utilisation de la mémoire à travers les requêtes. Si tu as remarqué qu’Ollama croissait en RAM sans raison, c’était ça.

Pourquoi ça te concerne. Si tu exécutes des agents locaux ou des workflows qui appellent des outils plusieurs fois dans la même session, cette mise à jour change la stabilité du système. La fuite n’était pas juste un désagrément : sur des charges répétées, elle pouvait envoyer en swap ou crasher l’agent. La correction arrive avec de meilleures performances sur les snapshots du cache MLX.

Deux notes mineures : le chargement des modèles MLX respecte maintenant OLLAMA_LOAD_TIMEOUT, et les agents avec recherche web ou fetch te disent clairement de lancer ollama signin quand l’authentification est nécessaire, au lieu de échouer silencieusement. Ceux qui travaillent avec des agents localement savent combien ces messages d’erreur clairs valent.

Si tu veux essayer. Télécharge la v0.32.1 depuis la page release sur GitHub (lien dans les sources), et si tu avais signalé des problèmes de mémoire ou des continuations tool instables sur Gemma 4, teste sur les mêmes cas.

En détail

Le contexte : Ollama comme runtime local pour les agents.

Ollama est le runtime local le plus utilisé pour exécuter des modèles open-weight sur son propre matériel, sans envoyer les prompts à une API externe. La version 0.32, sortie quelques jours plus tôt, avait introduit une interface agent et des avertissements pour les vieux modèles : le signal était clair, Ollama se positionne comme infrastructure pour les agents self-hosted.

Cette 0.32.1 n’ajoute pas de nouvelles fonctionnalités : elle corrige deux problèmes qui rendaient 0.32 instable en production.

La fuite mémoire MLX : ce qui la causait.

MLX est le framework Apple pour l’inférence sur Silicon. Ollama l’utilise quand tu exécutes des modèles sur Mac. La fuite documentée dans l’issue liée à la release était récurrente : le cache des modèles MLX ne libérait pas de mémoire entre les requêtes, et chaque nouvelle requête ajoutait une allocation sans libérer la précédente.

Sur un agent qui tourne pendant des heures, cela signifiait une croissance constante de la RAM jusqu’au swap ou au crash. La 0.32.1 résout la fuite et améliore les performances des snapshots du cache, ce qui se traduit par des chargements de modèle plus rapides après la première exécution.

Gemma 4 et tool calling : le problème des continuations.

Gemma 4 est l’un des modèles open-weight qu’Ollama supporte pour le tool calling. Le problème résolu ici concerne les raisonnements multi-tour avec des outils : le modèle appelle un outil, reçoit la réponse, et doit continuer le raisonnement en incorporant cette réponse. Dans certains cas, la continuation se cassait : le modèle perdait le contexte de l’appel précédent ou n’intégrait pas la réponse dans l’étape suivante.

La note de release dit « more reliable tool-response continuations », et cette phrase est clé pour ceux qui construisent des agents : si ton workflow prévoit plusieurs appels d’outils chaînés, ce correctif réduit les cas où l’agent « oublie » ce qu’il vient de faire.

Les autres corrections.

OLLAMA_LOAD_TIMEOUT fonctionne maintenant aussi pour les modèles MLX : avant c’était ignoré, ce qui créait des timeouts inattendus sur les gros modèles. Et les agents avec capacités de recherche web ou fetch signalent maintenant explicitement quand ollama signin est nécessaire, au lieu d’échouer avec une erreur générique. Des petits détails, mais ceux qui ont debuggé un agent savent combien compte un message d’erreur qui dit la bonne chose.

Implications pour ceux qui utilisent des agents localement.

Si tu exécutes des agents sur Ollama dans des contextes où la stabilité et la mémoire comptent (par exemple un agent qui monitore des feeds ou traite des fichiers pendant des heures), la 0.32.1 est la mise à jour qui ôte le risque d’échec silencieux. Ce n’est pas une release qui ajoute des fonctionnalités : c’est une release qui rend fiable ce que 0.32 promettait.

Pour ceux qui évaluent s’il faut porter un agent en self-hosted, c’est une bonne nouvelle : le runtime local le plus répandu mûrit sur les vrais cas d’usage agentiques, pas juste sur les démos.

Tapez pour chercher dans cours, playbooks, skills, papers…