Radar · 18/07/2026 · survenu le 11/07/2026 · coding

Ollama 0.32.1: tool calling più robusto e memory leak risolto per gli agenti locali

Ollama 0.32.1 corregge un memory leak che colpiva chi esegue agenti locali in background e migliora il tool calling nei ragionamenti multi-turno. È una release di manutenzione: niente feature nuove, due fix che rendono stabile quello che prima si rompeva in sessioni lunghe.

Come avevamo raccontato quando è uscita la 0.32.0, Ollama ha puntato sull’esperienza agente: lanci il comando e ti ritrovi in una chat che cerca nel web, scrive codice e delega compiti. La 0.32.1 aggiusta il tiro proprio su quel modo di usare il tool.

Il memory leak era il problema serio. Se lasciavi un agente in background per sessioni prolungate, la memoria occupata cresceva senza rilasciarsi. Chi usa modelli open-weight per task ricorrenti, tipo un agente che procesa la posta ogni mattina o un mini-radar che aggrega feed RSS, si trovava con processi che rallentavano fino a fermarsi. Il fix risolve il comportamento.

Il tool calling migliorato riguarda il multi-turn reasoning: quando l’agente chiama uno strumento, legge il risultato, e in base a quello decide la chiamata successiva. Prima poteva perdere il filo o ripetere la stessa chiamata a vuoto. Ora la sequenza regge meglio.

Perché ti riguarda. Se usi Ollama per agenti locali, è un upgrade da fare subito. Non cambia il tuo workflow, ma rende affidabile quello che prima si incagliava dopo mezz’ora. Se non usi ancora gli agenti locali, non è il rilascio che ti fa partire: il valore sta nella stabilità, non nelle novità.

La fonte è il changelog ufficiale su GitHub, pubblicato l’11 luglio 2026.

Nel dettaglio

Cosa c’era prima.

La versione 0.32.0, rilasciata l’11 luglio 2026, ha cambiato il modo in cui Ollama si presenta. Prima lanciavi ollama e avevi una shell per scaricare e far girare modelli. Ora lanci lo stesso comando e ti ritrovi in un’interfaccia agente che offre chat, coding e delega di compiti, con ricerca web integrata. Il modello di default per questa esperienza è glm-5.2:cloud.

La 0.32.0 ha anche introdotto un avviso di deprecazione per i modelli agentici più vecchi: CodeLlama, Qwen2.5 (anche nella variante coder), Llama 3.x, Mistral, StarCoder e i tag base di DeepSeek-R1. Se provi a lanciarne uno con il comando agente, Ollama ti avvisa prima di continuare. È un segnale chiaro: il tooling locale si sta orientando verso modelli pensati per gli agenti, non verso quelli generici addestrati anni fa.

Cosa cambia con la 0.32.1.

La 0.32.1 è una release di correzione che interessa due punti concreti dell’esperienza agente introdotta nella versione precedente.

Il memory leak si manifestava quando un agente restava attivo in background per sessioni prolungate. La memoria allocata per gestire il contesto, i risultati dei tool e lo stato della conversazione non veniva rilasciata fra un turno e l’altro. Il processo cresceva in RAM fino a saturare le risorse della macchina, con rallentamenti progressivi e, nei casi peggiori, crash. Per chi usa Ollama su un laptop con 16 o 32 GB di RAM, dove il modello stesso occupa già gran parte della memoria disponibile, il problema si presentava dopo 20-30 minuti di attività agente.

Il fix corregge la gestione del ciclo di vita degli oggetti di contesto, rilasciando la memoria fra i turni quando non serve più.

Il tool calling multi-turn riguarda la capacità dell’agente di incatenare chiamate a strumenti esterni. In un flusso tipico, l’agente chiama un tool di ricerca, legge il risultato, decide se chiamare un altro tool o rispondere. Prima della 0.32.1, in sequenze lunghe poteva perdere traccia dello stato o ripetere chiamate già fatte. Il miglioramento tocca la logica di routing fra i risultati dei tool e il passo successivo del ragionamento.

Quanto fidarsi.

Il changelog è verificabile sul repository ufficiale di Ollama su GitHub. Le note della 0.32.0 sono pubbliche e dettagliate. Per la 0.32.1, i fix descritti sono coerenti con i problemi segnalati dalla community negli issue tracker nelle settimane precedenti, ma le note di rilascio specifiche della 0.32.1 vanno controllate direttamente sul tag corrispondente.

Non ci sono benchmark numerici associati al miglioramento del tool calling: si tratta di una correzione di stabilità, non di un salto di prestazioni misurabile.

Implicazioni pratiche.

Se hai agenti locali che girano su schedule (un triage email mattutino, una rassegna feed, un sorvegliante di pagina), la 0.32.1 li rende affidabili su sessioni lunghe senza bisogno di riavvii manuali. Se invece usi Ollama solo per chat interattive brevi, il memory leak probabilmente non ti aveva colpito e l’upgrade è opzionale ma consigliato per sicurezza.

Per costruire agenti locali stabili, il playbook su come delegare un compito multi-passo a un agente resta valido: il fix di Ollama risolve l’infrastruttura, ma la qualità del risultato dipende sempre da come scrivi il brief.

Tapez pour chercher dans cours, playbooks, skills, papers…