Ollama 0.32.4-rc0: quantizzazione LM head, stabilità e Laguna su MLX
Ollama ha pubblicato la release candidata v0.32.4-rc0. È una versione di manutenzione: nessuna funzionalità nuova di rilievo, ma correzioni che contano per chi usa modelli open-weight sul proprio computer.
Il cambiamento più visibile è la quantizzazione dell’LM head a 8 bit. L’LM head è il layer finale del modello, quello che trasforma i numeri interni in parole. Comprimerlo a 8 bit riduce la memoria occupata senza degradare troppo la qualità del testo. Se hai una GPU con poca VRAM, sono i megabyte che fanno la differenza fra un modello che parte e uno che non entra.
Due fix di stabilità per chi fa girare agenti locali: una data race sul scheduler (due thread che leggevano la stessa struttura contemporaneamente, con comportamenti imprevedibili) e il rafforzamento di test flaky che generavano falsi allarmi. Come raccontavamo a luglio parlando del fix del memory leak in 0.32.1, la stabilità delle sessioni lunghe è il fronte principale per chi usa Ollama con gli agenti.
C’è poi il supporto Laguna su MLX: i modelli Laguna di Poolside, di cui abbiamo raccontato il rilascio open-weight del 118B, ora girano su Apple Silicon via Ollama. E un fix alla quantizzazione degli esperti per Qwen 3.5.
Essendo una release candidata, se usi Ollama per lavoro quotidiano il consiglio resta di aspettare la stabile. Se vuoi provare Laguna su Mac, è il momento di testare.
Nel dettaglio
Cos’è l’LM head e perché la quantizzazione conta.
Un modello linguistico è fatto di molti layer impilati. L’ultimo, chiamato LM head, prende la rappresentazione interna e la proietta sul vocabolario: per ogni parola possibile, un numero che indica quanto è probabile come prossima parola. È un layer grande, perché il vocabolario di un modello moderno va da 30mila a oltre 100mila token.
Quando quantizzi un modello (lo comprimi da 16 bit a 4 o 8 bit per farlo stare in meno memoria), l’LM head di solito resta a piena precisione. È una scelta conservativa: il layer finale è sensibile, e comprimerlo troppo può degradare la qualità del testo in modo visibile. Il PR di Jesse Gross in questa release quantizza l’LM head a 8 bit, un compromesso che dimezza la memoria di quel layer rispetto ai 16 bit mantenendo abbastanza precisione da non rovinare l’output.
Per chi ha una GPU con 8 o 12 GB di VRAM, questo può significare che un modello che prima non entrava ora parte. Il beneficio esatto dipende dal modello: il layer finale può pesare centinaia di megabyte nei modelli con vocabolari grandi.
Il fix della data race.
Una data race è un bug di programmazione concorrente: due parti del programma leggono e scrivono la stessa variabile senza coordinarsi. Il risultato dipende dal timing: a volte funziona, a volte no, e riprodurre il bug è difficile.
Il fix di dhiltgen chiude una data race sulla scheduler loaded map, la struttura dati che traccia quali modelli sono caricati in memoria in un dato momento. Se un agente locale chiede lo stato del sistema mentre un altro thread sta caricando o scaricando un modello, la mappa veniva letta e scritta simultaneamente. Nella maggior parte dei casi non succedeva niente, ma in sessioni lunghe con più modelli il rischio di comportamenti imprevedibili era reale.
MLX memory resident.
Su Mac, Ollama usa MLX, il framework di Apple per l’inferenza su Silicon. Prima di questo cambio, quando un modello veniva scaricato per liberare memoria, doveva essere ricaricato da zero al prossimo uso. Il PR di dhiltgen mantiene il modello residente in memoria anche quando non è attivo, riducendo il tempo di riavvio. Per chi lavora con agenti che cambiano modello durante una sessione (un modello piccolo per la pianificazione, uno grande per l’esecuzione), il risparmio di tempo è concreto.
Laguna su MLX.
Poolside AI ha rilasciato Laguna S 2.1 come modello open-weight il 23 luglio. Fino ad ora, farlo girare su Mac richiedeva setup manuali. L’aggiunta del supporto MLX in Ollama significa che puoi scaricarlo e avviarlo con il solito comando, senza configurare nulla. Il modello è un MoE da 118B parametri totali: serve un Mac con memoria unificata generosa, almeno 64 GB per stare comodi con la quantizzazione.
I limiti.
È una release candidata, non una stabile. I fix sono nel changelog e nei PR, ma non c’è ancora un’adozione ampia che confermi l’assenza di regressioni. I numeri sulla memoria risparmiata dalla quantizzazione dell’LM head non sono pubblicati: il beneficio esatto dipende dal modello specifico. Se lo usi in produzione, aspetta la 0.32.4 stabile.