Radar · 25/07/2026 · modèles

Ollama 0.32.4-rc0 : quantification de la LM head, stabilité et Laguna sur MLX

Ollama a publié la release candidate v0.32.4-rc0. C’est une version de maintenance : aucune nouvelle fonctionnalité majeure, mais des corrections qui comptent pour ceux qui utilisent des modèles open-weight sur leur ordinateur.

Le changement le plus visible est la quantification de la LM head à 8 bits. La LM head est la couche finale du modèle, celle qui transforme les nombres internes en paroles. La compresser à 8 bits réduit la mémoire occupée sans dégrader trop la qualité du texte. Si tu as une GPU avec peu de VRAM, ce sont les mégaoctets qui font la différence entre un modèle qui démarre et un qui ne rentre pas.

Deux correctifs de stabilité pour ceux qui exécutent des agentes locaux : une data race sur le scheduler (deux threads lisaient la même structure simultanément, avec des comportements imprévisibles) et le renforcement de tests flaky qui généraient de fausses alertes. Comme nous l’avons expliqué en juillet en parlant du correctif de la fuite mémoire en 0.32.1, la stabilité des sessions longues est le front principal pour ceux qui utilisent Ollama avec des agentes.

Il y a aussi le support Laguna sur MLX : les modèles Laguna de Poolside, dont nous avons parlé du lancement open-weight du 118B, tournent maintenant sur Apple Silicon via Ollama. Et un correctif à la quantification des experts pour Qwen 3.5.

Comme c’est une release candidate, si tu utilises Ollama au quotidien pour le travail, le conseil reste d’attendre la version stable. Si tu veux tester Laguna sur Mac, c’est le moment.

En détail

Qu’est-ce que la LM head et pourquoi la quantification compte.

Un modèle linguistique est composé de nombreuses couches empilées. La dernière, appelée LM head, prend la représentation interne et la projette sur le vocabulaire : pour chaque parole possible, un nombre qui indique sa probabilité d’être la parole suivante. C’est une grande couche, car le vocabulaire d’un modèle moderne va de 30 000 à plus de 100 000 tokens.

Quand tu quantifies un modèle (tu le comprimes de 16 bits à 4 ou 8 bits pour le faire tenir en moins de mémoire), la LM head reste généralement à pleine précision. C’est un choix conservateur : la couche finale est sensible, et la compresser trop peut dégrader la qualité du texte de manière visible. Le PR de Jesse Gross dans cette release quantifie la LM head à 8 bits, un compromis qui divise par deux la mémoire de cette couche par rapport aux 16 bits tout en conservant assez de précision pour ne pas ruiner la sortie.

Pour ceux qui ont une GPU avec 8 ou 12 GB de VRAM, cela peut signifier qu’un modèle qui auparavant ne rentrait pas démarre maintenant. Le bénéfice exact dépend du modèle : la couche finale peut peser plusieurs centaines de mégaoctets dans les modèles avec de grands vocabulaires.

Le correctif de la data race.

Une data race est un bug de programmation concurrente : deux parties du programme lisent et écrivent la même variable sans se coordonner. Le résultat dépend du timing : parfois cela fonctionne, parfois non, et reproduire le bug est difficile.

Le correctif de dhiltgen ferme une data race sur la scheduler loaded map, la structure de données qui trace quels modèles sont chargés en mémoire à un moment donné. Si un agent local demande l’état du système pendant qu’un autre thread charge ou décharge un modèle, la map était lue et écrite simultanément. Dans la plupart des cas rien ne se passait, mais dans les sessions longues avec plusieurs modèles, le risque de comportements imprévisibles était réel.

MLX memory resident.

Sur Mac, Ollama utilise MLX, le framework d’Apple pour l’inférence sur Silicon. Avant ce changement, quand un modèle était déchargé pour libérer de la mémoire, il devait être rechargé de zéro à la prochaine utilisation. Le PR de dhiltgen maintient le modèle résident en mémoire même quand il n’est pas actif, réduisant le temps de redémarrage. Pour ceux qui travaillent avec des agentes qui changent de modèle pendant une session (un petit modèle pour la planification, un grand pour l’exécution), l’économie de temps est concrète.

Laguna sur MLX.

Poolside AI a lancé Laguna S 2.1 comme modèle open-weight le 23 juillet. Jusqu’à présent, le faire tourner sur Mac nécessitait des configurations manuelles. L’ajout du support MLX dans Ollama signifie que tu peux le télécharger et le lancer avec la commande habituelle, sans rien configurer. Le modèle est un MoE avec 118B paramètres au total : il faut un Mac avec de la mémoire unifiée généreuse, au moins 64 GB pour être à l’aise avec la quantification.

Les limites.

C’est une release candidate, pas une version stable. Les correctifs sont dans le changelog et les PR, mais il n’y a pas encore d’adoption large qui confirme l’absence de régressions. Les chiffres sur la mémoire économisée par la quantification de la LM head ne sont pas publiés : le bénéfice exact dépend du modèle spécifique. Si tu l’utilises en production, attends la 0.32.4 stable.

Tapez pour chercher dans cours, playbooks, skills, papers…