Modèles en local : Ollama et LM Studio, quand ça a vraiment du sens
- pour démarrer
- un ordinateur avec au moins 8-16 Go de RAM · téléchargement gratuit · ni compte ni clé
- quand le choisir
- Des données qui ne peuvent pas sortir, des volumes qui rendraient chère n'importe quelle API, ou l'envie de comprendre ce qu'il y a dessous.
- site officiel
- ollama.com
tarifs
| offre | vérifié le | |
|---|---|---|
| Ollama | gratuit et open source ; minimum déclaré 8 Go de RAM pour les modèles 7B, 16 Go pour les 13B | 19/07/2026 |
| LM Studio | gratuit pour usage personnel ; 16 Go de RAM et un GPU d'au moins 4 Go recommandés | 19/07/2026 |
Les modèles à poids ouverts dont le radar parle souvent peuvent se télécharger et tourner sur votre ordinateur, gratuitement et sans envoyer un octet dehors. Les deux outils qui ont rendu la chose accessible sont Ollama (depuis le terminal : une commande pour télécharger un modèle, une pour lui parler) et LM Studio (une application avec interface : catalogue, téléchargements, chat, tout cliquable). Les deux gratuits.
La bonne question d’abord : pourquoi ?
Trois raisons tiennent, les autres en général non. Les données qui ne peuvent pas sortir : avec un modèle local, le texte ne quitte pas la machine, fin de la discussion sur le cloud et les politiques. Les volumes : si une tâche broie des millions de tokens par jour, même l’API la moins chère finit par compter, et un modèle local amortit le matériel. Comprendre : faire tourner un modèle chez soi apprend plus sur la nature de ces systèmes que dix articles. Si en revanche vous cherchez seulement la qualité maximale, la réponse honnête est que les modèles de frontière ne tournent pas sur un portable : le local se choisit pour les contraintes, et la qualité s’achète en taille de modèle, donc en matériel.
Ce qu’il faut vraiment
La variable est la taille du modèle, et la mémoire est le goulot. Les chiffres déclarés par les projets : Ollama indique 8 Go de RAM pour les modèles de 7 milliards de paramètres, 16 pour les 13B, 32 pour les 33B (dépôt officiel, vérifié le 19/07/2026) ; LM Studio recommande 16 Go de RAM et au moins 4 Go de GPU (exigences officielles, même date). En pratique : un portable récent avec 16 Go fait bien tourner les petits modèles (jusqu’à ~14B quantifiés), aujourd’hui étonnamment capables sur des tâches bien bornées ; les gros (70B et plus) veulent des stations à 48-64 Go ou des GPU dédiés, et là le calcul se fait contre le coût des API.
Comment ils se combinent avec le reste
La partie intéressante : les outils locaux parlent la même langue que les API. LM Studio et Ollama exposent un endpoint compatible, donc un agent comme OpenCode peut utiliser le modèle local comme moteur, et la méthode de vos cas reste identique : même banc d’essai, modèle local à la place du distant, et vous voyez de vos yeux si, pour votre tâche, ça suffit.
Les limites, dites franchement
La qualité par gigaoctet est la vraie taxe : un modèle qui tient dans 16 Go n’est pas un modèle de frontière, et sur les tâches ouvertes la différence se sent. La vitesse sur CPU pur est modeste ; l’expérience fluide veut un GPU ou un Mac à mémoire unifiée. Et la maintenance est la vôtre : versions, quantifications, mises à jour.
Contrôle : fiche descriptive ; exigences matérielles vérifiées sur les sources officielles le 19/07/2026, aucune procédure opérationnelle incluse. Le tour complet sur une machine aux spécifications déclarées (comme le demande le plan éditorial) reste à faire : ce conteneur n’est pas la bonne machine pour un chiffre honnête de tokens par seconde.