Nativ : vision-LLM en local sur Mac, avec interface graphique et API localhost
Prince Canuma, développeur de la bibliothèque Python MLX-VLM pour exécuter des modèles vision-LLM sur Mac avec le framework MLX d’Apple, a lancé Nativ. C’est une app desktop macOS qui enveloppe MLX dans une interface complète : chat et serveur API sur localhost, avec une forme similaire à LM Studio. L’app reconnaît les modèles MLX déjà présents dans le cache local de Hugging Face, donc tu ne les re-télécharges pas.
Pourquoi ça te concerne. Si tu as un Mac et que tu veux faire lire des images à un modèle sans envoyer tes données sur un cloud, jusqu’à présent tu devais configurer MLX-VLM depuis le terminal. LM Studio et Ollama couvrent bien les modèles de texte en local, mais les vision-LLM (modèles qui combinent texte et images) restaient l’apanage de ceux qui écrivent Python. Nativ apporte le multimodal local à ceux qui préfèrent une interface graphique. C’est la continuité d’une tendance que nous suivons : l’inférence locale se diffuse sur des form factors différents, des modèles 1-bit dans le navigateur à LM Studio Bionic, et maintenant aussi aux vision-LLM.
Si tu veux l’essayer. Le point de départ : télécharge l’app depuis le site du projet et pointe-la vers un modèle MLX déjà téléchargé depuis Hugging Face.
En détail
MLX est le framework open source d’Apple pour le machine learning sur Apple Silicon, conçu pour exploiter la mémoire unifiée des puces M. Contrairement à CUDA, qui nécessite des GPU NVIDIA dédiées, MLX tourne sur n’importe quel Mac avec une puce M1 ou ultérieure. MLX-VLM, toujours de Canuma, est la couche au-dessus : elle prend les modèles vision-linguistiques (architectures comme LLaVA, Idefics, Qwen-VL) et les adapte pour tourner avec MLX. Jusqu’à présent, l’utiliser signifiait installer Python, gérer les dépendances et lancer des scripts depuis le terminal.
Nativ ferme cet écart. L’app détecte les modèles déjà téléchargés dans le dossier de cache de Hugging Face, les liste dans une interface de chat, et offre aussi un endpoint API sur localhost, avec la même logique que LM Studio. Tu peux pointer un autre outil ou un script vers le même port et utiliser le modèle comme si c’était une API cloud, sauf qu’il tourne sur ton Mac et rien ne quitte la machine.
Ce qui change par rapport à LM Studio : LM Studio supporte principalement les modèles de texte au format GGUF via llama.cpp, et a ajouté certaines capacités vision de manière progressive. Nativ part du postulat opposé : elle se construit au-dessus de MLX natif d’Apple et cible les vision-LLM en priorité. Les deux outils peuvent coexister : ceux qui ont déjà des modèles en cache les retrouvent dans les deux.
Le cas d’usage le plus concret est le multimodal local. Tu as un scan de contrat, une capture d’écran d’une interface, une photo d’un produit : tu la donnes au modèle et tu lui demandes d’extraire des données, décrire ce qu’il voit, résumer. Jusqu’à aujourd’hui, le faire sans cloud nécessitait Python et de la patience. Maintenant, il suffit de glisser le fichier dans le chat.
Limites concrètes. L’app est nouvelle et Mac-only : pas de Windows, pas de Linux. La disponibilité des modèles vision au format MLX dépend de qui les convertit, et tous les modèles n’ont pas un équivalent MLX prêt. La qualité de l’inférence locale sur Apple Silicon se maintient pour les modèles petits et moyens, tandis que les modèles frontier restent hors de portée pour la mémoire et la vitesse. Enfin, c’est un projet d’un développeur : le support à long terme dépend de la manière dont la communauté construit dessus.
Pour ceux qui travaillent avec des documents visuels ou des données sensibles et veulent expérimenter avec les vision-LLM sans cloud, c’est la première tentative sérieuse de rendre la chose accessible à ceux qui ne programment pas.