Radar · 21/07/2026 · modelos

Nativ: vision-LLM en local en tu Mac, con interfaz gráfica y API localhost

Prince Canuma, desarrollador de la librería Python MLX-VLM para ejecutar modelos vision-LLM en Mac con el framework MLX de Apple, ha lanzado Nativ. Es una app de escritorio macOS que envuelve MLX en una interfaz completa: chat y servidor API en localhost, con una forma similar a LM Studio. La app reconoce los modelos MLX ya presentes en la caché local de Hugging Face, así no los descargas de nuevo.

Por qué te importa. Si tienes un Mac y quieres que un modelo lea imágenes sin enviar tus datos a un cloud, hasta ahora tenías que configurar MLX-VLM desde terminal. LM Studio y Ollama cubren bien los modelos de texto en local, pero los vision-LLM (modelos que combinan texto e imágenes) seguían siendo dominio de quien escribe Python. Nativ lleva el multimodal local a quien prefiere una interfaz gráfica. Es la continuación de un hilo que seguimos: la inferencia local se está expandiendo en diferentes formatos, desde modelos de 1 bit en el navegador a LM Studio Bionic, y ahora también en vision-LLM.

Si quieres probarlo. El punto de partida: descarga la app del sitio del proyecto y apúntala a un modelo MLX ya descargado desde Hugging Face.

En detalle

MLX es el framework open source de Apple para machine learning en Apple Silicon, diseñado para aprovechar la memoria unificada de los chips M. A diferencia de CUDA, que requiere GPUs NVIDIA dedicadas, MLX corre en cualquier Mac con chip M1 o posteriores. MLX-VLM, también de Canuma, es la capa encima: toma los modelos vision-lenguaje (arquitecturas como LLaVA, Idefics, Qwen-VL) y los adapta para correr con MLX. Hasta ahora usarlo significaba instalar Python, gestionar dependencias y lanzar scripts desde terminal.

Nativ cierra esa brecha. La app detecta los modelos ya descargados en la carpeta de caché de Hugging Face, los lista en una interfaz de chat, y además ofrece un endpoint API en localhost, con la misma lógica que LM Studio. Puedes apuntar otra herramienta o un script al mismo puerto y usar el modelo como si fuera una API en la nube, solo que corre en tu Mac y nada sale de la máquina.

Qué cambia respecto a LM Studio: LM Studio soporta principalmente modelos de texto en formato GGUF a través de llama.cpp, y ha añadido algunas capacidades vision de forma incremental. Nativ parte del supuesto opuesto: construye sobre MLX nativo de Apple y apunta a los vision-LLM en primer lugar. Las dos herramientas pueden coexistir: quien ya tiene modelos en caché los encuentra en ambas.

El caso de uso más concreto es el multimodal local. Tienes un escaneo de un contrato, una captura de una interfaz, una foto de un producto: se la pasas al modelo y le pides que extraiga datos, describa qué ve, resuma. Hasta hoy, para hacerlo sin cloud necesitabas Python y paciencia. Ahora basta arrastar el archivo al chat.

Limitaciones reales. La app es nueva y solo para Mac: nada de Windows, nada de Linux. La disponibilidad de modelos vision en formato MLX depende de quién los convierte, y no todos los modelos tienen un equivalente MLX listo. La calidad de la inferencia local en Apple Silicon aguanta para modelos pequeños y medianos, mientras que los modelos frontier quedan fuera de alcance por memoria y velocidad. Finalmente, es un proyecto de un desarrollador: el soporte a largo plazo depende de cuánto la comunidad construya sobre él.

Para quien trabaja con documentos visuales o datos sensibles y quiere experimentar con vision-LLM sin cloud, es el primer intento serio de hacer la cosa accesible para quien no programa.

Escribe para buscar en curso, playbooks, skills, papers…