Modelos en local: Ollama y LM Studio, cuándo tiene sentido de verdad
- para empezar
- un ordenador con al menos 8-16 GB de RAM · descarga gratuita · sin cuenta y sin clave
- cuándo elegirla
- Datos que no pueden salir, volúmenes que encarecerían cualquier API, o las ganas de entender qué hay debajo.
- sitio oficial
- ollama.com
precios
| plan | verificado el | |
|---|---|---|
| Ollama | gratuito y open source; mínimo declarado 8 GB de RAM para modelos 7B, 16 GB para 13B | 19/07/2026 |
| LM Studio | gratuito para uso personal; recomendados 16 GB de RAM y una GPU con al menos 4 GB | 19/07/2026 |
Los modelos open-weight de los que habla a menudo el radar se pueden descargar y hacer correr en tu ordenador, gratis y sin mandar un byte fuera. Las dos herramientas que lo hicieron accesible son Ollama (desde la terminal: un comando para descargar un modelo, otro para hablar con él) y LM Studio (una aplicación con interfaz: catálogo, descargas, chat, todo clicable). Ambas gratuitas.
La pregunta correcta primero: ¿por qué?
Tres razones aguantan, las demás normalmente no. Los datos que no pueden salir: con un modelo local el texto no abandona la máquina, fin de la discusión sobre nube y políticas. Los volúmenes: si una tarea tritura millones de tokens al día, hasta la API más barata suma, y un modelo local amortiza el hardware. El entender: hacer correr un modelo en casa enseña sobre la naturaleza de estos sistemas más que diez artículos. Si en cambio solo buscas la calidad máxima, la respuesta honesta es que los modelos de frontera no corren en un portátil: lo local se elige por las restricciones, y la calidad se compra en tamaño del modelo y por tanto en hardware.
Qué hace falta de verdad
La variable es el tamaño del modelo, y la memoria es el cuello de botella. Los números declarados por los proyectos: Ollama indica 8 GB de RAM para los modelos de 7 mil millones de parámetros, 16 para los 13B, 32 para los 33B (repo oficial, verificado el 19/07/2026); LM Studio recomienda 16 GB de RAM y al menos 4 GB de GPU (requisitos oficiales, misma fecha). La práctica: un portátil reciente con 16 GB hace correr bien los modelos pequeños (hasta ~14B cuantizados), hoy sorprendentemente capaces en tareas delimitadas; los grandes (70B en adelante) quieren estaciones con 48-64 GB o GPUs dedicadas, y ahí la cuenta se hace contra el coste de las APIs.
Cómo se combinan con el resto
La parte interesante es que las herramientas locales hablan el mismo idioma que las APIs: LM Studio y Ollama exponen un endpoint compatible, así que un agente como OpenCode puede usar el modelo local como motor, y el método de tus casos queda idéntico: mismo banco de pruebas, modelo local en lugar del remoto, y ves con tus ojos si para tu tarea basta.
Los límites, dichos claros
La calidad por gigabyte es el impuesto real: un modelo que cabe en 16 GB no es un modelo de frontera, y en tareas abiertas la diferencia se nota. La velocidad en CPU pura es modesta; la experiencia fluida quiere una GPU o un Mac con memoria unificada. Y el mantenimiento es tuyo: versiones, cuantizaciones, actualizaciones.
Verificación: ficha descriptiva; requisitos de hardware verificados en las fuentes oficiales el 19/07/2026, sin procedimientos operativos incluidos. La vuelta completa en una máquina con especificaciones declaradas (como pide el plan editorial) queda pendiente: este contenedor no es la máquina adecuada para un número honesto de tokens por segundo.