Radar · 26/07/2026 · ocurrido el 23/07/2026 · modelos

LLM de 1 bit en el navegador: la inferencia local se convierte en una página web

Modelos de lenguaje cuantificados a 1 bit se ejecutan directamente en el navegador mediante WebGPU, utilizando la tarjeta gráfica sin un servidor detrás. El modelo se descarga como un asset de la página y la inferencia ocurre en la pestaña abierta.

Hasta ayer, hacer inferencia local significaba instalar algo: Ollama, LM Studio, un runtime de Python. El salto a una página web cambia la distribución. Si construyes herramientas de IA para profesionales que no son ingenieros, el hecho de que el modelo se ejecute en un navegador sin instalación reduce la barrera de entrada.

La cuantificación a 1 bit comprime los pesos del modelo drásticamente: cada peso, en lugar de ocupar 16 u 8 bits, ocupa uno (0 o 1, o -1/0/1 en las variantes ternarias). Un modelo que en FP16 pesa gigabytes se vuelve descargable como asset de una página web. El precio es la calidad: los modelos de 1 bit pierden precisión y por ahora funcionan en tareas simples, no en razonamiento extendido.

Como contábamos el 20 de julio, la primera señal de este cambio ya había surgido. Ahora la tendencia se consolida: las demostraciones se multiplican y el despliegue directo vía página web se convierte en una opción viable para quienes quieren llevar un modelo a manos de usuarios sin hacerles instalar nada.

Escribe para buscar en curso, playbooks, skills, papers…