Radar · 23/07/2026 · modelos

Petals: LLM de 405B en casa, repartido en GPU compartida

Petals ejecuta modelos de lenguaje grandes en local distribuyendo pesos entre dispositivos, al estilo BitTorrent. Cargas una porción del modelo en tu GPU de consumidor, te conectas a una red de gente que sirve las otras porciones, y usas el modelo completo.

La diferencia respecto a una API cloud es el control: accedes al modelo en PyTorch, puedes hacer fine-tuning, seguir caminos personalizados, leer los hidden states. La diferencia respecto a una instalación local aislada es que no necesitas un cluster de GPUs.

Los modelos abiertos siguen creciendo en tamaño, como el Kimi K3 de 2,8T parámetros lanzado en julio. Petals aborda el problema simétrico: cómo los ejecutas sin un data center. En el sitio del proyecto declaran hasta 6 tokens por segundo para Llama 2 70B y 4 para Falcon 180B, suficientes para un chatbot interactivo.

El compromiso es la dependencia de la red. Si los pares que sirven las porciones críticas se desconectan, el modelo se ralentiza. Y la velocidad declarada aplica para single-batch inference, no para cargas de trabajo pesadas.

Si quieres probarlo

El notebook de Colab enlazado en el sitio de Petals es el punto de partida más rápido, sin instalación local.

En detalle

La inferencia local está tomando caminos distintos. Hay quien cuantiza modelos a 1 bit para hacerlos correr en una página web, reduciendo el modelo hasta que cabe en un único dispositivo. Petals toma el camino opuesto: mantiene el modelo en sus dimensiones originales y distribuye la carga de cómputo.

El mecanismo funciona así. Un modelo de lenguaje es una secuencia de capas (layers), cada una con sus pesos. En una instalación normal, todas las capas están en la misma máquina. Con Petals, cada dispositivo de la red carga un grupo de capas. Cuando generas texto, tu GPU calcula las primeras capas, pasa el resultado intermedio al dispositivo siguiente, que calcula sus capas, y así hasta el final. El resultado final vuelve a ti.

Es el mismo principio de BitTorrent, pero aplicado al cómputo en lugar de la transferencia de archivos: nadie tiene el modelo completo, pero la red en conjunto lo sirve todo.

Las ventajas prácticas van más allá de la generación de texto. Porque accedes al modelo a nivel PyTorch y Hugging Face Transformers, puedes aplicar métodos de sampling personalizados, ejecutar fine-tuning, o inspeccionar los hidden states. En una API cloud estas cosas no están disponibles: solo recibes el texto generado. Para quien investiga o experimenta técnicas de post-training, tener un modelo de cientos de miles de millones de parámetros accesible a este nivel cambia el tipo de experimentos posibles.

Los límites son concretos. La latencia depende de la red de pares: si quien sirve las capas críticas se desconecta, el modelo se ralentiza o se bloquea. Las velocidades declaradas en el sitio de Petals (6 tokens/seg para Llama 2 70B, 4 para Falcon 180B) aplican para single-batch inference, es decir, una solicitud a la vez. No está pensado para servir tráfico concurrente, y la dependencia de la red lo hace inadecuado para cargas de producción estables.

La seguridad es un punto abierto. Confías en que los pares de la red calculen los pesos correctamente: un par malicioso podría alterar los resultados intermedios sin que te des cuenta. Es un compromiso distinto al de una API cloud, donde el proveedor garantiza la integridad del cómputo.

Petals es parte del taller de investigación BigScience, el proyecto que produjo BLOOM (176B), uno de los primeros modelos abiertos de gran tamaño. El enfoque distribuido tiene sentido en un momento en que los modelos open-weight crecen rápidamente: cuando el modelo más grande lanzado abiertamente pasa de 176B a 2,8T de parámetros en pocos años, la distribución de la carga se convierte en una necesidad concreta para quien quiere ejecutarlos en privado.

Para quien está dispuesto a aceptar la fragilidad de la red a cambio de control sobre sus datos, Petals es una opción que antes no existía. Para quien necesita estabilidad y throughput, las APIs cloud siguen siendo la opción correcta.

Escribe para buscar en curso, playbooks, skills, papers…