Laguna S 2.1: 118B open-weight que supera Claude Fable 5 y cuesta menos que DeepSeek v4 Flash
Poolside AI lanza Laguna S 2.1, un modelo open-weight de 118 mil millones de parámetros totales con arquitectura MoE (8B activos por token), que supera Claude Fable 5 en benchmarks y cuesta menos que DeepSeek v4 Flash. Ventana de contexto de hasta 1 millón de tokens, con modos thinking y no-thinking.
Por qué te importa. Un equipo de menos de 70 investigadores produce un modelo que supera modelos frontier diez veces más grandes. Como contábamos el 20 de julio con Qwen 3.8, la brecha entre modelos abiertos y propietarios se está cerrando: la elección entre ambos se vuelve económica, no técnica. Kimi K3, Qwen 3.8 y ahora Laguna S 2.1 convergen en la misma señal: la compresión de calidad es una tendencia, no un caso aislado.
Para quien usa IA en su trabajo, el costo de una API open-weight ya no es el precio de un modelo débil. Puedes pagar menos y obtener resultados comparables a los frontier en muchas tareas. El cálculo cambia, y vale la pena rehacerlo con tus datos en lugar de quedarte con los rankings de julio.
En detalle
Poolside AI es una neolab fundada por Eiso Kant, quien pasó cuatro años e invirtió 12 millones de dólares construyendo modelos para código antes de que el mercado se diera cuenta. Hoy el equipo tiene menos de 70 investigadores pero ha construido lo que Kant llama “Model Factory”: un sistema end-to-end que lleva un modelo del pre-training al lanzamiento en ocho semanas, con 10.000-20.000 experimentos al mes.
Laguna S 2.1 es un Mixture-of-Experts: 118 mil millones de parámetros totales, pero solo 8 mil millones activos por cada token generado. Es como tener un equipo de especialistas donde para cada pregunta responde solo el experto relevante, en lugar de movilizar todo el departamento. Esto mantiene bajo el costo de inferencia mientras conserva una capacidad general elevada. La ventana de contexto llega a 1 millón de tokens y el modelo ofrece modos thinking (razona antes de responder) y no-thinking (responde directo).
En benchmarks, Laguna S 2.1 supera Claude Fable 5 y el modelo de Thinking Machines (Inkling, 975B parámetros lanzado el 17 de julio), con un modelo casi diez veces más pequeño. Cuesta menos que DeepSeek v4 Flash y supera DeepSeek v4 Pro en calidad.
El contexto importa. El 17 de julio Moonshot AI había lanzado Kimi K3, 2.8T parámetros, el modelo open-weight más grande jamás publicado. Tres días después Alibaba puso en preview Qwen 3.8, 2.4T parámetros. Ambos mostraban que la calidad de los modelos abiertos se aproximaba a los frontier. Poolside añade un tercer dato: ni siquiera necesitas ser enorme. Un 118B MoE bien entrenado, con el pipeline correcto de experimentos, es suficiente.
La parte interesante de la estrategia Poolside es el énfasis en persistencia, verificación y backtracking. Kant sostiene que la capacidad de intentar, verificar y corregir importa más que la inteligencia bruta. Es la misma dirección que vemos en agentes de coding, donde la arquitectura del ciclo de control gana sobre la potencia del modelo individual.
Las limitaciones de lo que sabemos hoy. Los benchmarks citados provienen del tech report de Poolside y de la cobertura de Latent.Space del 23 de julio, no de evaluaciones independientes verificadas. El modelo es open-weight pero aún no tenemos datos de adopción o pruebas en tareas reales fuera del coding. Poolside ha recaudado 500 millones de dólares, así que tiene recursos para sostener la investigación, pero el panorama de modelos abiertos se mueve tan rápido que una ventaja hoy puede durar semanas.
Para quien construye productos sobre un modelo único, la pregunta cambia. Hoy la verdadera pregunta es qué combinación de calidad, costo y licencia te permite dormir tranquilo. Un MoE 118B con 8B activos cuesta poco en cada llamada, y si los pesos son abiertos puedes incluso ejecutarlo en tu propia infraestructura. El punto débil sigue siendo la verificación: mientras los números vengan del laboratorio que construyó el modelo, el consejo es probarlo en tus propias tareas antes de creer en los rankings.