Kimi K3: 2.8T parámetros, el modelo abierto más grande jamás lanzado, precios chinos al alza
Moonshot AI ha lanzado Kimi K3, un modelo MoE con 2.8 billones de parámetros totales y 50 mil millones activos, el modelo open-weight más grande jamás publicado. La licencia Apache 2.0 lo hace disponible para self-hosting y uso comercial. En las primeras pruebas independientes contra inyección de prompts, el modelo respondió con un escueto «Is there something I can actually help you with today?» en lugar de ceder.
El desempeño reportado lo coloca cerca de GPT-5.6 Sol y Claude Fable 5 en SWE-bench y tareas de coding complejas, y los precios de API ya no son regalados: el input cuesta lo mismo que el tier superior de Meta (Muse Spark), el output el doble. Es una señal: China sale de la categoría de modelos con precios dumping y compite por valor, no solo por costo.
Por qué te importa. Si trabajas con modelos self-hosted, K3 es el primero abierto con desempeño de frontera que puedes ejecutar en tu propia infraestructura. Si usas APIs, los precios señalan que el mercado chino comienza a posicionarse como alternativa seria a los labs estadounidenses, no solo como proveedor de masas a bajo costo. Las decisiones técnicas (arquitectura MoE, contexto largo) replican las de los modelos propietarios más recientes, y el lanzamiento Apache intensifica la presión competitiva para que otros labs liberen pesos abiertos.
En detalle
El contexto.
Hasta hoy, los modelos open-weight más allá del billón de parámetros eran experimentos de investigación (Grok 1, lanzado por xAI en marzo de 2024, tenía 314 mil millones) o variantes destiladas de modelos más grandes. K3 es el primer modelo de su escala lanzado como producto completo con licencia permisiva.
Moonshot AI es la compañía detrás del asistente Kimi, popular en China por su ventana de contexto larga (originalmente 200k tokens, luego extendida). K3 es la tercera generación de la familia, después de K1 (2023) y K2 (inicio de 2025). El nombre del modelo sigue la convención interna de la empresa.
Los números anunciados.
K3 usa una arquitectura Mixture of Experts (MoE): 2.8T parámetros totales, pero solo 50B activos para inferencia. Esto reduce los requisitos de memoria y latencia comparado con un modelo denso de la misma capacidad nominal. El contexto nativo es 1M tokens, alineado con los modelos de frontera recientes (Gemini 2.5, GPT-5.6).
Los benchmarks reportados por Moonshot colocan K3 por encima de Claude Opus 4.8 en AIME (matemáticas) e igual a GPT-5.6 Sol en SWE-bench Verified (coding en producción). Aún no hay evaluaciones independientes a gran escala, pero las primeras pruebas de la comunidad confirman que el modelo no falla en tareas complejas.
Los precios de API son $1.50/millón de tokens en input y $6/millón en output (verificado en el pricing oficial al 17 de julio de 2026). Para comparar: GPT-5.6 Sol cuesta $3/$15, Claude Fable 5 $3/$15, Muse Spark 1.1 $1.50/$3. K3 se posiciona en el medio: input como Meta, output el doble. Ya no es el precio chino que todos conocían (DeepSeek v3 estaba a $0.14/$0.28), sino un precio de modelo de gama alta.
Qué cambia.
Primero, la brecha cualitativa se cierra. Los modelos chinos ya no son «casi tan buenos como» los de frontera estadounidenses: en ciertos benchmarks los igualan, y lo hacen con licencias abiertas. Esto cambia el cálculo para quien elige un modelo: si K3 funciona para tu caso de uso, tienes una alternativa self-hosted que no depende de una API extranjera.
Segundo, la guerra de precios cambia de tono. China ha usado el precio como palanca competitiva durante años (modelos abiertos casi gratuitos en API). K3 señala que al menos Moonshot apunta ahora a competir en calidad percibida, no en dumping. Si otros labs chinos siguen, el mercado global se reequilibra: menos carrera al fondo, más diferenciación en desempeño y licencias.
Tercero, la presión sobre otros labs. Anthropic y OpenAI mantienen los pesos cerrados; Meta lanza abiertos pero más pequeños (Llama 4 se detiene en 405B densos, Muse Spark en ~600B MoE). Un modelo abierto de 2.8T parámetros, Apache, que funciona como sus top tiers, es un argumento difícil de ignorar para quienes piden transparencia.
Las limitaciones.
Aún no hay evaluaciones independientes a gran escala: los benchmarks de Moonshot son auto-reportados. La comunidad está probando el modelo, pero tomará semanas tener consenso sobre dónde funciona bien y dónde no. El modelo no es multimodal (solo texto), a diferencia de GPT-5.6 y Gemini 2.5.
Los requisitos de self-hosting son altos incluso con MoE: 50B activos requieren al menos una máquina con 4×A100 o H100 para inferencia fluida, y el costo de setup no es trivial para quien no tiene infraestructura ya. La API es el camino práctico para la mayoría de casos.
Finalmente, el ecosistema: las herramientas e integraciones para K3 aún son inmaduras comparadas con las de GPT o Claude. Si tu flujo depende de herramientas bien consolidadas, cambiar a un modelo nuevo requiere trabajo de adaptación.