Circles y Qwen3.8-Max: los modelos frontier en producción hablan con números
OpenAI publica los números de Circles, operador MVNO que usa la API OpenAI y Codex para personalizar la experiencia de los clientes en telecomunicaciones. El resultado declarado: +22% de ARPU y -9% de churn, con eficiencia de desarrollo mejorada. Son las métricas con las que una empresa decide si una tecnología se queda o se va.
El mismo día, Alibaba abre los pesos de Qwen3.8-Max, el modelo de 2.4T parámetros del que contamos su llegada a los stacks USA. Dos señales en paralelo: un case study de negocio con números reales y un frontier abierto con licencia MIT que entra en el flujo de trabajo de quien construye.
Por qué te importa. Los modelos, abiertos y propietarios, dejan de ser una apuesta y se convierten en una línea del estado de resultados. Si tu organización evalúa la adopción de IA, la pregunta correcta es qué indicador de negocio se mueve cuando lo pones en producción. Los benchmarks dicen poco sobre esto. Circles midió ARPU y churn. Qwen3.8-Max da a quien tiene restricciones de costo o soberanía de datos una opción competitiva y descargable.
Los dos caminos se suman. La elección se vuelve operativa.
Si quieres intentarlo: identifica un proceso donde puedas medir un indicador de negocio antes y después de introducir IA. Sin ese número, estás en marketing.
En detalle
El case study de Circles es interesante porque OpenAI rara vez publica números de negocio tan concretos. Circles es un MVNO (operador virtual de red móvil) activo en mercados asiáticos. Usa la API OpenAI y Codex para personalizar la experiencia del usuario, automatizar parte del desarrollo de software y gestionar el soporte al cliente.
Los números declarados:
- +22% ARPU: cada cliente genera en promedio una quinta parte más de ingresos.
- -9% churn: la tasa de abandono cae cerca de una décima parte.
- Eficiencia de desarrollo mejorada: OpenAI no cuantifica cuánto, y este es el primer límite de la fuente.
Los datos provienen de la página oficial del case study, por lo que deben leerse como material de marketing parcial. Ninguna métrica va acompañada de metodología de medición, período de referencia o grupo de control. Para quien toma decisiones, la señal es interesante pero la prueba falta: un +22% ARPU podría incluir factores que no tienen nada que ver con IA.
En el otro frente, Qwen3.8-Max es el segundo modelo chino abierto en dos semanas en entrar a los stacks operativos USA, después de Kimi K3 servido vía API Telnyx. Alibaba prometió los pesos para la semana siguiente al anuncio del 3 de agosto, con licencia MIT. El modelo es una mezcla de expertos de 2.4T parámetros totales, 95B activos por token, ventana de contexto de 1M de tokens. Los benchmarks reportados (PaperBench 93.0, CoWorkBench 74.8) lo ubican en la gama de los frontier propietarios, pero son auto-reportados y deben tomarse con precaución.
La convergencia que importa es esta: un operador real documenta un impacto financiero medible, y al mismo tiempo un modelo abierto con capacidades de frontier se vuelve descargable. Para quien evalúa la adopción de IA en la empresa, significa tener tanto un case de negocio de referencia como una opción que no vincula al lock-in de un único proveedor.
Los límites siguen siendo fuertes en ambos lados. El case study de Circles es de fuente única y no independiente: un seguimiento de terceros sería útil. Los benchmarks de Qwen son del fabricante. El tamaño de Qwen3.8-Max (2.4T parámetros) lo hace no ejecutable en local para casi todas las organizaciones: requiere infraestructura de inferencia dedicada o un proveedor API. Alibaba ofrece la API a 2 dólares por millón de tokens de entrada y 6 de salida, con caché a 0,25 dólares, pero la tarifa sola no es suficiente para decidir sin haber probado la calidad en tu caso.
La lección operativa para quien lee: cuando evalúes el impacto de IA en tu trabajo, pide los números de negocio y pide cómo fueron medidos. Un case study sin metodología es una anécdota. Y un modelo abierto de 2.4T parámetros es una oportunidad concreta solo si tienes el compute para usarlo, o si lo sirves vía API a un costo que tiene sentido para tu volumen real.