MiniMax H3 es el primer modelo open-weight en ganar un ranking de generación de video
MiniMax publicó los pesos de H3, su modelo de generación de video de 33 mil millones de parámetros. Es el primer modelo open-weight en ganar un ranking público de generación de video: Artificial Analysis lo coloca primero en Video Editing, segundo en Text-to-Video, tercero en Image-to-Video.
Hasta ahora, la convergencia entre modelos abiertos y propietarios se limitaba al texto: DeepSeek V4-Flash había igualado a GPT-5.6 Luna con un costo 60% menor. El video seguía siendo territorio de laboratorios con capacidad de cómputo desmedida y modelos cerrados. H3 lleva la generación de video open-weight a una calidad medible, y lo hace con un modelo que procesa texto, imágenes, video y audio juntos, generando clips de 4 a 15 segundos con audio estéreo nativo.
Para quienes producen contenido, lo concreto es el fine-tuning. Puedes entrenar el modelo con tu propio material, tus personajes, tu estilo visual. Con una API cerrada no puedes hacerlo.
Dos componentes permanecen cerrados. El módulo para resolución 2K y H3-Context-IR, el sistema que traduce prompts complejos a un formato estructurado antes de la generación, no están en los pesos. Quien lo ejecute localmente en ComfyUI llega a 768p y debe manejar la preparación del contexto por su cuenta, siguiendo las guías de MiniMax. La licencia permite uso comercial solo para empresas con facturación menor a 20 millones de dólares.
El mismo día, ByteDance lanzó Sora 2.5, un modelo cerrado que genera clips de 30 segundos con audio integrado. La competencia en video generativo no se detuvo para esperar a H3.
En detalle
Hasta H3, los rankings públicos de generación de video eran dominados por modelos propietarios. La calidad medible en benchmarks como VQEG y VMAF era patrimonio de laboratorios que no publican sus pesos. El open-weight en video existía (SANA-Video de NVlabs, por ejemplo), pero aún no había llegado a la cima de una clasificación pública.
H3 es un modelo omnimodal de 33 mil millones de parámetros. Acepta como entrada una combinación de texto, imágenes, video y audio, y produce como salida un clip de video con audio estéreo a 32 kHz. Un único prompt puede incluir hasta 9 imágenes de referencia, 3 clips de video y 3 clips de audio, para un máximo de 12 archivos totales. La duración de la salida va de 4 a 15 segundos, a 24 fotogramas por segundo.
El sistema completo tiene tres módulos. H3-Context-IR es el preprocesador: toma prompts complejos y material de referencia, los interpreta y los convierte en una representación intermedia estructurada que el modelo de generación puede usar. MiniMax lo describe como crítico para la calidad del resultado, pero no lo incluye en los pesos abiertos porque depende de un pipeline de modelos y servicios alojados. Proporciona una API para reproducir su comportamiento y guías detalladas para construir uno propio.
H3-Base es el modelo generativo real. A partir de los pesos abiertos produce salida a 768p de resolución. Es lo que descargas de Hugging Face y puedes ejecutar localmente a través de Diffusers o ComfyUI.
H3-Regenerate-2K es el módulo de upscaling que lleva el resultado a 2K aprovechando tanto las capacidades generativas de H3 como la información del contexto original. Esto también permanece cerrado.
Quien descargue los pesos hoy tiene H3-Base. Para obtener resultados comparables a los de los rankings, debe construir su propio pipeline de preparación del contexto siguiendo las guías publicadas por MiniMax, o llamar a la API de H3-Context-IR como servicio.
La licencia comunitaria permite uso comercial para quien factura menos de 20 millones de dólares. Por encima de ese umbral se requiere un acuerdo comercial separado. Es una restricción ya vista en modelos abiertos chinos: pesos disponibles, pero con un techo de facturación que excluye a las grandes empresas.
En el frente de la competencia, ByteDance lanzó Sora 2.5 el mismo día. Modelo cerrado, clips de 30 segundos con audio integrado. El mensaje es claro: el video generativo es un frente de competencia feroz, y quien abre los pesos lo hace por estrategia, no por generosidad.