Radar · 03/08/2026 · modèles

MiniMax H3 est le premier modèle open-weight à remporter un classement de génération vidéo

MiniMax a publié les poids de H3, son modèle de génération vidéo de 33 milliards de paramètres. C’est le premier modèle open-weight à remporter un classement public de génération vidéo : Artificial Analysis le place premier en Video Editing, deuxième en Text-to-Video, troisième en Image-to-Video.

Jusqu’à présent, la convergence entre modèles ouverts et modèles propriétaires concernait le texte : DeepSeek V4-Flash avait égalé GPT-5.6 Luna à un coût inférieur de 60%. La vidéo restait le territoire des labs disposant d’une puissance de calcul démesurée et de modèles fermés. H3 porte l’open-weight dans la génération vidéo à une qualité mesurable, et le fait avec un modèle qui traite le texte, les images, les vidéos et l’audio ensemble, générant des clips de 4 à 15 secondes avec audio stéréo natif.

Pour les producteurs de contenu, l’aspect concret est le fine-tuning. Tu peux entraîner le modèle sur tes vidéos, tes personnages, ton style visuel. Avec une API fermée, tu ne le fais pas.

Deux éléments restent fermés. Le module pour la résolution 2K et H3-Context-IR, le système qui traduit les prompts complexes en un format structuré avant la génération, ne sont pas dans les poids. Celui qui le fait tourner localement sur ComfyUI atteint 768p et doit gérer la préparation du contexte lui-même, en suivant les guides de MiniMax. La licence ne permet l’usage commercial que pour un chiffre d’affaires inférieur à 20 millions de dollars.

Le même jour, ByteDance a sorti Seedance 2.5, un modèle fermé qui génère des clips de 30 secondes avec audio intégré. La concurrence sur la vidéo générative n’a pas attendu H3.

En détail

Jusqu’à H3, les classements publics de génération vidéo étaient dominés par des modèles propriétaires. La qualité mesurable sur des benchmarks comme VQEG et VMAF était l’apanage de labs qui ne publient pas leurs poids. L’open-weight en vidéo existait (SANA-Video de NVlabs, par exemple), mais n’avait pas encore atteint le sommet d’un classement public.

H3 est un modèle omni-modal de 33 milliards de paramètres. Il accepte en entrée une combinaison de texte, d’images, de vidéos et d’audio, et produit en sortie un clip vidéo avec audio stéréo à 32 kHz. Un simple prompt peut inclure jusqu’à 9 images de référence, 3 clips vidéo et 3 clips audio, pour un maximum de 12 fichiers au total. La durée de la sortie va de 4 à 15 secondes, à 24 images par seconde.

Le système complet a trois modules. H3-Context-IR est le préprocesseur : il prend les prompts complexes et le matériel de référence, les interprète, et les convertit en une représentation intermédiaire structurée que le modèle de génération peut utiliser. MiniMax le décrit comme critique pour la qualité du résultat, mais ne l’inclut pas dans les poids ouverts car il dépend d’un pipeline de modèles et de services hébergés. Il fournit une API pour reproduire son comportement et des guides détaillés pour en construire un soi-même.

H3-Base est le vrai modèle génératif. À partir des poids ouverts, il produit une sortie à 768p. C’est celui que tu télécharges depuis Hugging Face et que tu peux faire tourner localement via Diffusers ou ComfyUI.

H3-Regenerate-2K est le module d’upscaling qui porte le résultat à 2K en exploitant à la fois les capacités génératives de H3 et les informations du contexte original. Celui-ci reste aussi fermé.

Ceux qui téléchargent les poids aujourd’hui ont H3-Base. Pour obtenir des résultats comparables à ceux des classements, ils doivent construire leur propre pipeline de préparation du contexte en suivant les guides publiés par MiniMax, ou appeler l’API de H3-Context-IR comme un service.

La licence communautaire autorise l’usage commercial pour ceux qui font moins de 20 millions de dollars de chiffre d’affaires. Au-delà, un accord commercial séparé est nécessaire. C’est une restriction déjà vue dans les modèles ouverts chinois : les poids sont disponibles, mais avec un plafond de chiffre d’affaires qui exclut les grandes entreprises.

Sur le front de la concurrence, ByteDance a lancé Seedance 2.5 le même jour. Modèle fermé, clips de 30 secondes avec audio intégré. Le message est clair : la vidéo générative est un front sur lequel on se concurrence durement, et ceux qui ouvrent les poids le font par stratégie, pas par générosité.

Tapez pour chercher dans cours, playbooks, skills, papers…