Soofi S 30B : modèle souverain allemand-anglais open source
Un consortium de recherche allemand coordonné par le KI Bundesverband a publié Soofi S 30B-A3B, un modèle mixture-of-experts open source (Apache 2.0) entraîné entièrement sur le cloud AI de Deutsche Telekom à Munich. Le modèle contient 31,6 milliards de paramètres mais n’en active que 3,2 par token, maintenant les coûts d’inférence proches d’un modèle de 3B. L’architecture hybride Mamba-Transformer préserve le cache d’inférence quasi constant même sur des contextes longs (jusqu’à 256k tokens), avec un avantage décisif en throughput et concurrence par rapport aux modèles denses.
Pourquoi ça te concerne. Soofi S est le premier modèle ouvert conçu avec une part délibérément élevée d’allemand dans le mix d’entraînement (de 7,2 % à 15,3 % dans les phases suivantes, contre ~5 % des modèles mainstream). Sur les benchmarks agrégés allemand-anglais, il surpasse tous les modèles complètement ouverts, y compris OLMo 3 32B et Apertus 70B, et domine chaque benchmark allemand en comparaison directe. C’est un cas concret de souveraineté numérique : une alternative européenne open source aux modèles américains/chinois, entraînée sur infrastructure européenne avec des données européennes, prête pour le self-hosting. Si tu travailles sur des contenus allemands ou tu cherches un modèle ouvert bilingue compétitif, c’est la première option à essayer.
Si tu veux l’essayer. Le modèle est sur Hugging Face sous soofi-team/soofi-s-30b-a3b. Le rapport complet de prétraining est arXiv 2607.09424.
En détail
Le contexte
La plupart des modèles open source s’entraînent avec des données presque entièrement anglaises : dans les mix de training de référence comme celui de Nvidia Nemotron, toutes les langues non anglaises ensemble pèsent environ 5 %. Le résultat est que les modèles ouverts compétitifs en anglais s’effondrent sur les autres langues, y compris l’allemand, qui est pourtant la langue maternelle de 100 millions de personnes et la plus parlée dans l’UE. Les modèles fermés les plus puissants (GPT, Claude, Gemini) couvrent l’allemand, mais ne sont pas disponibles pour le self-hosting et dépendent des datacenters américains.
Ce qui change
Soofi S est le premier modèle ouvert conçu pour être bilingue dès la prétrainization, avec une part croissante d’allemand atteignant 15,3 % dans la deuxième phase (contre les 5 % typiques). L’entraînement est distribué sur environ 27 trillions de tokens en trois phases : 20T de mix large (web, code, math, domaines), 6T de sources de meilleure qualité pour affiner les patterns, et une troisième phase courte pour étendre le contexte à 1M tokens. L’allemand provient de HPLT, le corpus Commons, FinePDFs, FineWiki, le corpus commercial Genios (193M articles de 916 publications allemandes) et des textes traduits mécaniquement ou générés.
L’architecture est celle de Nvidia Nemotron 3 Nano sans modifications : mixture-of-experts hybride Mamba-2 + attention, 31,6B paramètres totaux, 3,2B actifs par token. Seulement 6 des 52 couches maintiennent un cache KV qui croît avec le contexte ; le reste utilise des états de dimension fixe. L’avantage pratique : à 40k tokens avec 32 requêtes parallèles, Soofi S génère environ huit fois plus de tokens par seconde par GPU comparé aux modèles denses de 14–24B, et le throughput reste plat de 4k à 256k tokens tandis que les modèles denses s’effondrent. Le seul modèle avec un comportement similaire dans le test est Qwen3.5 35B-A3B, aussi hybride.
Les chiffres
Sur les benchmarks agrégés anglais-allemand, Soofi S surpasse tous les modèles complètement open source, y compris OLMo 3 32B (Allen Institute) et Apertus 70B (ETH/EPFL). Sur chaque benchmark allemand en comparaison, Soofi S prend la première place, parfois avec des marges à deux chiffres. En code : 73,8 % HumanEval, 70,2 % MBPP, 84,2 % MBPP-DE (variante allemande), les meilleurs résultats parmi les modèles ouverts. Sur INCLUDE-DE (connaissances régionales allemandes) égale Qwen3.5 35B-A3B à 61,2 points. Par rapport à la baseline Nemotron, la recette de données allemande gagne 15,1 points en langue et 9,6 en GPQA-Diamond (science), sans perdre en anglais. Le point faible est les mathématiques de compétition allemandes (56 points sur Minerva MATH-DE), où il reste sous les leaders.
Les implications
C’est le premier cas d’un modèle open source entraîné entièrement sur cloud européen (Deutsche Telekom, Munich) avec des données pondérées pour une langue non anglaise, qui démontre des performances bilingues compétitives. La licence Apache le rend utilisable en production, même commercialement, sans dépendre d’APIs américaines ou chinoises. Pour qui travaille sur des contenus allemands ou veut un modèle ouvert bilingue self-hostable, c’est la première option à évaluer. Pour qui construit des services sur données européennes, c’est un signal que la souveraineté numérique en IA peut fonctionner sur le plan technique, pas seulement politique.
Les limites
La comparaison est avec des modèles open source : les meilleurs modèles fermés (GPT-5.6, Claude Opus 4.8) restent en tête en absolu. Soofi S a 31,6B paramètres totaux mais n’en active que 3,2B par token : le comportement est plus proche d’un modèle de 3B que d’un de 30B sur des tâches nécessitant toute la capacité en parallèle. Le rapport ne couvre pas les évaluations sur la sécurité, les biais ou la robustesse contre l’injection de prompts. Les mathématiques de compétition en allemand reste un point faible connu.