Radar · 28/07/2026 · modèles

LFM2.5-Encoders sur CPU et Claude Fable 5 stable : l'efficacité prime sur la puissance

Deux choses arrivent ensemble. LiquidAI publie deux encoders, LFM2.5-Encoder-230M et 350M, qui traitent des contextes longs sur CPU à une vitesse 3,7 fois supérieure à ModernBERT-base. Anthropic, de son côté, formalise Claude Fable 5 comme modèle permanent dans les plans Max et Team Premium, à 50% des limites, fermant des semaines de prolongations temporaires (comme nous l’expliquions le 18 juillet).

Pourquoi cela te concerne

Si tu as des tâches qui tournent toute la journée (routage d’intentions, filtres de politique, détecteurs de PII), un encoder fine-tuné sur CPU coûte une fraction d’un LLM cloud et se termine en secondes. LFM2.5-Encoder-230M scanne un contrat complet ou un long fil de support en moins de 30 secondes sur un laptop. Là où ModernBERT-base en prend une minute et demie.

Sur le front des abonnements, la stabilisation de Fable 5 offre à ceux qui utilisent Claude Max ou Team Premium un modèle par défaut fiable. Plus de renégociations mensuelles avec OpenAI pour GPT-5.6 : le choix se déplace du marketing au coût par output vérifié.

Si tu veux l’essayer

Les modèles sont sur Hugging Face avec des démos en direct sur des espaces CPU uniquement : zero-shot prompt routing, policy linting, PII detection en 16 langues.

Dans les détails

Le marché de l’inférence se divise. D’un côté les frontier models (GPT-5.6, Claude Fable 5) rivalisent sur la puissance et le coût par abonnement. De l’autre, des modèles spécialisés et petits, qui tournent sur du matériel que tu as déjà, résolvent des tâches répétitives sans cloud.

LFM2.5-Encoders vient de LiquidAI, pas d’Anthropic. Ce sont deux encoders (230M et 350M paramètres) construits sur l’architecture LFM2, la même que celle des retrievers sortis le mois dernier. Le passage de decoder à encoder s’opère avec trois modifications : attention bidirectionnelle (chaque token regarde à droite et à gauche), convolutions non causales avec padding symétrique, et masked language modeling avec 30% des tokens masqués pendant l’entraînement.

L’entraînement a deux phases. D’abord la compétence générale sur contexte court (1.024 tokens), puis l’adaptation à contexte long (8.192 tokens) sur des données multilingues, légales et factuelles. Sur les benchmarks GLUE et SuperGLUE, LFM2.5-Encoder-350M se classe quatrième sur 14 modèles, surpassant des encoders dix fois plus grands. Le 230M surpasse ModernBERT-base et tout EuroBERT, étant plus petit que la plupart d’entre eux.

La vitesse sur CPU est le point décisif. À 8.192 tokens, ModernBERT-base prend plus de 90 secondes pour une forward pass. LFM2.5-Encoder-230M en prend 28 : 3,7 fois plus rapide. Sur GPU l’avantage existe mais est moindre, et se manifeste seulement au-dessus de 2.000 tokens.

Les démos en direct sur Hugging Face montrent ce que tu peux construire : zero-shot prompt routing (tu définis les lanes en texte libre, le modèle assigne chaque prompt à la bonne en une seule passe), policy linting (tu contrôles un texte contre les règles d’entreprise écrites en langage naturel), correction orthographique token par token, et PII detection avec 40 catégories d’informations personnelles en 16 langues.

Pour ceux qui construisent des agents, cela signifie que les tâches de compréhension de texte (routage, classification, extraction, scoring) peuvent tourner localement, sans latence réseau et sans coût par token. Le placement naturel est à la couche de pré-traitement : d’abord l’encoder décide si le gros modèle est nécessaire, puis le code l’appelle seulement quand c’est utile (comme le fait Cactus Hybrid avec les sondes de confiance).

La stabilité de Fable 5 dans les plans Anthropic répond à une pression différente. GPT-5.6 a imposé un rythme de mises à jour qui force ceux qui gèrent les abonnements à renégocier chaque mois. Fixer Fable 5 comme permanent, même à 50% des limites, donne aux clients enterprise un point de référence stable. Le compromis est clair : moins de capacité par rapport au top, mais prévisibilité.

Les limites : les benchmarks sont déclarés par LiquidAI elle-même, avec un framework open-source mais des mesures internes. Les modèles sont neufs, personne ne les a encore stressés en production sur des charges réelles pendant des semaines. La vitesse sur CPU dépend du processeur spécifique : les chiffres cités sont des moyennes, pas des garanties pour chaque matériel. L’affirmation sur Fable 5 permanent à 50% des limites est confirmée par le texte du 18 juillet mais n’a pas de source primaire parmi les éléments collectés ce tour-ci.

Tapez pour chercher dans cours, playbooks, skills, papers…