Radar · 28/07/2026 · modelli

LFM2.5-Encoders su CPU e Fable 5 stabile: l'efficienza vince sulla potenza

Due cose succedono insieme. LiquidAI pubblica due encoder, LFM2.5-Encoder-230M e 350M, che processano contesti lunghi su CPU a una velocità 3,7 volte superiore a ModernBERT-base. Anthropic, dal canto suo, formalizza Claude Fable 5 come modello permanente nei piani Max e Team Premium, al 50% dei limiti, chiudendo settimane di proroghe temporanee (come raccontavamo il 18 luglio).

Perché ti riguarda

Se hai compiti che girano tutto il giorno (router di intenti, filtri di policy, rilevatori di PII), un encoder fine-tuned su CPU costa una frazione di un LLM cloud e chiude in secondi. LFM2.5-Encoder-230M scansiona un contratto intero o un thread di supporto lungo in meno di 30 secondi su un laptop. Dove ModernBERT-base impiega un minuto e mezzo.

Sul fronte abbonamenti, la stabilizzazione di Fable 5 dà a chi usa Claude Max o Team Premium un modello default affidabile. Niente più rinegoziazioni mensili con OpenAI per GPT-5.6: la scelta si sposta dal marketing al costo per output verificato.

Se vuoi provarci

I modelli sono su Hugging Face con demo live in spazi CPU-only: zero-shot prompt routing, policy linting, PII detection in 16 lingue.

Nel dettaglio

Il mercato dell’inferenza si sta biforcando. Da una parte i frontier model (GPT-5.6, Claude Fable 5) competono sulla potenza e sul costo per abbonamento. Dall’altra, modelli specializzati e piccoli, che girano su hardware che hai già, risolvono compiti ripetitivi senza cloud.

LFM2.5-Encoders nasce da LiquidAI, non da Anthropic. Sono due encoder (230M e 350M parametri) costruiti sull’architettura LFM2, la stessa dei retriever rilasciati il mese scorso. Il passaggio da decoder a encoder avviene con tre modifiche: attention bidirezionale (ogni token guarda sia a destra che a sinistra), convoluzioni non causali con padding simmetrico, e masked language modeling con il 30% dei token nascosti durante il training.

Il training ha due fasi. Prima competenza generale su contesto corto (1.024 token), poi adattamento a contesto lungo (8.192 token) su dati multilingue, legali e fattuali. Sui benchmark GLUE e SuperGLUE, LFM2.5-Encoder-350M si classifica quarto su 14 modelli, battendo encoder dieci volte più grandi. Il 230M batte ModernBERT-base e ogni EuroBERT, essendo più piccolo della maggior parte di loro.

La velocità su CPU è il punto decisivo. A 8.192 token, ModernBERT-base impiega oltre 90 secondi per forward pass. LFM2.5-Encoder-230M ne impiega 28: 3,7 volte più veloce. Su GPU il vantaggio esiste ma è minore, e si manifesta solo sopra i 2.000 token.

Le demo live su Hugging Face mostrano cosa puoi costruire: zero-shot prompt routing (definisci le lane come testo libero, il modello assegna ogni prompt alla giusta in una sola passata), policy linting (controlla un testo contro le regole aziendali scritte in linguaggio naturale), spell checking token per token, e PII detection con 40 categorie di informazioni personali in 16 lingue.

Per chi costruisce agenti, questo significa che i compiti di comprensione del testo (routing, classificazione, estrazione, scoring) possono girare in locale, senza latenza di rete e senza costo per token. Il collocamento naturale è nello strato di pre-processing: prima l’encoder decide se serve il modello grande, poi lo chiama solo quando serve (come fa Cactus Hybrid con le sonde di confidenza).

La stabilità di Fable 5 nei piani Anthropic risponde a una pressione diversa. GPT-5.6 ha imposto un ritmo di aggiornamenti che costringe chi gestisce abbonamenti a rinegoziare ogni mese. Fissare Fable 5 come permanente, anche al 50% dei limiti, dà ai clienti enterprise un punto di riferimento stabile. Il trade-off è chiaro: meno capacità rispetto al top, ma prevedibilità.

I limiti: i benchmark sono dichiarati da LiquidAI stessa, con framework open-source ma misurazioni interne. I modelli sono nuovi, nessuno li ha ancora stressati in produzione su carichi reali per settimane. La velocità su CPU dipende dal processore specifico: i numeri citati sono medie, non garanzie per ogni hardware. L’affermazione su Fable 5 permanente al 50% dei limiti è confermata dal pezzo del 18 luglio ma non ha una fonte primaria tra gli item raccolti in questo giro.

Scrivi per cercare fra corso, playbook, skill, paper…