Radar · 06/08/2026 · fatto del 05/08/2026 · modelli

Castform su Neon: il modello open da 4B pareggia GPT-5.6 Sol sul retrieval a un centesimo del costo

Castform ha addestrato un modello open-weight da 4 miliardi di parametri che eguaglia GPT-5.6 Sol su accuratezza nel retrieval, a un centesimo del costo. Il modello, post-trained con reinforcement learning su infrastruttura Neon, recupera risultati di ricerca con la stessa precisione del frontier di OpenAI.

Perché ti riguarda. Se costruisci pipeline RAG o sistemi agentic con ricerca, il calcolo economico cambia. Una richiesta di ricerca multi-turno con GPT-5.6 Sol impiega oltre 10 secondi e costa circa 0,03 dollari (fonte: Neon, 5 agosto 2026). Un modello piccolo specializzato costa 100 volte meno. Come raccontavamo il 1° agosto, DeepSeek V4-Flash aveva già chiuso il gap con GPT-5.6 Luna sul costo per task. Ora il pattern si ripete su un dominio specifico: il retrieval.

Su compiti specifici come cercare bene in un corpus, un modello da 4B post-trained con RL sui tuoi dati basta e avanza. Il frontier resta necessario dove serve generalità, non dove serve retrieval. Castform trasforma il tuo corpus esistente in dati di addestramento: documenti, wiki, ticket di supporto diventano domande sintetiche e funzioni di reward. Se hai una base di conoscenza aziendale, il tuo dataset di training esiste già.

Se vuoi provarci. Il post di Neon descrive la pipeline end-to-end: parti dal tuo corpus su Postgres, lasci che Castform generi domande e reward dal testo, e addestri un modello che in produzione usa lo stesso search tool imparato in training.

Nel dettaglio

Il pezzo racconta un cambiamento in due fasi che si è già visto altrove, ma qui si compatta in un solo annuncio.

Cosa c’era prima. Nel 2022 l’industria è andata tutta sugli embedding: ogni database ha aggiunto la ricerca vettoriale, e pgvector è diventata l’estensione più scaricata di Neon. Le pipeline RAG classiche facevano una singola query di similarità e passavano il risultato al modello. Nel 2025 gli agenti hanno cominciato a fare ricerca multi-hop: decomporre un problema grande in sotto-query, pianificare, cercare più volte in un loop. Ogni iterazione del loop era una chiamata al modello frontier. Risultato: latenza e costo per richiesta sono saliti. Il post di Neon quantifica il prezzo di questo approccio con GPT-5.6 Sol a oltre 10 secondi e circa 0,03 dollari a richiesta (fonte: blog Neon, 5 agosto 2026).

Cosa cambia. I modelli open-weight medio-piccoli costano un ordine di grandezza in meno, ma fuori dalla scatola sono meno capaci sui compiti agentic. Il post-training con reinforcement learning colma il gap su task specifici. Castform si posiziona qui: rendere il RL post-training accessibile come il prompt engineering, senza gestire GPU e interni di machine learning.

Come funziona la pipeline. Castform parte dal corpus aziendale che vive su Postgres (Neon con Lakebase Search). Usa le estensioni lakebase_text e lakebase_vector per generare dati sintetici: dato un documento, inferisce un ground truth, crea una domanda a cui quel documento dovrebbe rispondere. Il documento diventa il compito, la correttezza della risposta diventa la reward function. Il modello tenta la ricerca, lo score lo guida a migliorare. In produzione usa lo stesso search tool imparato in training.

La mossa interessante è che Castform risolve il problema del dato di addestramento, che è il collo di bottiglia reale. Le aziende hanno corpus proprietari (documentazione interna, record di prodotto, articoli di supporto, interazioni con i clienti) ma non hanno dataset puliti con task e reward pronti. Castform automatizza quella trasformazione.

Limiti. Questo è un post promozionale di Neon e Castform, non un paper peer-reviewed. Il benchmark di accuratezza è specifico al loro setup di retrieval: non sappiamo come si generalizza ad altri domini o ad altri tipi di corpus. Il modello è specialista della ricerca, non sostituisce un modello generale. I 100x di risparmio sono calcolati sul loro caso d’uso specifico (multi-turn search con GPT-5.6 Sol) e dipendono dal pricing attuale delle API, che cambia. La disponibilità di Castform stessa, i costi del training e i requisiti hardware non sono dettagliati nel post.

Per chi vuole misurare da solo se un modello piccolo post-trainato regge contro il proprio frontier di riferimento sul proprio caso, il playbook Confronta due modelli in un quarto d’ora dà la struttura: stesso compito, stessi casi di prova, tabella dei risultati.

Scrivi per cercare fra corso, playbook, skill, paper…