Castform sur Neon : le modèle open de 4B égale GPT-5.6 Sol sur le retrieval à un centième du coût
Castform a entraîné un modèle open-weight de 4 milliards de paramètres qui égale GPT-5.6 Sol en précision sur le retrieval, à un centième du coût. Le modèle, post-trainé avec reinforcement learning sur l’infrastructure Neon, récupère des résultats de recherche avec la même exactitude que la frontier d’OpenAI.
Pourquoi ça t’intéresse. Si tu construis des pipelines RAG ou des systèmes agentic avec recherche, le calcul économique change. Une requête de recherche multi-tour avec GPT-5.6 Sol prend plus de 10 secondes et coûte environ 0,03 dollar (source : Neon, 5 août 2026). Un modèle petit spécialisé coûte 100 fois moins. Comme on l’expliquait le 1er août, DeepSeek V4-Flash avait déjà comblé l’écart avec GPT-5.6 Luna sur le coût par tâche. Maintenant le pattern se répète sur un domaine spécifique : le retrieval.
Sur des tâches spécifiques comme bien chercher dans un corpus, un modèle de 4B post-trainé avec RL sur tes données suffit amplement. La frontier reste nécessaire où il faut de la généralité, pas où il faut du retrieval. Castform transforme ton corpus existant en données d’entraînement : documents, wikis, tickets de support deviennent des questions synthétiques et des fonctions de reward. Si tu as une base de connaissance d’entreprise, ton dataset de training existe déjà.
Si tu veux essayer. Le post de Neon décrit le pipeline end-to-end : tu pars de ton corpus sur Postgres, tu laisses Castform générer des questions et des rewards à partir du texte, et tu entraînes un modèle qui en production utilise le même search tool appris en training.
En détail
L’article raconte un changement en deux phases qu’on a déjà vus ailleurs, mais qui se concentre ici en une seule annonce.
Ce qu’il y avait avant. En 2022 l’industrie s’est tournée vers les embeddings : chaque base de données a ajouté la recherche vectorielle, et pgvector est devenue l’extension la plus téléchargée de Neon. Les pipelines RAG classiques faisaient une seule requête de similarité et passaient le résultat au modèle. En 2025 les agentsont commencé à faire de la recherche multi-hop : décomposer un gros problème en sous-requêtes, planifier, chercher plusieurs fois dans une boucle. Chaque itération de la boucle était un appel au modèle frontier. Résultat : la latence et le coût par requête ont monté. Le post de Neon quantifie le prix de cette approche avec GPT-5.6 Sol à plus de 10 secondes et environ 0,03 dollar par requête (source : blog Neon, 5 août 2026).
Ce qui change. Les modèles open-weight petit-moyen coûtent un ordre de grandeur moins cher, mais en l’état ils sont moins capables sur les tâches agentic. Le post-training avec reinforcement learning comble l’écart sur des tâches spécifiques. Castform se positionne ici : rendre le RL post-training aussi accessible que le prompt engineering, sans gérer des GPU et les internals du machine learning.
Comment fonctionne le pipeline. Castform part du corpus d’entreprise qui vit sur Postgres (Neon avec Lakebase Search). Il utilise les extensions lakebase_text et lakebase_vector pour générer des données synthétiques : donné un document, il déduit une vérité terrain, crée une question à laquelle ce document devrait répondre. Le document devient la tâche, la justesse de la réponse devient la fonction de reward. Le modèle tente la recherche, le score le guide à s’améliorer. En production il utilise le même search tool appris en training.
La manœuvre intéressante c’est que Castform résout le problème de la donnée d’entraînement, qui est le vrai goulot. Les entreprises ont des corpus propriétaires (documentation interne, fiches produit, articles d’aide, interactions clients) mais n’ont pas de datasets propres avec des tâches et des rewards prêts. Castform automatise cette transformation.
Limites. C’est un post promotionnel de Neon et Castform, pas un paper évalué par les pairs. Le benchmark de précision est spécifique à leur setup de retrieval : on ne sait pas comment il se généralise à d’autres domaines ou d’autres types de corpus. Le modèle est spécialisé en recherche, il ne remplace pas un modèle général. Les 100x d’économie sont calculés sur leur cas spécifique (recherche multi-turn avec GPT-5.6 Sol) et dépendent de la tarification actuelle des API, qui change. La disponibilité de Castform elle-même, les coûts du training et les prérequis hardware ne sont pas détaillés dans le post.
Pour qui veut mesurer par lui-même si un modèle petit post-trainé tient face à sa frontier de référence sur son propre cas, le playbook Compare deux modèles en un quart d’heure donne la structure : même tâche, mêmes cas de test, tableau des résultats.