Castform en Neon: el modelo open de 4B iguala GPT-5.6 Sol en retrieval a una centésima del costo
Castform entrenó un modelo open-weight de 4 mil millones de parámetros que iguala a GPT-5.6 Sol en precisión de retrieval, a una centésima del costo. El modelo, post-entrenado con reinforcement learning en infraestructura Neon, recupera resultados de búsqueda con la misma precisión del frontier de OpenAI.
Por qué te importa. Si construyes pipelines RAG o sistemas agentic con búsqueda, el cálculo económico cambia. Una consulta de búsqueda multi-turno con GPT-5.6 Sol tarda más de 10 segundos y cuesta aproximadamente 0,03 dólares (fuente: Neon, 5 de agosto de 2026). Un modelo pequeño especializado cuesta 100 veces menos. Como contábamos el 1 de agosto, DeepSeek V4-Flash ya había cerrado la brecha con GPT-5.6 Luna en costo por tarea. Ahora el patrón se repite en un dominio específico: el retrieval.
En tareas específicas como buscar bien en un corpus, un modelo de 4B post-entrenado con RL en tus datos es suficiente y sobra. El frontier sigue siendo necesario donde se requiere generalidad, no donde se requiere retrieval. Castform transforma tu corpus existente en datos de entrenamiento: documentos, wikis, tickets de soporte se convierten en preguntas sintéticas y funciones de reward. Si tienes una base de conocimiento corporativa, tu dataset de entrenamiento ya existe.
Si quieres probarlo. El post de Neon describe el pipeline end-to-end: parte de tu corpus en Postgres, deja que Castform genere preguntas y reward del texto, y entrena un modelo que en producción usa la misma herramienta de búsqueda que aprendió durante el entrenamiento.
En detalle
El artículo cuenta un cambio en dos fases que ya se ha visto en otros lados, pero aquí se condensa en un solo anuncio.
Qué había antes. En 2022 toda la industria se fue hacia embeddings: cada base de datos añadió búsqueda vectorial, y pgvector se convirtió en la extensión más descargada de Neon. Los pipelines RAG clásicos hacían una única consulta de similaridad y pasaban el resultado al modelo. En 2025 los agentes comenzaron a hacer búsqueda multi-hop: descomponer un problema grande en sub-consultas, planificar, buscar múltiples veces en un loop. Cada iteración del loop era una llamada al modelo frontier. Resultado: la latencia y el costo por consulta subieron. El post de Neon cuantifica el precio de este enfoque con GPT-5.6 Sol en más de 10 segundos y aproximadamente 0,03 dólares por consulta (fuente: blog Neon, 5 de agosto de 2026).
Qué cambia. Los modelos open-weight pequeños-medianos cuestan un orden de magnitud menos, pero listos para usar son menos capaces en tareas agentic. El post-entrenamiento con reinforcement learning cierra la brecha en tareas específicas. Castform se posiciona aquí: hacer el post-entrenamiento con RL accesible como el prompt engineering, sin gestionar GPUs e internals de machine learning.
Cómo funciona el pipeline. Castform parte del corpus corporativo que vive en Postgres (Neon con Lakebase Search). Usa las extensiones lakebase_text y lakebase_vector para generar datos sintéticos: dado un documento, infiere una verdad de referencia, crea una pregunta que ese documento debería responder. El documento se convierte en la tarea, la corrección de la respuesta se convierte en la función de reward. El modelo intenta la búsqueda, el score lo guía a mejorar. En producción usa la misma herramienta de búsqueda que aprendió durante el entrenamiento.
El movimiento interesante es que Castform resuelve el problema del dato de entrenamiento, que es el cuello de botella real. Las empresas tienen corpus propios (documentación interna, registros de producto, artículos de soporte, interacciones con clientes) pero no tienen datasets limpios con tareas y reward listos. Castform automatiza esa transformación.
Limitaciones. Este es un post promocional de Neon y Castform, no un paper revisado por pares. El benchmark de precisión es específico de su configuración de retrieval: no sabemos cómo se generaliza a otros dominios u otros tipos de corpus. El modelo es especialista en búsqueda, no reemplaza un modelo general. Los 100x de ahorro se calculan en su caso de uso específico (búsqueda multi-turn con GPT-5.6 Sol) y dependen del pricing actual de las APIs, que cambia. La disponibilidad de Castform en sí, los costos del entrenamiento y los requisitos de hardware no se detallan en el post.
Para quien quiera medir por sí mismo si un modelo pequeño post-entrenado aguanta contra su propio frontier de referencia en su caso, la guía Compara dos modelos en un cuarto de hora da la estructura: misma tarea, mismos casos de prueba, tabla de resultados.