Cactus Hybrid: Gemma 4 aprende a decir «no lo sé», y el enrutamiento se vuelve automático
Cactus Compute lanzó Cactus Hybrid, un proyecto open source que entrena Gemma 4 E2B para reconocer cuándo se equivoca. Cada respuesta lleva una puntuación de confianza entre 0 y 1, devuelva como dato estructurado, no extraído del texto generado. Por encima de un umbral responde el modelo local. Por debajo, la consulta pasa a un modelo más grande en la nube.
Es la pieza que faltaba en la infraestructura agentic en producción. Un modelo local de 2 mil millones de parámetros es rápido y privado, pero no sabes cuándo está cometiendo errores. Con la calibración de la incertidumbre integrada en los pesos, el enrutamiento se convierte en una decisión automática basada en una puntuación verificable.
Cactus Hybrid hace coincidir Gemma 4 E2B con Gemini 3.1 Flash-Lite en los benchmarks comunes, ejecutando solo el 15-55% de las consultas en el modelo en la nube. El resto lo resuelve localmente. Los números varían según el benchmark y la cuantización, pero el patrón es claro: la mayoría de las consultas no necesita el modelo frontier.
Como contábamos respecto a la economía de los enjambres de Cursor, la mezcla de modelos importa más que la potencia individual. Cactus Hybrid formaliza el mismo principio desde abajo: el modelo pequeño sabe cuándo pasar la responsabilidad.
Para quienes usan modelos open en producción, la calibración de la incertidumbre se convierte en el segundo criterio de selección después de la calidad pura. El repositorio está en GitHub con los modelos en Hugging Face.
En detalle
Cómo era antes.
Los modelos locales open-weight como Gemma, Llama o Qwen se ejecutan en el dispositivo o en un servidor privado, pero no pueden decirte qué tan seguros están de lo que dicen. Si preguntas «¿cuál es la capital de Francia?» y «¿cuál es la fórmula del Bennett ratio?», el modelo te da una respuesta con el mismo tono asertivo para ambas. Sin puntuación de confianza, sin señal de incertidumbre.
Quienes construyen sistemas agentic en producción hasta ahora han tenido que estimar la incertidumbre con trucos externos. Generar múltiples respuestas y compararlas, pedir al modelo que se evalúe a sí mismo (una meta que los LLM hacen mal), o usar un segundo modelo como árbitro. Todas soluciones que añaden latencia y costo sin garantías.
Cómo funciona.
Cactus Hybrid inserta sondas directamente en el checkpoint del modelo. Durante el post-training, el modelo aprende a dar la respuesta y a estimar qué tan confiable es. La puntuación de confianza es un número entre 0 y 1 devuelto como dato estructurado, separado del texto de la respuesta. No se parsea del texto generado: es un output separado.
El umbral de handoff es configurable. El repositorio muestra un ejemplo legible: if confidence < 0.85: answer = ask_a_bigger_model(prompt). Por encima de 0.85 responde el modelo local, por debajo pasa a la nube. El modelo en la nube en el rollout inicial es Gemini 3.1 Flash-Lite.
Los números.
Los benchmarks de Cactus muestran el porcentaje de handoff necesario para coincidir con Flash-Lite. En FP16: ChartQA 15-20%, MMBench 30-35%, LibriSpeech 25-30%, GigaSpeech 30-35%, MMAU 30-35%. A 4-bit los valores aumentan 10-15 puntos. MMLU-Pro requiere 45-55% de handoff en FP16, casi el doble que otros benchmarks.
La cuantización aumenta el porcentaje de handoff necesario, pero incluso los modelos más comprimidos resuelven más de la mitad de las consultas localmente. El trade-off es legible: ahorras memoria en el dispositivo, pagas con más llamadas a la nube.
Limitaciones.
El proyecto es joven. Tres forks y 189 estrellas en GitHub, un solo modelo en el rollout inicial. Los benchmarks son proporcionados por el equipo de Cactus, no por una evaluación independiente.
La confianza calibrada es un problema conocido y difícil. Un modelo puede estar «seguro» y equivocarse, o ser incierto y tener razón. La calibración verdadera se mide con el ECE (Expected Calibration Error) en datasets de validación, y el repositorio no informa este dato.
Quienes quieran usarlo en producción deberían construir su propio banco de pruebas: un conjunto de preguntas con respuesta conocida en su propio dominio, comparar la puntuación de confianza con la corrección efectiva, y verificar que el umbral elegido realmente separe las respuestas correctas de las incorrectas. El playbook para comparar dos modelos es un punto de partida: misma tarea, mismos casos de prueba, tabla de resultados.