Los gateways para probar modelos: OpenRouter, Together, Groq, Fireworks
- para empezar
- para todos: cuenta y clave API; ninguno exige contratos para empezar
- cuándo elegirla
- Has entendido que necesitas las APIs y quieres decidir por qué ventanilla entrar.
precios
| plan | verificado el | |
|---|---|---|
| OpenRouter | listas de los proveedores sin recargo + 5,5% al comprar créditos | 19/07/2026 |
| Together AI | a consumo por token, lista propia para cada modelo alojado | 19/07/2026 |
| Groq | a consumo por token; en Llama 3.3 70B, 0,59/0,79 $ por millón de tokens entrada/salida | 19/07/2026 |
| Fireworks AI | a consumo por token, con descuento del 50% en tandas batch | 19/07/2026 |
En la ficha de OpenRouter contamos la ventanilla única. Pero OpenRouter es un tipo particular de ventanilla: un agregador, que dirige tus peticiones a proveedores ajenos. Al lado están los proveedores propiamente dichos, que alojan los modelos en infraestructura propia. Las diferencias importan, y la elección depende de tu perfil más que de una clasificación.
El mapa
OpenRouter agrega: una clave, el catálogo más ancho (400+ modelos, incluidos los propietarios de los grandes laboratorios), precios passthrough. Es la ventanilla para probar y comparar: nadie más te pone Claude, GPT y los abiertos chinos en la misma llamada.
Together AI aloja los modelos abiertos (uno de los catálogos más amplios entre proveedores directos, más de 100) y además te deja afinar un modelo (fine-tuning: entrenarlo más con tus datos) y servirlo desde la misma API. Es la ventanilla para el trabajo serio con open-weight.
Groq corre: hardware propietario diseñado para la inferencia, catálogo estrecho de modelos abiertos seleccionados, velocidades de generación que los demás no alcanzan. Un ancla de precio a la fecha: en Llama 3.3 70B declara 0,59/0,79 $ por millón de tokens entrada/salida (fuente en la tabla, 19/07/2026). Es la ventanilla para quien tiene la latencia como restricción: asistentes en vivo, voz, interfaces que no pueden esperar. Fine-tuning público: no.
Fireworks AI apunta a la producción: function calling, salidas estructuradas, cumplimiento (HIPAA, cero retención de datos en los modelos abiertos sin opt-in explícito), fine-tuning y serving en la misma plataforma. Es la ventanilla para quien lleva a producción un producto con requisitos.
Cómo elegir, por perfil
Si estás aprendiendo o comparando, OpenRouter, sin pensarlo: el catálogo ancho es exactamente su oficio, y las variantes gratuitas ponen a cero los primeros experimentos. Si has elegido un modelo abierto y construyes sobre él, Together o Fireworks, la segunda favorita si tienes requisitos de cumplimiento o salidas estructuradas en producción. Si tu producto vive o muere por la velocidad de respuesta, Groq, aceptando el catálogo estrecho. Y si solo usas los modelos de un laboratorio, la API directa del laboratorio sigue siendo el camino principal: un intermediario menos.
Sobre los datos, la regla operativa es leer la página de políticas del proveedor elegido antes de mandarle trabajo real: las políticas de retención y entrenamiento difieren y cambian, y se verifican a la fecha, no se recuerdan.
Qué le falta a esta comparativa
Las latencias medidas por nosotros: los números de velocidad que circulan vienen de los propios proveedores o de terceros, y nuestro banco comparativo (el evaluador batch del plan de scaffolding, SC-03) aún no está construido. Cuando exista, esta comparativa se actualizará con medidas hechas en casa, con fecha y condiciones declaradas. Hasta entonces, los precios de la tabla llevan su fecha de verificación y la velocidad sigue siendo un claim de los fabricantes.