I gateway per provare i modelli: OpenRouter, Together, Groq, Fireworks
- per iniziare
- per tutti: account e chiave API; nessuno richiede contratti per iniziare
- quando sceglierlo
- Hai capito che le API ti servono e vuoi decidere da quale sportello entrare.
prezzi
| piano | verificato il | |
|---|---|---|
| OpenRouter | listino dei provider senza ricarico + 5,5% sull'acquisto crediti | 19/07/2026 |
| Together AI | a consumo per token, listino proprio per ogni modello ospitato | 19/07/2026 |
| Groq | a consumo per token; su Llama 3.3 70B, 0,59/0,79 $ per milione di token in/out | 19/07/2026 |
| Fireworks AI | a consumo per token, con sconto del 50% sui giri batch | 19/07/2026 |
Nella scheda OpenRouter abbiamo raccontato lo sportello unico. Ma OpenRouter è un tipo particolare di sportello: un aggregatore, che smista le tue richieste verso provider altrui. Accanto ci sono i provider veri e propri, che i modelli li ospitano su infrastruttura propria. Le differenze contano, e la scelta dipende dal tuo profilo più che da una classifica.
La mappa
OpenRouter aggrega: una chiave, il catalogo più largo (400+ modelli, inclusi i proprietari dei grandi laboratori), prezzi passthrough. È lo sportello per provare e confrontare: nessun altro ti mette Claude, GPT e i cinesi aperti nella stessa chiamata.
Together AI ospita i modelli aperti (uno dei cataloghi più ampi fra i provider diretti, oltre 100) e ti fa anche rifinire un modello (fine-tuning: addestrarlo ulteriormente sui tuoi dati) e servirlo dalla stessa API. È lo sportello per chi lavora seriamente con gli open-weight.
Groq corre: hardware proprietario progettato per l’inferenza, catalogo ristretto di modelli aperti selezionati, velocità di generazione che gli altri non raggiungono. Un’ancora di prezzo alla data: su Llama 3.3 70B dichiara 0,59/0,79 $ per milione di token in ingresso/uscita (fonte in tabella, 19/07/2026). È lo sportello per chi ha la latenza come vincolo: assistenti dal vivo, voce, interfacce che non possono aspettare. Fine-tuning pubblico: no.
Fireworks AI punta alla produzione: function calling, output strutturati, conformità (HIPAA, zero data retention sui modelli aperti senza opt-in esplicito), fine-tuning e serving nella stessa piattaforma. È lo sportello per chi porta in produzione un prodotto con requisiti.
Come scegliere, per profilo
Se stai imparando o confrontando, OpenRouter, senza pensarci: il catalogo largo è esattamente il suo mestiere, e le varianti gratuite azzerano il costo dei primi esperimenti. Se hai scelto un modello aperto e ci costruisci sopra, Together o Fireworks, con la seconda favorita se hai requisiti di conformità o output strutturati in produzione. Se il tuo prodotto vive o muore sulla velocità di risposta, Groq, accettando il catalogo ristretto. E se usi solo i modelli di un laboratorio, l’API diretta del laboratorio resta la via maestra: un intermediario in meno.
Sui dati, la regola operativa è leggere la pagina delle policy del provider scelto prima di mandarci lavoro vero: le politiche di retention e training differiscono e cambiano, e vanno verificate alla data, non ricordate.
Cosa manca a questo confronto
Le latenze misurate da noi: i numeri di velocità che circolano vengono dai provider stessi o da terzi, e il nostro banco di prova comparativo (il valutatore batch dello scaffolding, SC-03 del piano) non è ancora costruito. Quando esiste, questo confronto si aggiorna con le misure fatte in casa, con data e condizioni dichiarate. Fino ad allora, i prezzi in tabella portano la data di verifica e la velocità resta un claim dei produttori.