Outils · ST-02 · comparatif

Les passerelles pour essayer les modèles : OpenRouter, Together, Groq, Fireworks

pour démarrer
pour tous : un compte et une clé API ; aucun n'exige de contrat pour commencer
quand le choisir
Vous avez compris que les API vous servent et voulez décider à quel guichet entrer.

tarifs

offrevérifié le
OpenRoutertarifs catalogue des fournisseurs sans majoration + 5,5 % à l'achat des crédits19/07/2026
Together AIau token, catalogue propre pour chaque modèle hébergé19/07/2026
Groqau token ; sur Llama 3.3 70B, 0,59/0,79 $ par million de tokens entrée/sortie19/07/2026
Fireworks AIau token, avec 50 % de remise sur les traitements batch19/07/2026

Dans la fiche OpenRouter, nous avons raconté le guichet unique. Mais OpenRouter est un type particulier de guichet : un agrégateur, qui aiguille vos requêtes vers les fournisseurs des autres. À côté, il y a les fournisseurs proprement dits, qui hébergent les modèles sur leur propre infrastructure. Les différences comptent, et le choix dépend de votre profil plus que d’un classement.

La carte

OpenRouter agrège : une clé, le catalogue le plus large (400+ modèles, y compris les propriétaires des grands laboratoires), prix passthrough. C’est le guichet pour essayer et comparer : personne d’autre ne met Claude, GPT et les modèles ouverts chinois dans le même appel.

Together AI héberge les modèles ouverts (l’un des catalogues les plus larges parmi les fournisseurs directs, plus de 100) et vous laisse aussi affiner un modèle (fine-tuning : l’entraîner davantage sur vos données) et le servir depuis la même API. C’est le guichet du travail sérieux avec les poids ouverts.

Groq court : matériel propriétaire conçu pour l’inférence, catalogue étroit de modèles ouverts sélectionnés, vitesses de génération que les autres n’atteignent pas. Une ancre de prix à la date : sur Llama 3.3 70B, il affiche 0,59/0,79 $ par million de tokens entrée/sortie (source dans le tableau, 19/07/2026). C’est le guichet pour qui a la latence comme contrainte : assistants en direct, voix, interfaces qui ne peuvent pas attendre. Fine-tuning public : non.

Fireworks AI vise la production : function calling, sorties structurées, conformité (HIPAA, zéro rétention de données sur les modèles ouverts sans opt-in explicite), fine-tuning et serving sur la même plateforme. C’est le guichet pour qui met en production un produit avec des exigences.

Comment choisir, par profil

Si vous apprenez ou comparez, OpenRouter, sans hésiter : le catalogue large est exactement son métier, et les variantes gratuites mettent à zéro les premières expériences. Si vous avez choisi un modèle ouvert et construisez dessus, Together ou Fireworks, la seconde favorite en cas d’exigences de conformité ou de sorties structurées en production. Si votre produit vit ou meurt sur la vitesse de réponse, Groq, en acceptant le catalogue étroit. Et si vous n’utilisez que les modèles d’un laboratoire, l’API directe du laboratoire reste la voie royale : un intermédiaire de moins.

Sur les données, la règle opérationnelle est de lire la page des politiques du fournisseur choisi avant d’y envoyer du vrai travail : les politiques de rétention et d’entraînement diffèrent et changent, et se vérifient à la date, ne se devinent pas de mémoire.

Ce qui manque à ce comparatif

Les latences mesurées par nous : les chiffres de vitesse qui circulent viennent des fournisseurs eux-mêmes ou de tiers, et notre banc comparatif (l’évaluateur batch du plan scaffolding, SC-03) n’est pas encore construit. Quand il existera, ce comparatif sera mis à jour avec des mesures faites maison, date et conditions déclarées. D’ici là, les prix du tableau portent leur date de vérification et la vitesse reste une affirmation des fabricants.

Tapez pour chercher dans cours, playbooks, skills, papers…