Aller au contenu principal

Plans Experiment et Scale : Quotas et Tarification

Mis à jour le 29 juillet 2026

Deux plans pour deux moments d’un projet

Mistral propose deux plans d’accès à son API, chacun taillé pour une phase différente. Comprendre ce qui les sépare vous évitera la mauvaise surprise classique : une application qui fonctionnait parfaitement en démonstration et qui s’effondre le jour où trente utilisateurs s’y connectent en même temps.

Le plan Experiment est gratuit. Il donne accès à tous les modèles Mistral et sert à prototyper, apprendre et évaluer : vous testez Mistral Small, Mistral Large 3, Devstral 2, vous déboguez votre intégration, vous mesurez la qualité des réponses sur votre cas d’usage réel et vous construisez un prototype qui tourne. En contrepartie, il impose des rate limits stricts — un nombre maximum de requêtes par seconde, par minute et par mois, variable selon le modèle. Dès que vous les dépassez, l’API répond 429 Too Many Requests. Ce n’est pas une panne, c’est le plan qui vous rappelle sa vocation.

Le plan Scale est le plan professionnel, facturé à l’usage. Les quotas y sont bien supérieurs, le support prioritaire, et des fonctionnalités avancées s’ouvrent. Son activation est étonnamment discrète : dans la Console Mistral, ouvrez Paramètres > Facturation, ajoutez un moyen de paiement, et le basculement est instantané. Vos clés API existantes continuent de fonctionner telles quelles, désormais avec les nouveaux quotas — aucune ligne de code à modifier, aucun redéploiement.

Caractéristique Experiment (gratuit) Scale (production)
Coût Gratuit Pay-as-you-go (par million de tokens)
Modèles disponibles Tous les modèles Tous les modèles
Rate limits Restreints (1-2 req/s selon le modèle) Élevés (ajustables sur demande)
Quota mensuel Limité (tokens/mois plafonnés) Illimité (selon budget)
Support Documentation + communauté Support prioritaire
SLA Aucun (best-effort) SLA garanti (disponibilité, latence)
Usage recommandé Prototypage, apprentissage, POC Production, applications commerciales
Augmentation de quotas Non disponible Sur demande via le support

Comment se calcule la facture

La facturation Scale repose sur le nombre de tokens consommés. Un token correspond approximativement à quatre caractères en anglais, un peu moins en français où les accents et les mots longs se découpent en davantage de morceaux : à contenu égal, un texte français coûte donc légèrement plus cher qu’un texte anglais. Vous êtes facturé séparément pour les tokens d’entrée — votre prompt, le contexte que vous joignez, l’historique de conversation — et pour les tokens de sortie, c’est-à-dire la réponse générée. Ces derniers coûtent généralement plus cher, car ils mobilisent davantage de ressources de calcul.

De cette mécanique découlent quatre leviers d’optimisation, et ils sont plus efficaces que n’importe quelle négociation commerciale. Le premier est le choix du modèle : Mistral Small revient bien moins cher que Mistral Large 3, et une tâche de classification ou d’extraction n’a aucun besoin du modèle le plus puissant du catalogue. Le deuxième est le paramètre max_tokens, qui plafonne la longueur des réponses — laissez-le ouvert et le modèle rédigera trois paragraphes là où une phrase suffisait. Le troisième consiste à réduire le contexte envoyé : dans une conversation multi-tour, seul l’historique pertinent mérite d’être retransmis, puisqu’il est refacturé à chaque appel. Le quatrième est le cache applicatif : si les mêmes dix questions reviennent chaque jour dans votre FAQ, stockez les réponses côté application plutôt que de les régénérer.

La Console vous donne les moyens de surveiller tout cela sans attendre la facture. Vous y trouvez le volume de tokens par modèle et par jour, le coût cumulé sur la période en cours, des alertes configurables par e-mail lorsque vous approchez d’un seuil que vous avez défini, et des limites de dépenses qui coupent net avant le dérapage. Configurez ces deux dernières le jour même où vous activez Scale, pas le mois suivant.

Le bon moment pour basculer

Restez sur Experiment tant que vous explorez : le plan est fait pour cela et il ne vous coûte rien. Le passage à Scale s’impose lorsque des utilisateurs réels accèdent à votre application, lorsque vous butez sur les limites de requêtes par seconde, lorsque vous avez besoin d’un SLA et d’un support technique joignable, ou lorsque votre application devient critique et ne tolère plus d’interruption. En pratique, ces quatre signaux arrivent souvent ensemble, dans la semaine qui suit la première démonstration réussie devant un client.

Tarifs relevés le 5 août 2026 — les prix évoluent régulièrement : avant tout calcul de budget, vérifiez la grille en vigueur sur la tarification officielle Mistral.

Points clés à retenir

  • Experiment = gratuit, idéal pour apprendre et prototyper, quotas limités
  • Scale = pay-as-you-go, conçu pour la production, quotas élevés et ajustables
  • La facturation est basée sur les tokens (entrée + sortie), avec des tarifs différents par modèle
  • Configurez des alertes de dépenses dès l’activation du plan Scale
  • Le passage d’Experiment à Scale est transparent : vos clés API existantes restent valides