Aller au contenu principal

Plans Experiment et Scale : Quotas et Tarification

Deux plans pour deux usages

Mistral propose deux plans d’accès à son API, chacun adapté à une phase différente de votre projet. Comprendre leurs différences vous évitera des surprises en production et vous aidera à planifier votre budget.

Plan Experiment : explorer sans frais

Le plan Experiment est gratuit et conçu pour le prototypage, l’apprentissage et les tests exploratoires. Il vous donne accès à tous les modèles Mistral avec des limitations de volume.

Ce que permet Experiment

  • Tester tous les modèles disponibles (Mistral Small, Mistral Large, Codestral, etc.)
  • Développer et déboguer vos intégrations
  • Évaluer la qualité des réponses pour votre cas d’usage
  • Construire des prototypes fonctionnels

Les limites à connaître

Le plan Experiment impose des rate limits stricts : un nombre maximum de requêtes par seconde, par minute et par mois. Ces limites varient selon le modèle utilisé. Si vous les dépassez, l’API retourne une erreur 429 Too Many Requests.

Plan Scale : passer en production

Le plan Scale est le plan professionnel, facturé à l’usage (pay-as-you-go). Il offre des quotas bien supérieurs, un support prioritaire et des fonctionnalités avancées.

Activer le plan Scale

Depuis la Console Mistral, rendez-vous dans Paramètres > Facturation et ajoutez un moyen de paiement. Le passage au plan Scale est instantané et rétrocompatible : vos clés API existantes continuent de fonctionner avec les nouveaux quotas.

Comparaison détaillée

Caractéristique Experiment (gratuit) Scale (production)
Coût Gratuit Pay-as-you-go (par million de tokens)
Modèles disponibles Tous les modèles Tous les modèles
Rate limits Restreints (1-2 req/s selon le modèle) Élevés (ajustables sur demande)
Quota mensuel Limité (tokens/mois plafonnés) Illimité (selon budget)
Support Documentation + communauté Support prioritaire
SLA Aucun (best-effort) SLA garanti (disponibilité, latence)
Usage recommandé Prototypage, apprentissage, POC Production, applications commerciales
Augmentation de quotas Non disponible Sur demande via le support

Tarification Scale : comment ça fonctionne

La facturation Scale repose sur le nombre de tokens consommés. Un token correspond approximativement à 4 caractères en anglais (un peu moins en français, car les accents et les mots longs consomment davantage de tokens).

Vous êtes facturé séparément pour :

  • Les tokens d’entrée (votre prompt, le contexte, l’historique de conversation)
  • Les tokens de sortie (la réponse générée par le modèle)

Les tokens de sortie coûtent généralement plus cher que les tokens d’entrée, car ils mobilisent davantage de ressources de calcul.

Optimiser vos coûts

  • Choisissez le bon modèle : Mistral Small est bien moins cher que Mistral Large. Pour des tâches simples (classification, extraction), préférez un modèle compact.
  • Contrôlez max_tokens : limitez la longueur des réponses à ce qui est nécessaire
  • Réduisez le contexte : envoyez seulement l’historique pertinent dans les conversations multi-tour
  • Mettez en cache : si la même question revient souvent, cachez la réponse côté application

Surveiller sa consommation

La Console Mistral fournit un tableau de bord détaillé de votre consommation :

  • Volume de tokens par modèle et par jour
  • Coût cumulé sur la période en cours
  • Alertes configurables (par e-mail) lorsque vous approchez un seuil défini
  • Limites de dépenses que vous pouvez configurer pour éviter les mauvaises surprises

Quand passer de Experiment à Scale ?

Restez sur Experiment tant que vous êtes en phase d’exploration. Passez à Scale lorsque :

  • Vos utilisateurs réels accèdent à votre application
  • Vous avez besoin de plus de requêtes par seconde que les limites Experiment
  • Vous souhaitez bénéficier d’un SLA et d’un support technique
  • Votre application est critique et ne tolère pas les interruptions

Points clés à retenir

  • Experiment = gratuit, idéal pour apprendre et prototyper, quotas limités
  • Scale = pay-as-you-go, conçu pour la production, quotas élevés et ajustables
  • La facturation est basée sur les tokens (entrée + sortie), avec des tarifs différents par modèle
  • Configurez des alertes de dépenses dès l’activation du plan Scale
  • Le passage d’Experiment à Scale est transparent : vos clés API existantes restent valides