Aller au contenu principal

Tiers et tarification

Mis à jour le 29 juillet 2026

Comprendre les limites et la tarification

AI Studio applique des limites de débit — les rate limits — pour garantir la stabilité du service. Ces limites varient selon votre tier d’abonnement et déterminent le volume de requêtes et de tokens que vous pouvez consommer. Le choix du tier n’est donc pas une case administrative à cocher : c’est une décision qui se répercute directement sur vos coûts et sur le comportement de votre application aux heures de pointe.

Les deux types de limites

Mistral applique deux contrôles simultanés sur chaque workspace, et il suffit que l’un des deux soit atteint pour que vos appels échouent. Le premier, le Requests Per Second (RPS), plafonne le nombre de requêtes API envoyées par seconde ; au-delà, l’API renvoie une erreur 429 Too Many Requests. Le second porte sur les tokens par minute et par mois : il mesure le volume consommé en entrée comme en sortie, s’applique au niveau du workspace et se partage entre tous les utilisateurs qui y ont accès. Une équipe de six développeurs travaillant sur la même clé épuise ce quota six fois plus vite qu’un développeur seul, ce que l’on oublie systématiquement lors du premier pic de trafic.

La parade tient en quelques lignes : lorsqu’un 429 survient, attendez avant de réessayer, et allongez l’attente à chaque tentative plutôt que de marteler l’API.

import time
from mistralai import Mistral

client = Mistral(api_key=os.environ["MISTRAL_API_KEY"])

def call_with_retry(messages, max_retries=3):
    """Gestion basique du rate limiting avec retry exponentiel."""
    for attempt in range(max_retries):
        try:
            return client.chat.complete(
                model="mistral-large-latest",
                messages=messages
            )
        except Exception as e:
            if "429" in str(e) and attempt < max_retries - 1:
                wait = 2 ** attempt
                print(f"Rate limit atteint, attente de {wait}s...")
                time.sleep(wait)
            else:
                raise

Les tiers d’abonnement

Le Free API Tier, aussi appelé Experiment, est conçu pour l’exploration. Son RPS reste faible, de l’ordre de quelques requêtes par seconde, et son volume de tokens mensuel est limité ; tous les modèles restent accessibles, mais avec des quotas réduits, sans SLA ni support dédié. Il remplit parfaitement son office pour découvrir les modèles Mistral, prototyper une application ou dérouler des tests fonctionnels — et il vous fera très vite comprendre ce qu’est un 429 si vous tentez d’y faire tourner une démonstration client.

Le tier Scale, payant, s’adresse à la production. Le RPS y est relevé pour absorber un trafic réel, le volume mensuel de tokens élargi, et la facturation bascule à l’usage au-delà de l’abonnement, avec un support technique standard. C’est le niveau attendu pour une application en production à trafic modéré ou élevé, pour une équipe de développement professionnelle, et plus généralement dès que vos performances doivent être prévisibles.

Le tier Enterprise, enfin, se négocie sur mesure avec l’équipe commerciale de Mistral. Il ouvre des limites personnalisées, un SLA garanti sur la disponibilité et la latence, un support dédié avec interlocuteur technique, l’accès aux options Dedicated Serverless et Self-Hosted, ainsi que des conditions contractuelles adaptées — DPA et conformité RGPD comprises. C’est le passage obligé lorsque vos propres clients vous imposent contractuellement des engagements de service.

Consulter vos limites actuelles

Les valeurs exactes qui s’appliquent à votre workspace ne se devinent pas : elles se lisent dans le dashboard admin.

https://admin.mistral.ai/plateforme/limits

Vous y trouverez vos limites RPS par modèle, votre consommation de tokens à la minute et au mois, l’historique de cette consommation et les alertes déclenchées à l’approche des seuils. Prenez le réflexe d’ouvrir cette page avant chaque montée en charge annoncée, plutôt qu’après le premier incident.

Optimiser vos coûts

Le levier le plus efficace reste le choix du modèle, car tous ne coûtent pas le même prix au token. Réservez Mistral Large 3 aux tâches complexes — raisonnement, génération longue, analyse de documents contractuels — et confiez à Mistral Small les traitements simples comme la classification ou l’extraction de champs. Lorsque la latence prime sur la finesse de la réponse, Ministral 3 mérite d’être testé.

# Tâche simple → modèle léger
response_simple = client.chat.complete(
    model="mistral-small-latest",
    messages=[{"role": "user", "content": "Classifie ce texte : positif ou négatif ?"}]
)

# Tâche complexe → modèle puissant
response_complex = client.chat.complete(
    model="mistral-large-latest",
    messages=[{"role": "user", "content": "Analyse ce contrat et identifie les clauses problématiques."}]
)

La consommation elle-même se réduit ensuite par petites touches. Un prompt système concis économise des tokens sur chaque appel, et non une seule fois ; max_tokens borne la longueur des réponses et évite les digressions coûteuses ; le streaming n’allège pas la facture mais améliore nettement l’expérience sur les réponses longues ; enfin, mettre en cache côté application les réponses aux questions récurrentes supprime purement et simplement l’appel.

Encore faut-il mesurer. Journalisez les tokens de chaque appel : sans cette instrumentation, vous découvrirez la dérive au moment de la facture.

import logging

logger = logging.getLogger("mistral_usage")

def tracked_call(model, messages):
    response = client.chat.complete(model=model, messages=messages)
    usage = response.usage
    logger.info(
        f"Modèle: {model} | "
        f"Tokens entrée: {usage.prompt_tokens} | "
        f"Tokens sortie: {usage.completion_tokens} | "
        f"Total: {usage.total_tokens}"
    )
    return response

Quand passer au tier supérieur

Quatre signaux doivent déclencher la conversation avec Mistral : des erreurs 429 qui reviennent régulièrement, une consommation mensuelle qui atteint 80 % du quota, un besoin de SLA à faire valoir auprès de vos propres clients, ou le traitement de données sensibles exigeant une isolation. Le premier des quatre suffit ; les trois autres arrivent rarement seuls.

Points clés à retenir

  • Les limites s’appliquent au niveau du workspace (RPS + tokens/minute/mois)
  • Le tier gratuit suffit pour le prototypage, le tier Scale pour la production
  • Consultez vos limites exactes sur admin.mistral.ai/plateforme/limits
  • Optimisez vos coûts en choisissant le modèle adapté à chaque tâche
  • Implémentez un retry exponentiel pour gérer le rate limiting en production