Tiers et tarification
Comprendre les limites et la tarification
AI Studio applique des limites de débit (rate limits) pour garantir la stabilité du service. Ces limites varient selon votre tier d’abonnement et déterminent le volume de requêtes et de tokens que vous pouvez consommer. Choisir le bon tier est une décision stratégique qui impacte directement vos coûts et vos performances en production.
Les deux types de limites
Mistral applique deux contrôles simultanés sur chaque workspace :
Requests Per Second (RPS)
Le nombre maximum de requêtes API que votre workspace peut envoyer par seconde. Si vous dépassez cette limite, l’API renvoie une erreur 429 Too Many Requests.
Tokens Per Minute / Per Month
Le volume de tokens (entrée + sortie) que vous pouvez consommer sur une période donnée. Cette limite s’applique au niveau du workspace et est partagée entre tous les utilisateurs qui y ont accès.
import time
from mistralai import Mistral
client = Mistral(api_key=os.environ["MISTRAL_API_KEY"])
def call_with_retry(messages, max_retries=3):
"""Gestion basique du rate limiting avec retry exponentiel."""
for attempt in range(max_retries):
try:
return client.chat.complete(
model="mistral-large-latest",
messages=messages
)
except Exception as e:
if "429" in str(e) and attempt < max_retries - 1:
wait = 2 ** attempt
print(f"Rate limit atteint, attente de {wait}s...")
time.sleep(wait)
else:
raise
Les tiers d’abonnement
Free API Tier (Experiment)
Le tier gratuit est conçu pour l’exploration et le prototypage. Les limites sont volontairement restrictives :
- RPS faible (quelques requêtes par seconde)
- Volume de tokens mensuel limité
- Accès à tous les modèles, mais avec des quotas réduits
- Pas de SLA ni de support dédié
Ce tier convient pour :
- Découvrir les modèles Mistral
- Prototyper une application
- Réaliser des tests fonctionnels
Scale (Paid)
Le tier payant est adapté à la production. Il offre des limites significativement plus élevées :
- RPS augmenté pour supporter le trafic production
- Volume de tokens mensuel élargi
- Facturation à l’usage (pay-as-you-go) au-delà de l’abonnement
- Support technique standard
Ce tier convient pour :
- Applications en production avec trafic modéré à élevé
- Équipes de développement professionnelles
- Projets nécessitant des performances prévisibles
Enterprise
Le tier Enterprise est négocié sur mesure avec l’équipe commerciale Mistral :
- Limites personnalisées selon vos besoins
- SLA garanti (disponibilité, latence)
- Support dédié avec interlocuteur technique
- Options Dedicated Serverless et Self-Hosted
- Conditions contractuelles adaptées (DPA, conformité RGPD)
Consulter vos limites actuelles
Les valeurs exactes de vos limites sont visibles dans le dashboard admin de votre workspace :
https://admin.mistral.ai/plateforme/limits
Ce dashboard affiche :
- Vos limites RPS actuelles par modèle
- Votre consommation de tokens (minute / mois)
- L’historique de consommation
- Les alertes en cas d’approche des limites
Optimiser vos coûts
Choisir le bon modèle
Tous les modèles n’ont pas le même coût par token. Pour réduire votre facture :
- Utilisez Mistral Small pour les tâches simples (classification, extraction)
- Réservez Mistral Large pour les tâches complexes (raisonnement, génération longue)
- Testez Ministral 3B/8B pour les cas où la latence prime sur la qualité
# Tâche simple → modèle léger
response_simple = client.chat.complete(
model="mistral-small-latest",
messages=[{"role": "user", "content": "Classifie ce texte : positif ou négatif ?"}]
)
# Tâche complexe → modèle puissant
response_complex = client.chat.complete(
model="mistral-large-latest",
messages=[{"role": "user", "content": "Analyse ce contrat et identifie les clauses problématiques."}]
)
Réduire la consommation de tokens
- Soyez concis dans vos prompts système — chaque token compte
- Utilisez
max_tokenspour limiter la longueur des réponses - Activez le streaming pour les réponses longues (meilleure expérience utilisateur sans surcoût)
- Mettez en cache les réponses fréquentes côté application
Surveiller la consommation
Mettez en place un monitoring de vos appels API :
import logging
logger = logging.getLogger("mistral_usage")
def tracked_call(model, messages):
response = client.chat.complete(model=model, messages=messages)
usage = response.usage
logger.info(
f"Modèle: {model} | "
f"Tokens entrée: {usage.prompt_tokens} | "
f"Tokens sortie: {usage.completion_tokens} | "
f"Total: {usage.total_tokens}"
)
return response
Quand passer au tier supérieur
Voici les signaux qui indiquent qu’il est temps d’upgrader :
- Vous recevez régulièrement des erreurs
429 - Votre consommation mensuelle approche 80% du quota
- Vous avez besoin d’un SLA pour vos clients
- Vous traitez des données sensibles nécessitant une isolation
Points clés à retenir
- Les limites s’appliquent au niveau du workspace (RPS + tokens/minute/mois)
- Le tier gratuit suffit pour le prototypage, le tier Scale pour la production
- Consultez vos limites exactes sur
admin.mistral.ai/plateforme/limits - Optimisez vos coûts en choisissant le modèle adapté à chaque tâche
- Implémentez un retry exponentiel pour gérer le rate limiting en production