Aller au contenu principal

Tiers et tarification

Comprendre les limites et la tarification

AI Studio applique des limites de débit (rate limits) pour garantir la stabilité du service. Ces limites varient selon votre tier d’abonnement et déterminent le volume de requêtes et de tokens que vous pouvez consommer. Choisir le bon tier est une décision stratégique qui impacte directement vos coûts et vos performances en production.

Les deux types de limites

Mistral applique deux contrôles simultanés sur chaque workspace :

Requests Per Second (RPS)

Le nombre maximum de requêtes API que votre workspace peut envoyer par seconde. Si vous dépassez cette limite, l’API renvoie une erreur 429 Too Many Requests.

Tokens Per Minute / Per Month

Le volume de tokens (entrée + sortie) que vous pouvez consommer sur une période donnée. Cette limite s’applique au niveau du workspace et est partagée entre tous les utilisateurs qui y ont accès.

import time
from mistralai import Mistral

client = Mistral(api_key=os.environ["MISTRAL_API_KEY"])

def call_with_retry(messages, max_retries=3):
    """Gestion basique du rate limiting avec retry exponentiel."""
    for attempt in range(max_retries):
        try:
            return client.chat.complete(
                model="mistral-large-latest",
                messages=messages
            )
        except Exception as e:
            if "429" in str(e) and attempt < max_retries - 1:
                wait = 2 ** attempt
                print(f"Rate limit atteint, attente de {wait}s...")
                time.sleep(wait)
            else:
                raise

Les tiers d’abonnement

Free API Tier (Experiment)

Le tier gratuit est conçu pour l’exploration et le prototypage. Les limites sont volontairement restrictives :

  • RPS faible (quelques requêtes par seconde)
  • Volume de tokens mensuel limité
  • Accès à tous les modèles, mais avec des quotas réduits
  • Pas de SLA ni de support dédié

Ce tier convient pour :

  • Découvrir les modèles Mistral
  • Prototyper une application
  • Réaliser des tests fonctionnels

Scale (Paid)

Le tier payant est adapté à la production. Il offre des limites significativement plus élevées :

  • RPS augmenté pour supporter le trafic production
  • Volume de tokens mensuel élargi
  • Facturation à l’usage (pay-as-you-go) au-delà de l’abonnement
  • Support technique standard

Ce tier convient pour :

  • Applications en production avec trafic modéré à élevé
  • Équipes de développement professionnelles
  • Projets nécessitant des performances prévisibles

Enterprise

Le tier Enterprise est négocié sur mesure avec l’équipe commerciale Mistral :

  • Limites personnalisées selon vos besoins
  • SLA garanti (disponibilité, latence)
  • Support dédié avec interlocuteur technique
  • Options Dedicated Serverless et Self-Hosted
  • Conditions contractuelles adaptées (DPA, conformité RGPD)

Consulter vos limites actuelles

Les valeurs exactes de vos limites sont visibles dans le dashboard admin de votre workspace :

https://admin.mistral.ai/plateforme/limits

Ce dashboard affiche :

  • Vos limites RPS actuelles par modèle
  • Votre consommation de tokens (minute / mois)
  • L’historique de consommation
  • Les alertes en cas d’approche des limites

Optimiser vos coûts

Choisir le bon modèle

Tous les modèles n’ont pas le même coût par token. Pour réduire votre facture :

  • Utilisez Mistral Small pour les tâches simples (classification, extraction)
  • Réservez Mistral Large pour les tâches complexes (raisonnement, génération longue)
  • Testez Ministral 3B/8B pour les cas où la latence prime sur la qualité
# Tâche simple → modèle léger
response_simple = client.chat.complete(
    model="mistral-small-latest",
    messages=[{"role": "user", "content": "Classifie ce texte : positif ou négatif ?"}]
)

# Tâche complexe → modèle puissant
response_complex = client.chat.complete(
    model="mistral-large-latest",
    messages=[{"role": "user", "content": "Analyse ce contrat et identifie les clauses problématiques."}]
)

Réduire la consommation de tokens

  • Soyez concis dans vos prompts système — chaque token compte
  • Utilisez max_tokens pour limiter la longueur des réponses
  • Activez le streaming pour les réponses longues (meilleure expérience utilisateur sans surcoût)
  • Mettez en cache les réponses fréquentes côté application

Surveiller la consommation

Mettez en place un monitoring de vos appels API :

import logging

logger = logging.getLogger("mistral_usage")

def tracked_call(model, messages):
    response = client.chat.complete(model=model, messages=messages)
    usage = response.usage
    logger.info(
        f"Modèle: {model} | "
        f"Tokens entrée: {usage.prompt_tokens} | "
        f"Tokens sortie: {usage.completion_tokens} | "
        f"Total: {usage.total_tokens}"
    )
    return response

Quand passer au tier supérieur

Voici les signaux qui indiquent qu’il est temps d’upgrader :

  • Vous recevez régulièrement des erreurs 429
  • Votre consommation mensuelle approche 80% du quota
  • Vous avez besoin d’un SLA pour vos clients
  • Vous traitez des données sensibles nécessitant une isolation

Points clés à retenir

  • Les limites s’appliquent au niveau du workspace (RPS + tokens/minute/mois)
  • Le tier gratuit suffit pour le prototypage, le tier Scale pour la production
  • Consultez vos limites exactes sur admin.mistral.ai/plateforme/limits
  • Optimisez vos coûts en choisissant le modèle adapté à chaque tâche
  • Implémentez un retry exponentiel pour gérer le rate limiting en production