Aller au contenu principal

Tarification des tokens

Comprendre la facturation des modèles Grok

Tarification des modèles dans la documentation La tarification des modèles Grok repose sur un principe simple : vous payez au volume de tokens traités. Mais derrière cette simplicité apparente se cachent plusieurs mécanismes qu’il est essentiel de maîtriser pour contrôler vos coûts : tokens d’entrée, tokens de sortie, cache automatique, tokens de raisonnement.

Cette leçon vous donne une vision complète de la grille tarifaire et des mécanismes de facturation.

La grille tarifaire complète

Modèle Entrée ($/M) Caché ($/M) Sortie ($/M)
grok-4.20 (reasoning) $2.00 $0.20 $6.00
grok-4.20 (non-reasoning) $2.00 $0.20 $6.00
grok-4.20 multi-agent $2.00 $0.20 $6.00
grok-4-1-fast (reasoning) $0.20 $0.05 $0.50
grok-4-1-fast (non-reasoning) $0.20 $0.05 $0.50

Les quatre types de tokens

Pour bien comprendre votre facture, vous devez distinguer quatre catégories de tokens :

Tokens d’entrée (input)

Ce sont les tokens que vous envoyez au modèle : prompt système, messages de l’utilisateur, contexte, documents. Chaque token non caché est facturé au tarif d’entrée standard.

Tokens cachés (cached)

Lorsque vous envoyez une requête qui partage un préfixe commun avec une requête précédente, les tokens déjà traités sont récupérés depuis le cache. Ces tokens cachés bénéficient d’une réduction massive : 90 % pour Grok 4.20 ($0.20 au lieu de $2.00) et 75 % pour Grok 4-1 Fast ($0.05 au lieu de $0.20).

Le cache est entièrement automatique — vous n’avez rien à configurer. Les tokens cachés apparaissent dans l’objet usage de la réponse.

Tokens de sortie (output)

Les tokens générés par le modèle dans sa réponse visible. C’est le texte que vous recevez et affichez à l’utilisateur.

Tokens de raisonnement (reasoning)

Pour les variantes reasoning uniquement. Ces tokens représentent la « réflexion » interne du modèle. Ils sont facturés au tarif de sortie mais n’apparaissent pas dans la réponse visible. Ils sont comptabilisés séparément dans usage.completion_tokens_details.reasoning_tokens.

Lire sa facture dans la réponse API

Chaque réponse API contient un objet usage détaillé. Voici comment l’interpréter :

{
  "usage": {
    "prompt_tokens": 5000,
    "completion_tokens": 800,
    "total_tokens": 5800,
    "completion_tokens_details": {
      "reasoning_tokens": 300
    },
    "cost_in_usd_ticks": 5000000000
  }
}

Le champ cost_in_usd_ticks donne le coût exact de la requête. L’unité est le « tick » : 10 milliards de ticks = 1 dollar USD. Dans cet exemple, 5 000 000 000 ticks = $0.50.

Un champ alternatif cost_in_nano_usd est aussi disponible : 1 milliard = 1 dollar.

Le tokenizer

Avant d’envoyer une requête, vous pouvez estimer le nombre de tokens qu’elle consommera grâce à deux outils :

  • Console web : console.x.ai/team/default/tokenizer — interface graphique pour tester vos prompts
  • API de tokenisation : endpoint /v1/tokenize-text — comptage programmatique

C’est particulièrement utile pour estimer les coûts avant de lancer un traitement en lot sur un gros volume de données.

Tokens d’images en entrée

Si vous envoyez des images à un modèle multimodal (Grok 4.20 ou Grok 4-1 Fast), chaque image consomme entre 256 et 1 792 tokens selon sa taille et le niveau de détail demandé. Les images doivent être au format JPG ou PNG, avec une taille maximale de 20 MiB.

Ces tokens d’image sont facturés comme des tokens d’entrée classiques.

10x
Écart de prix entrée
12x
Écart de prix sortie
90%
Réduction cache 4.20
75%
Réduction cache Fast

Points clés à retenir

  • Quatre types de tokens : entrée, cachés, sortie, raisonnement
  • Le cache automatique réduit les coûts d’entrée de 75 % à 90 % selon le modèle
  • Les tokens de raisonnement sont facturés au tarif de sortie
  • Le champ cost_in_usd_ticks donne le coût exact (10 milliards = $1)
  • Utilisez le tokenizer pour estimer les coûts avant les traitements en volume
  • Les images en entrée consomment 256 à 1 792 tokens selon la taille