Tarification des tokens
Comprendre la facturation des modèles Grok
La tarification des modèles Grok repose sur un principe simple : vous payez au volume de tokens traités. Mais derrière cette simplicité apparente se cachent plusieurs mécanismes qu’il est essentiel de maîtriser pour contrôler vos coûts : tokens d’entrée, tokens de sortie, cache automatique, tokens de raisonnement.
Cette leçon vous donne une vision complète de la grille tarifaire et des mécanismes de facturation.
La grille tarifaire complète
| Modèle | Entrée ($/M) | Caché ($/M) | Sortie ($/M) |
|---|---|---|---|
| grok-4.20 (reasoning) | $2.00 | $0.20 | $6.00 |
| grok-4.20 (non-reasoning) | $2.00 | $0.20 | $6.00 |
| grok-4.20 multi-agent | $2.00 | $0.20 | $6.00 |
| grok-4-1-fast (reasoning) | $0.20 | $0.05 | $0.50 |
| grok-4-1-fast (non-reasoning) | $0.20 | $0.05 | $0.50 |
Les quatre types de tokens
Pour bien comprendre votre facture, vous devez distinguer quatre catégories de tokens :
Tokens d’entrée (input)
Ce sont les tokens que vous envoyez au modèle : prompt système, messages de l’utilisateur, contexte, documents. Chaque token non caché est facturé au tarif d’entrée standard.
Tokens cachés (cached)
Lorsque vous envoyez une requête qui partage un préfixe commun avec une requête précédente, les tokens déjà traités sont récupérés depuis le cache. Ces tokens cachés bénéficient d’une réduction massive : 90 % pour Grok 4.20 ($0.20 au lieu de $2.00) et 75 % pour Grok 4-1 Fast ($0.05 au lieu de $0.20).
Le cache est entièrement automatique — vous n’avez rien à configurer. Les tokens cachés apparaissent dans l’objet usage de la réponse.
Tokens de sortie (output)
Les tokens générés par le modèle dans sa réponse visible. C’est le texte que vous recevez et affichez à l’utilisateur.
Tokens de raisonnement (reasoning)
Pour les variantes reasoning uniquement. Ces tokens représentent la « réflexion » interne du modèle. Ils sont facturés au tarif de sortie mais n’apparaissent pas dans la réponse visible. Ils sont comptabilisés séparément dans usage.completion_tokens_details.reasoning_tokens.
Lire sa facture dans la réponse API
Chaque réponse API contient un objet usage détaillé. Voici comment l’interpréter :
{
"usage": {
"prompt_tokens": 5000,
"completion_tokens": 800,
"total_tokens": 5800,
"completion_tokens_details": {
"reasoning_tokens": 300
},
"cost_in_usd_ticks": 5000000000
}
}
Le champ cost_in_usd_ticks donne le coût exact de la requête. L’unité est le « tick » : 10 milliards de ticks = 1 dollar USD. Dans cet exemple, 5 000 000 000 ticks = $0.50.
Un champ alternatif cost_in_nano_usd est aussi disponible : 1 milliard = 1 dollar.
Le tokenizer
Avant d’envoyer une requête, vous pouvez estimer le nombre de tokens qu’elle consommera grâce à deux outils :
- Console web :
console.x.ai/team/default/tokenizer— interface graphique pour tester vos prompts - API de tokenisation : endpoint
/v1/tokenize-text— comptage programmatique
C’est particulièrement utile pour estimer les coûts avant de lancer un traitement en lot sur un gros volume de données.
Tokens d’images en entrée
Si vous envoyez des images à un modèle multimodal (Grok 4.20 ou Grok 4-1 Fast), chaque image consomme entre 256 et 1 792 tokens selon sa taille et le niveau de détail demandé. Les images doivent être au format JPG ou PNG, avec une taille maximale de 20 MiB.
Ces tokens d’image sont facturés comme des tokens d’entrée classiques.
Points clés à retenir
- Quatre types de tokens : entrée, cachés, sortie, raisonnement
- Le cache automatique réduit les coûts d’entrée de 75 % à 90 % selon le modèle
- Les tokens de raisonnement sont facturés au tarif de sortie
- Le champ
cost_in_usd_ticksdonne le coût exact (10 milliards = $1) - Utilisez le tokenizer pour estimer les coûts avant les traitements en volume
- Les images en entrée consomment 256 à 1 792 tokens selon la taille