Aller au contenu principal

Quatre types de tokens

Mis à jour le 29 juillet 2026

Comprendre la facturation par token

Une facture d’API Grok n’est pas une simple multiplication entre un volume et un prix. Quatre types de tokens y coexistent, chacun avec ses règles de comptage et son tarif propre, et deux applications consommant le même nombre total de tokens peuvent payer des sommes très différentes. Savoir lire cette décomposition est la condition pour estimer un budget avant le lancement — et pour comprendre, une fois en production, d’où vient la ligne qui dérape.

4
Types de tokens
85 %
Réduction tokens cachés
1 792
Tokens max par image
1M
Contexte maximum

Les tokens texte, et l’écart entrée-sortie

Les tokens texte forment le gros du volume : tout ce que vous envoyez — prompt système, historique de conversation, message de l’utilisateur — et tout ce que le modèle produit en retour. Sur grok-4.5, l’entrée est facturée $2.00 par million de tokens et la sortie $6.00 par million. Sur grok-4.3, ces valeurs tombent à $1.25 et $2.50 par million.

Retenez surtout la forme du rapport : la sortie coûte systématiquement plus cher que l’entrée, dans un facteur de trois sur grok-4.5. Générer du texte mobilise davantage de calcul que lire du contexte, et la grille tarifaire reflète cette asymétrie. La conséquence pratique est contre-intuitive : ajouter mille tokens d’exemples à votre prompt système coûte souvent moins cher que laisser le modèle produire mille tokens de verbiage superflu. Une instruction de concision bien placée est parfois le meilleur levier d’économie de toute une application.

Les tokens image

Une image envoyée à l’API est convertie en tokens avant d’être analysée. Le compte varie de 256 tokens pour une vignette basse résolution à 1 792 tokens pour une image haute définition, selon la taille et le niveau de détail. Ces tokens sont facturés au tarif de l’entrée texte, ce qui rend l’arbitrage facile à poser : chaque image lourde équivaut, sur votre facture, à environ un millier et demi de mots de prompt.

D’où un réflexe à installer dans le pipeline en amont de l’appel. Redimensionnez systématiquement à la résolution minimale que votre cas d’usage exige, appliquez une compression JPEG raisonnable, et cessez d’envoyer du 4K quand une image standard suffit à répondre à la question posée. Sur un service traitant des milliers de photos par jour, ce simple redimensionnement divise la facture visuelle sans dégrader la qualité des réponses. Notez au passage les contraintes de format : seuls le JPG et le PNG sont acceptés, dans la limite de 20 MiB par fichier.

Les tokens cachés

Les tokens cachés sont des tokens d’entrée que le système de cache automatique de l’API a déjà mémorisés lors d’un appel précédent. Ils vous sont facturés à un tarif fortement réduit : $0.30 par million sur grok-4.5 au lieu de $2.00, soit environ 85 % d’économie, et $0.20 par million sur grok-4.3 au lieu de $1.25.

Le mécanisme qui déclenche cette mise en cache fera l’objet de la section suivante du cours. Pour l’instant, sachez simplement où le lire : le champ cached_tokens de l’objet usage renvoyé avec chaque réponse vous indique combien de vos tokens d’entrée ont bénéficié du tarif réduit. C’est la première métrique à instrumenter si vous voulez piloter vos coûts sérieusement.

Les tokens de raisonnement

Le quatrième type concerne les modèles qui réfléchissent avant de répondre, comme la variante grok-4.20-0309-reasoning. Les tokens de raisonnement correspondent à cette délibération interne, produite avant la réponse visible.

C’est ici que se cache la surprise de facturation la plus fréquente : ces tokens sont comptabilisés au tarif de sortie, et non d’entrée. Sur grok-4.5, cela représente $6.00 par million. Comme un raisonnement peut mobiliser plusieurs milliers de tokens sur une question complexe, la part invisible de la réponse dépasse parfois la part visible. Ajoutez-y un détail qui déroute souvent les équipes : grok-4.20-0309 ne restitue pas le contenu de raisonnement (reasoning_content) en clair dans la réponse API. Vous payez une chaîne de pensée que vous ne pouvez pas lire. Ce n’est pas une raison d’écarter le raisonnement, mais une raison de ne l’activer que là où il change réellement la qualité du résultat.

Tarifs relevés le 5 août 2026 — les prix évoluent régulièrement : avant tout calcul de budget, vérifiez la grille en vigueur sur la page officielle des modèles et tarifs xAI.

Points clés à retenir

  • Quatre types de tokens existent : texte, image, cached (tarif réduit) et reasoning (facturés en sortie)
  • Les tokens image varient de 256 à 1 792 selon la taille et le détail de l’image
  • Les tokens cachés offrent environ 85 % de réduction sur grok-4.5
  • Les tokens de raisonnement sont facturés au tarif de sortie, ce qui peut représenter un coût important
  • Choisissez le bon modèle selon votre besoin : grok-4.3 revient nettement moins cher que grok-4.5, en entrée comme en sortie