Aller au contenu principal

Tarification détaillée des modèles

Mis à jour le 29 juillet 2026

Choisir le bon modèle pour votre budget

Le choix du modèle est la décision technique qui pèse le plus lourd sur votre facture Grok : l’écart entre deux modèles de la gamme se chiffre en facteur, pas en pourcentage, et le plus cher n’apporte souvent aucune amélioration perceptible sur un cas d’usage donné.

La grille xAI ajoute une particularité à intégrer dès la conception : la tarification à palier. Chaque modèle texte applique un tarif de base tant que la requête reste sous 200 000 tokens de contexte, puis un tarif doublé au-delà. Les tokens d’entrée servis depuis le cache échappent en grande partie à cette logique.

Modèles texte et code

ModèleContexteEntrée ($/M)Entrée cachée ($/M)Sortie ($/M)
grok-4.5500k$2.00 / $4.00$0.30 / $0.60$6.00 / $12.00
grok-4.31M$1.25 / $2.50$0.20 / $0.40$2.50 / $5.00
grok-4.20-0309 (reasoning / non-reasoning)1M$1.25 / $2.50$0.20 / $0.40$2.50 / $5.00
grok-4.20-multi-agent-03091M$1.25 / $2.50$0.20 / $0.40$2.50 / $5.00
grok-build-0.1256k$1.00 / $2.00$0.20 / $0.40$2.00 / $4.00

Dans chaque cellule, le premier chiffre s’applique sous 200 000 tokens de contexte et le second au-delà. Une requête grok-4.5 embarquant 250 000 tokens de contexte est donc facturée $4.00 par million en entrée et $12.00 par million en sortie : les 50 000 tokens qui dépassent le seuil ont doublé le prix de la requête entière, pas seulement celui de la partie excédentaire. Surveillez ce palier de près sur les applications à historique long, où le contexte grossit conversation après conversation.

La lecture de cette grille livre quatre repères. grok-4.5 est le modèle phare, le plus cher, avec un raisonnement configurable. grok-4.3 offre le meilleur rapport qualité-prix tout en disposant de la plus grande fenêtre, 1 million de tokens. Les trois variantes de grok-4.20-0309 restent au catalogue au même tarif que grok-4.3. Enfin, grok-build-0.1 est à la fois le moins cher et le plus rapide sur les tâches de code, au prix d’une fenêtre plus courte de 256 000 tokens.

Génération visuelle : Grok Imagine

Pour l’image et la vidéo, la facturation abandonne le token au profit de l’unité produite ou de la seconde générée, ce qui simplifie beaucoup l’estimation. Comptez $0.02 par image avec grok-imagine-image, en 1K comme en 2K, et $0.05 avec grok-imagine-image-quality pour un rendu supérieur. Côté vidéo, grok-imagine-video revient à $0.05 par seconde en 480p, 720p ou 1080p, et grok-imagine-video-1.5, disponible depuis juin 2026, à $0.08 par seconde.

Voice API : agent vocal, TTS et STT

Les services vocaux se facturent au temps ou au caractère. L’agent vocal temps réel coûte $0.05 par minute, soit $3.00 par heure de conversation, plus $0.004 par message pour l’entrée texte en session temps réel. La synthèse vocale revient à $15.00 par million de caractères. La reconnaissance vocale distingue ses deux modes : $0.10 par heure d’audio en traitement par lot via REST, $0.20 par heure en streaming — le temps réel se paie du double, arbitrage à poser selon que vous transcrivez un flux en direct ou une archive. Depuis juillet 2026, le Voice Agent Builder permet d’assembler des agents vocaux sans écrire de code, et 21 nouvelles voix ont rejoint le catalogue.

Le levier du cache d’entrée

Revenez à la colonne « entrée cachée » du tableau : c’est la plus rentable de toutes, puisqu’un token déjà en cache coûte cinq à sept fois moins cher qu’un token standard. Si votre assistant réutilise le même prompt système et le même préambule d’instructions à chaque requête, ce préfixe est facturé $0.20 par million sur grok-4.3 au lieu de $1.25.

Encore faut-il structurer vos prompts pour que le cache opère : début strictement stable — prompt système, instructions, exemples — et tout ce qui varie repoussé à la fin, question de l’utilisateur ou données du jour. Une variable insérée en tête, ne serait-ce qu’un horodatage, invalide le préfixe entier et vous fait payer plein tarif des tokens que vous auriez eus à prix réduit.

Estimer sa facture mensuelle

Prenons une application de service client traitant 10 000 requêtes par jour sur grok-4.3, avec 2 000 tokens en entrée et 500 en sortie par requête — donc largement sous le palier des 200 000 tokens — et un taux de cache de 60 %. Sur trente jours, l’entrée totalise 600 millions de tokens et la sortie 150 millions.

PosteVolume mensuelTarif grok-4.3Coût
Entrée cachée (60 %)360M$0.20/M$72
Entrée non cachée (40 %)240M$1.25/M$300
Sortie150M$2.50/M$375
Total~$747/mois

Le même trafic servi par grok-4.5 reviendrait à environ le double : $108 d’entrée cachée, $480 d’entrée pleine et $900 de sortie, soit près de $1 488 par mois. Avant d’arbitrer, posez-vous la seule question qui compte : ces $741 supplémentaires achètent-ils une qualité de réponse que vos utilisateurs remarqueront ? Sur un service client bien cadré par ses instructions, la réponse est souvent non.

Tarifs relevés le 5 août 2026 — les prix évoluent régulièrement : avant tout calcul de budget, vérifiez la grille en vigueur sur la page officielle des modèles et tarifs xAI.

Points clés à retenir

  • Tarification à palier : tarif de base sous 200k tokens de contexte, tarif doublé au-delà — surveillez ce seuil
  • grok-4.3 ($1.25 / $2.50 par M) est le meilleur rapport qualité-prix ; grok-4.5 ($2.00 / $6.00) le modèle phare ; grok-build-0.1 ($1.00 / $2.00) le moins cher pour le code
  • Le cache d’entrée divise le coût des préfixes stables par 5 à 7 — structurez vos prompts en conséquence
  • Multimédia : image dès $0.02, vidéo dès $0.05/s ; voix : $3.00/heure d’agent vocal, TTS $15.00/M caractères, STT dès $0.10/heure
  • Estimez votre facture en combinant volume, taux de cache, palier de contexte et choix de modèle
  • Les tarifs évoluent : vérifiez la page officielle des modèles (docs.x.ai) avant tout engagement budgétaire