Calcul des coûts et exemple concret
La formule de calcul
Le coût du débit provisionné suit une formule simple :
Coût quotidien = (Unités entrée + Unités sortie) x $10
Le nombre d’unités nécessaires dépend de vos besoins en TPM et du modèle choisi. Pour calculer les unités :
Unités entrée = TPM entrée souhaité / TPM par unité du modèle (arrondi au supérieur)
Unités sortie = TPM sortie souhaité / TPM par unité du modèle (arrondi au supérieur)
Exemple détaillé : grok-4-1-fast-reasoning
Supposons que votre application de support client nécessite 100 000 TPM en entrée et 50 000 TPM en sortie avec le modèle grok-4-1-fast-reasoning.
Étape 1 : Calculer les unités d’entrée
Le modèle offre 31 500 TPM d’entrée par unité :
100 000 / 31 500 = 3,17 → 4 unités (arrondi au supérieur)
Capacité réelle obtenue : 4 x 31 500 = 126 000 TPM d’entrée
Étape 2 : Calculer les unités de sortie
Le modèle offre 12 500 TPM de sortie par unité :
50 000 / 12 500 = 4,00 → 4 unités
Capacité réelle obtenue : 4 x 12 500 = 50 000 TPM de sortie
Étape 3 : Calculer le coût
Coût quotidien = (4 + 4) x $10 = $80/jour
Coût sur 30 jours = $80 x 30 = $2 400
Comparaison avec le pay-as-you-go
Pour évaluer la pertinence du débit provisionné, comparez avec le coût en pay-as-you-go pour le même volume.
Estimer la consommation mensuelle en pay-as-you-go
Si vous consommez effectivement 100 000 TPM d’entrée pendant 8 heures par jour, 22 jours ouvrés :
Tokens entrée mensuels = 100 000 x 60 x 8 x 22 = 10,56 milliards de tokens
Le coût en pay-as-you-go dépend alors du tarif au token du modèle. Si le débit provisionné revient moins cher, c’est le bon choix.
Quand le provisionné est avantageux
Le débit provisionné devient rentable quand :
- Vous utilisez votre capacité de manière soutenue (plus de 6-8 heures par jour)
- Vous avez besoin de temps de réponse garantis
- Les pics de trafic de la plateforme impactent votre application
- Le SLA 99.9% est une exigence métier
Exemple avec grok-4.20 (modèle premium)
Le même besoin avec grok-4.20-0309-reasoning coûte significativement plus cher :
Entrée : 100 000 / 3 000 = 34 unités
Sortie : 50 000 / 700 = 72 unités
Coût quotidien = 106 x $10 = $1 060/jour
Coût sur 30 jours = $31 800
Cet exemple illustre l’importance de choisir le bon modèle. Pour un chatbot de support client, le modèle fast est très probablement suffisant et coûte 13 fois moins que le modèle premium.
Ajuster la capacité
Quelques recommandations pour dimensionner votre débit provisionné :
- Démarrez modeste : commencez avec une estimation basse et ajustez à la hausse
- Surveillez l’utilisation : la Management API fournit des métriques détaillées de consommation
- Prévoyez une marge : réservez 20-30% de capacité supplémentaire pour absorber les pics
- Utilisez le fallback : les requêtes dépassant votre allocation retombent automatiquement en pay-as-you-go
Points clés à retenir
- La formule est simple : (unités entrée + unités sortie) x $10/jour
- Arrondissez toujours au supérieur le nombre d’unités nécessaires
- Le choix du modèle a un impact majeur sur le coût : un facteur 13x entre fast et premium
- Le débit provisionné est rentable pour un usage soutenu (6+ heures/jour)
- Le fallback pay-as-you-go absorbe automatiquement les dépassements