Aller au contenu principal

Calcul des coûts et exemple concret

La formule de calcul

Le coût du débit provisionné suit une formule simple :

Coût quotidien = (Unités entrée + Unités sortie) x $10

Le nombre d’unités nécessaires dépend de vos besoins en TPM et du modèle choisi. Pour calculer les unités :

Unités entrée = TPM entrée souhaité / TPM par unité du modèle (arrondi au supérieur)
Unités sortie = TPM sortie souhaité / TPM par unité du modèle (arrondi au supérieur)

Exemple détaillé : grok-4-1-fast-reasoning

Supposons que votre application de support client nécessite 100 000 TPM en entrée et 50 000 TPM en sortie avec le modèle grok-4-1-fast-reasoning.

Étape 1 : Calculer les unités d’entrée

Le modèle offre 31 500 TPM d’entrée par unité :

100 000 / 31 500 = 3,17 → 4 unités (arrondi au supérieur)

Capacité réelle obtenue : 4 x 31 500 = 126 000 TPM d’entrée

Étape 2 : Calculer les unités de sortie

Le modèle offre 12 500 TPM de sortie par unité :

50 000 / 12 500 = 4,00 → 4 unités

Capacité réelle obtenue : 4 x 12 500 = 50 000 TPM de sortie

Étape 3 : Calculer le coût

Coût quotidien = (4 + 4) x $10 = $80/jour
Coût sur 30 jours = $80 x 30 = $2 400

Comparaison avec le pay-as-you-go

Pour évaluer la pertinence du débit provisionné, comparez avec le coût en pay-as-you-go pour le même volume.

Estimer la consommation mensuelle en pay-as-you-go

Si vous consommez effectivement 100 000 TPM d’entrée pendant 8 heures par jour, 22 jours ouvrés :

Tokens entrée mensuels = 100 000 x 60 x 8 x 22 = 10,56 milliards de tokens

Le coût en pay-as-you-go dépend alors du tarif au token du modèle. Si le débit provisionné revient moins cher, c’est le bon choix.

Quand le provisionné est avantageux

Le débit provisionné devient rentable quand :

  • Vous utilisez votre capacité de manière soutenue (plus de 6-8 heures par jour)
  • Vous avez besoin de temps de réponse garantis
  • Les pics de trafic de la plateforme impactent votre application
  • Le SLA 99.9% est une exigence métier

Exemple avec grok-4.20 (modèle premium)

Le même besoin avec grok-4.20-0309-reasoning coûte significativement plus cher :

Entrée : 100 000 / 3 000 = 34 unités
Sortie : 50 000 / 700 = 72 unités
Coût quotidien = 106 x $10 = $1 060/jour
Coût sur 30 jours = $31 800

Cet exemple illustre l’importance de choisir le bon modèle. Pour un chatbot de support client, le modèle fast est très probablement suffisant et coûte 13 fois moins que le modèle premium.

Ajuster la capacité

Quelques recommandations pour dimensionner votre débit provisionné :

  • Démarrez modeste : commencez avec une estimation basse et ajustez à la hausse
  • Surveillez l’utilisation : la Management API fournit des métriques détaillées de consommation
  • Prévoyez une marge : réservez 20-30% de capacité supplémentaire pour absorber les pics
  • Utilisez le fallback : les requêtes dépassant votre allocation retombent automatiquement en pay-as-you-go

Points clés à retenir

  • La formule est simple : (unités entrée + unités sortie) x $10/jour
  • Arrondissez toujours au supérieur le nombre d’unités nécessaires
  • Le choix du modèle a un impact majeur sur le coût : un facteur 13x entre fast et premium
  • Le débit provisionné est rentable pour un usage soutenu (6+ heures/jour)
  • Le fallback pay-as-you-go absorbe automatiquement les dépassements