Unités et allocations TPM par modèle
Comprendre les allocations TPM
Chaque unité de débit provisionné donne accès à un nombre de tokens par minute (TPM) qui varie selon le modèle. Cette variation reflète la complexité computationnelle de chaque modèle : plus un modèle est puissant, moins une unité offre de TPM.
Les allocations sont séparées entre tokens d’entrée et tokens de sortie, car le coût de génération (sortie) est significativement plus élevé que le coût d’ingestion (entrée).
Tableau des allocations
Voici les allocations TPM par unité pour chaque modèle disponible en débit provisionné :
| Modèle | TPM entrée/unité | TPM sortie/unité |
|---|---|---|
| grok-3 | 2 000 | 400 |
| grok-3-mini | 21 000 | 12 500 |
| grok-4-0709 | 2 000 | 400 |
| grok-4-1-fast (non-reasoning) | 31 500 | 12 500 |
| grok-4-1-fast (reasoning) | 31 500 | 12 500 |
| grok-4.20-0309 (non-reasoning) | 3 000 | 700 |
| grok-4.20-0309 (reasoning) | 3 000 | 700 |
| grok-4.20-multi-agent | 3 000 | 700 |
| grok-code-fast-1 | 31 500 | 4 000 |
Lire ce tableau
Les modèles se répartissent en trois catégories de coût :
Modèles premium (faible TPM/unité)
Les modèles grok-3, grok-4-0709 et grok-4.20 offrent le moins de TPM par unité (2 000-3 000 en entrée, 400-700 en sortie). Ce sont les modèles les plus puissants et les plus coûteux en calcul. Réservez-les aux tâches nécessitant un raisonnement avancé.
Modèles rapides (TPM élevé/unité)
Les variantes fast (grok-4-1-fast, grok-4-fast) offrent jusqu’à 31 500 TPM d’entrée et 12 500 TPM de sortie par unité. Elles constituent le meilleur compromis performance/coût pour la majorité des cas d’usage.
Modèle économique
grok-3-mini offre 21 000 TPM d’entrée et 12 500 TPM de sortie par unité. Il est idéal pour les tâches simples à haut volume : classification, extraction, résumé.
Choisir le bon modèle
Pour optimiser votre allocation de débit provisionné :
- Utilisez les modèles fast pour le support client, les chatbots et les traitements courants
- Réservez grok-4.20 pour l’analyse complexe, la rédaction avancée et le multi-agent
- Déployez grok-3-mini pour le pré-filtrage, la classification et les tâches à haut volume
- Combinez plusieurs modèles avec des pools de capacité distincts (voir le header
x-pt-id)
Points clés à retenir
- Les allocations TPM varient fortement selon le modèle : de 2 000 à 31 500 TPM d’entrée par unité
- Le coût unitaire reste constant à $10/jour, c’est le TPM qui varie
- Les modèles fast offrent le meilleur rapport débit/coût
- Combinez plusieurs modèles pour optimiser les coûts selon le type de tâche