Capacité dédiée et débit provisionné
Qu’est-ce que le débit provisionné
Le débit provisionné (Provisioned Throughput) est le pilier technique de l’offre Enterprise de xAI. Il vous permet de réserver une capacité de traitement dédiée pour vos modèles Grok, garantissant des performances constantes indépendamment de la charge globale de la plateforme.
Pourquoi opter pour une capacité dédiée
En mode pay-as-you-go, vos requêtes partagent l’infrastructure avec tous les autres utilisateurs de l’API. Pendant les pics de demande, vous pouvez observer :
- Des temps de réponse plus longs et plus variables
- Des erreurs de rate limiting (code 429)
- Des dégradations ponctuelles de la disponibilité
Avec le débit provisionné, vous disposez d’une capacité réservée qui élimine ces problèmes. Vos requêtes sont traitées avec une priorité garantie et des temps de réponse plus consistants.
Le concept d’unité
Le débit provisionné fonctionne par unités. Chaque unité correspond à une allocation de tokens par minute (TPM) pour un modèle spécifique. Vous achetez séparément des unités d’entrée (pour vos prompts) et des unités de sortie (pour les réponses).
Le coût est simple : $10 par unité par jour, quel que soit le modèle. Ce qui varie, c’est le nombre de TPM que chaque unité vous donne selon le modèle choisi.
Quand activer le débit provisionné
Le débit provisionné est pertinent dans les situations suivantes :
- Applications en production avec des exigences de latence strictes
- Support client automatisé où les temps de réponse impactent l’expérience utilisateur
- Traitement en temps réel de volumes importants et prévisibles
- Applications critiques où une interruption de service a un coût élevé
En revanche, pour les workloads batch sans contrainte de temps, le prototypage ou les faibles volumes, le pay-as-you-go reste plus économique.
Points clés à retenir
- Le débit provisionné réserve une capacité dédiée à $10 par unité par jour
- L’engagement minimum est de 30 jours
- Le SLA de 99.9% est garanti contractuellement
- Les performances sont constantes indépendamment de la charge globale de la plateforme
- Le pay-as-you-go reste préférable pour les faibles volumes et le prototypage