Concept de la Batch API
Mis à jour le 30 juillet 2026
Traitement asynchrone en masse
La Batch API de xAI permet d’envoyer des milliers de requêtes en une seule opération, puis de récupérer les résultats une fois le traitement terminé. Contrairement aux appels synchrones où vous attendez chaque réponse individuellement, le mode batch fonctionne de manière asynchrone : vous soumettez un lot, vous continuez votre travail, et vous revenez chercher les résultats plus tard.
Cette approche répond à un besoin concret. Lorsque vous devez traiter 10 000 articles pour en extraire un résumé, classifier 50 000 tickets de support, ou générer des descriptions pour un catalogue de produits, envoyer les requêtes une par une serait à la fois lent et coûteux. La Batch API résout ces deux problèmes simultanément.
Réduction de 50 % sur les tokens texte
L’avantage économique est le principal argument de la Batch API. xAI applique une réduction de 50 % sur les tarifs des tokens texte pour toutes les requêtes traitées en mode batch. Si votre application génère un volume important de texte et que vous pouvez tolerer un délai de traitement, cette réduction divise votre facture par deux.
Les générations d’images et de vidéos conservent leurs tarifs standard, même en mode batch. La réduction s’applique uniquement aux tokens d’entrée et de sortie texte.
Workflow en quatre étapes
Le fonctionnement de la Batch API suit un schéma simple et prévisible :
- Créer un batch vide via
POST /v1/batches - Ajouter des requêtes au batch, soit une par une en JSON, soit en masse via un fichier JSONL
- Surveiller la progression en interrogeant le statut du batch
- Récupérer les résultats une fois le traitement terminé
Ce workflow decouple la soumission du traitement. Vous n’avez pas besoin de maintenir une connexion ouverte pendant que Grok traite vos requêtes. Le délai de traitement typique est de 24 heures, mais il peut être plus court selon la charge et le volume soumis.
Endpoints supportés
La Batch API ne se limite pas à la génération de texte. Vous pouvez soumettre des requêtes vers plusieurs endpoints dans un même batch :
/v1/chat/completions— completions texte classiques/v1/responses— API Responses avec outils intégrés/v1/images/generations— génération d’images/v1/images/edits— édition d’images/v1/videos/generations— génération de vidéos/v1/videos/edits— édition de vidéos
Cette polyvalence permet de mixer différents types de requêtes dans un même lot. Vous pouvez par exemple combiner des complétions texte et des générations d’images dans un seul batch.
Quand utiliser la Batch API
La Batch API est pertinente dans trois scénarios principaux :
- Traitement de données en masse : classification, extraction, résumé de milliers de documents
- Génération de contenu : descriptions produits, traductions, variations créatives à grande échelle
- Pipelines de données : enrichissement de bases de données, pré-calcul d’embeddings, analyses périodiques
Si votre cas d’usage nécessite une réponse immédiate (chatbot, assistant en temps réel), la Batch API n’est pas adaptée. Elle est conçue pour les traitements ou le délai de quelques heures est acceptable.
Points clés à retenir
- La Batch API traite les requêtes de manière asynchrone avec un délai typique de 24 heures
- Les tokens texte bénéficient d’une réduction de 50 % par rapport aux tarifs synchrones
- Le workflow suit quatre étapes : créer, ajouter, surveiller, récupérer
- Six endpoints sont supportés, du texte à la vidéo
- Elle est adaptée au traitement de masse, pas aux interactions en temps réel