Aller au contenu principal

Concept de la Batch API

Traitement asynchrone en masse

La Batch API de xAI permet d’envoyer des milliers de requetes en une seule operation, puis de recuperer les resultats une fois le traitement termine. Contrairement aux appels synchrones ou vous attendez chaque reponse individuellement, le mode batch fonctionne de maniere asynchrone : vous soumettez un lot, vous continuez votre travail, et vous revenez chercher les resultats plus tard.

Cette approche repond a un besoin concret. Lorsque vous devez traiter 10 000 articles pour en extraire un resume, classifier 50 000 tickets de support, ou generer des descriptions pour un catalogue de produits, envoyer les requetes une par une serait a la fois lent et couteux. La Batch API resout ces deux problemes simultanement.

Reduction de 50 % sur les tokens texte

L’avantage economique est le principal argument de la Batch API. xAI applique une reduction de 50 % sur les tarifs des tokens texte pour toutes les requetes traitees en mode batch. Si votre application genere un volume important de texte et que vous pouvez tolerer un delai de traitement, cette reduction divise votre facture par deux.

Les generations d’images et de videos conservent leurs tarifs standard, meme en mode batch. La reduction s’applique uniquement aux tokens d’entree et de sortie texte.

-50%
Tokens texte
24h
Delai typique
50K
Requetes par fichier
200 MB
Taille max JSONL

Workflow en quatre etapes

Le fonctionnement de la Batch API suit un schema simple et previsible :

  1. Creer un batch vide via POST /v1/batches
  2. Ajouter des requetes au batch, soit une par une en JSON, soit en masse via un fichier JSONL
  3. Surveiller la progression en interrogeant le statut du batch
  4. Recuperer les resultats une fois le traitement termine

Ce workflow decouple la soumission du traitement. Vous n’avez pas besoin de maintenir une connexion ouverte pendant que Grok traite vos requetes. Le delai de traitement typique est de 24 heures, mais il peut etre plus court selon la charge et le volume soumis.

Endpoints supportes

La Batch API ne se limite pas a la generation de texte. Vous pouvez soumettre des requetes vers plusieurs endpoints dans un meme batch :

  • /v1/chat/completions — completions texte classiques
  • /v1/responses — API Responses avec outils integres
  • /v1/images/generations — generation d’images
  • /v1/images/edits — edition d’images
  • /v1/videos/generations — generation de videos
  • /v1/videos/edits — edition de videos

Cette polyvalence permet de mixer differents types de requetes dans un meme lot. Vous pouvez par exemple combiner des completions texte et des generations d’images dans un seul batch.

Quand utiliser la Batch API

La Batch API est pertinente dans trois scenarios principaux :

  • Traitement de donnees en masse : classification, extraction, resume de milliers de documents
  • Generation de contenu : descriptions produits, traductions, variations creatives a grande echelle
  • Pipelines de donnees : enrichissement de bases de donnees, pre-calcul d’embeddings, analyses periodiques

Si votre cas d’usage necessite une reponse immediate (chatbot, assistant en temps reel), la Batch API n’est pas adaptee. Elle est concue pour les traitements ou le delai de quelques heures est acceptable.

Points cles a retenir

  • La Batch API traite les requetes de maniere asynchrone avec un delai typique de 24 heures
  • Les tokens texte beneficient d’une reduction de 50 % par rapport aux tarifs synchrones
  • Le workflow suit quatre etapes : creer, ajouter, surveiller, recuperer
  • Six endpoints sont supportes, du texte a la video
  • Elle est adaptee au traitement de masse, pas aux interactions en temps reel