Aller au contenu principal

Chat Completions et Responses dans les batchs

Mis à jour le 30 juillet 2026

Les deux endpoints texte en mode batch

Les endpoints /v1/chat/completions et /v1/responses sont les plus utilisés dans les batchs. Ils permettent de traiter des milliers de requêtes texte avec une réduction de 50 % sur les tokens. Cette leçon détaille leurs spécificités respectives et comment les utiliser efficacement dans un contexte batch.

Chat Completions dans un batch

L’endpoint Chat Completions en mode batch accepte exactement les mêmes paramètres qu’en mode synchrone. La seule différence est l’enveloppe JSONL :

{"custom_id": "sum-1", "method": "POST", "url": "/v1/chat/completions", "body": {"model": "grok-4.5", "messages": [{"role": "system", "content": "Vous êtes un expert en synthèse."}, {"role": "user", "content": "Résumez ce rapport financier en 5 points clés."}], "temperature": 0.3, "max_tokens": 500}}

Tous les paramètres habituels sont disponibles :

  • temperature : contrôlez la créativité (0 pour du déterministe, 1 pour du créatif)
  • max_tokens : limitez la longueur de la réponse pour maîtriser les coûts
  • top_p : alternative à température pour le sampling
  • stop : séquences d’arrêt personnalisées

Cas d’usage typiques

  • Classification de textes (sentiment, catégorie, urgence)
  • Extraction d’informations structurées (entités, dates, montants)
  • Génération de résumés ou de reformulations
  • Traduction en masse

Responses API dans un batch

L’API Responses offre des fonctionnalités supplémentaires. En mode batch, elle permet d’utiliser les outils intégrés de Grok :

{"custom_id": "research-1", "method": "POST", "url": "/v1/responses", "body": {"model": "grok-4.5", "input": "Quelles sont les dernières tendances en IA générative ?", "tools": [{"type": "web_search"}]}}

Les outils disponibles dans les batchs Responses API incluent la recherche web, l’exécution de code, et les serveurs MCP. Ces outils sont traités côté serveur par Grok pendant le traitement du batch.

Différences avec Chat Completions en batch

CaractéristiqueChat CompletionsResponses API
Format d’entréemessages (array)input (string ou array)
Outils serveurNonOui (web search, code, MCP)
Function callingOuiOui
Structured outputsOuiOui
Réduction 50 %OuiOui

Paramètres avancés communs

Certains paramètres méritent une attention particulière en mode batch :

temperature: 0 est recommandé pour les tâches de classification ou d’extraction. En mode batch, la reproductibilité est importante : vous voulez des résultats cohérents sur tout le lot.

max_tokens doit être défini explicitement. Sans limite, une requête peut générer une réponse très longue et consommer des tokens inutilement. Pour un résumé, 200 à 500 tokens suffisent généralement.

response_format permet de forcer un format JSON structuré dans la réponse, utile quand vous traitez les résultats de manière programmatique :

{"custom_id": "classify-1", "method": "POST", "url": "/v1/chat/completions", "body": {"model": "grok-4.5", "messages": [{"role": "user", "content": "Classifie : positif, neutre, négatif"}], "response_format": {"type": "json_object"}}}

Mixer les deux endpoints

Vous pouvez combiner Chat Completions et Responses API dans le même batch. Chaque requête spécifie son endpoint dans le champ url :

{"custom_id": "simple-1", "method": "POST", "url": "/v1/chat/completions", "body": {"model": "grok-4.5", "messages": [{"role": "user", "content": "Résume en une phrase."}]}}
{"custom_id": "search-1", "method": "POST", "url": "/v1/responses", "body": {"model": "grok-4.5", "input": "Actualités IA cette semaine", "tools": [{"type": "web_search"}]}}

Cette flexibilité permet de créer des pipelines où certaines requêtes nécessitent des outils (recherche web pour enrichir des données) tandis que d’autres sont purement textuelles.

Points clés à retenir

  • Chat Completions et Responses API bénéficient tous deux de la réduction de 50 %
  • Chat Completions est idéal pour les tâches textuelles simples et la compatibilité SDK
  • Responses API est nécessaire pour les outils intégrés (web search, code, MCP)
  • Utilisez temperature: 0 et max_tokens pour des résultats reproductibles et économes
  • Les deux endpoints peuvent coexister dans un même batch