Chat Completions et Responses dans les batchs
Mis à jour le 30 juillet 2026
Les deux endpoints texte en mode batch
Les endpoints /v1/chat/completions et /v1/responses sont les plus utilisés dans les batchs. Ils permettent de traiter des milliers de requêtes texte avec une réduction de 50 % sur les tokens. Cette leçon détaille leurs spécificités respectives et comment les utiliser efficacement dans un contexte batch.
Chat Completions dans un batch
L’endpoint Chat Completions en mode batch accepte exactement les mêmes paramètres qu’en mode synchrone. La seule différence est l’enveloppe JSONL :
{"custom_id": "sum-1", "method": "POST", "url": "/v1/chat/completions", "body": {"model": "grok-4.5", "messages": [{"role": "system", "content": "Vous êtes un expert en synthèse."}, {"role": "user", "content": "Résumez ce rapport financier en 5 points clés."}], "temperature": 0.3, "max_tokens": 500}}
Tous les paramètres habituels sont disponibles :
temperature: contrôlez la créativité (0 pour du déterministe, 1 pour du créatif)max_tokens: limitez la longueur de la réponse pour maîtriser les coûtstop_p: alternative à température pour le samplingstop: séquences d’arrêt personnalisées
Cas d’usage typiques
- Classification de textes (sentiment, catégorie, urgence)
- Extraction d’informations structurées (entités, dates, montants)
- Génération de résumés ou de reformulations
- Traduction en masse
Responses API dans un batch
L’API Responses offre des fonctionnalités supplémentaires. En mode batch, elle permet d’utiliser les outils intégrés de Grok :
{"custom_id": "research-1", "method": "POST", "url": "/v1/responses", "body": {"model": "grok-4.5", "input": "Quelles sont les dernières tendances en IA générative ?", "tools": [{"type": "web_search"}]}}
Les outils disponibles dans les batchs Responses API incluent la recherche web, l’exécution de code, et les serveurs MCP. Ces outils sont traités côté serveur par Grok pendant le traitement du batch.
Différences avec Chat Completions en batch
| Caractéristique | Chat Completions | Responses API |
|---|---|---|
| Format d’entrée | messages (array) | input (string ou array) |
| Outils serveur | Non | Oui (web search, code, MCP) |
| Function calling | Oui | Oui |
| Structured outputs | Oui | Oui |
| Réduction 50 % | Oui | Oui |
Paramètres avancés communs
Certains paramètres méritent une attention particulière en mode batch :
temperature: 0 est recommandé pour les tâches de classification ou d’extraction. En mode batch, la reproductibilité est importante : vous voulez des résultats cohérents sur tout le lot.
max_tokens doit être défini explicitement. Sans limite, une requête peut générer une réponse très longue et consommer des tokens inutilement. Pour un résumé, 200 à 500 tokens suffisent généralement.
response_format permet de forcer un format JSON structuré dans la réponse, utile quand vous traitez les résultats de manière programmatique :
{"custom_id": "classify-1", "method": "POST", "url": "/v1/chat/completions", "body": {"model": "grok-4.5", "messages": [{"role": "user", "content": "Classifie : positif, neutre, négatif"}], "response_format": {"type": "json_object"}}}
Mixer les deux endpoints
Vous pouvez combiner Chat Completions et Responses API dans le même batch. Chaque requête spécifie son endpoint dans le champ url :
{"custom_id": "simple-1", "method": "POST", "url": "/v1/chat/completions", "body": {"model": "grok-4.5", "messages": [{"role": "user", "content": "Résume en une phrase."}]}}
{"custom_id": "search-1", "method": "POST", "url": "/v1/responses", "body": {"model": "grok-4.5", "input": "Actualités IA cette semaine", "tools": [{"type": "web_search"}]}}
Cette flexibilité permet de créer des pipelines où certaines requêtes nécessitent des outils (recherche web pour enrichir des données) tandis que d’autres sont purement textuelles.
Points clés à retenir
- Chat Completions et Responses API bénéficient tous deux de la réduction de 50 %
- Chat Completions est idéal pour les tâches textuelles simples et la compatibilité SDK
- Responses API est nécessaire pour les outils intégrés (web search, code, MCP)
- Utilisez
temperature: 0etmax_tokenspour des résultats reproductibles et économes - Les deux endpoints peuvent coexister dans un même batch