Pourquoi la Responses API ?
Un nouvel endpoint pour de nouvelles ambitions
La Responses API est le nouvel endpoint principal de xAI pour interagir avec les modèles Grok. Si vous connaissez déjà l’endpoint Chat Completions (compatible OpenAI), vous vous demandez probablement pourquoi xAI a créé un second endpoint. La réponse tient en un mot : évolution.
Chat Completions reste disponible pour la rétro-compatibilité avec les SDK OpenAI, mais toutes les nouvelles fonctionnalités de la plateforme xAI sont ajoutées en priorité à la Responses API. C’est donc l’endpoint sur lequel vous devez investir votre temps d’apprentissage.
Stateful vs Stateless : le changement fondamental
La différence la plus importante entre les deux endpoints est la gestion de l’état de la conversation.
Chat Completions (stateless)
Avec Chat Completions, chaque requête est indépendante. Vous devez renvoyer l’intégralité de l’historique de conversation à chaque appel :
{
"model": "grok-4.20-reasoning",
"messages": [
{"role": "system", "content": "Tu es un assistant."},
{"role": "user", "content": "Bonjour"},
{"role": "assistant", "content": "Bonjour ! Comment puis-je vous aider ?"},
{"role": "user", "content": "Parle-moi de l'IA."}
]
}
Plus la conversation est longue, plus la requête grossit. Vous gérez vous-même le contexte.
Responses API (stateful)
Avec la Responses API, le serveur xAI conserve l’historique. Vous envoyez simplement votre nouveau message et une référence à la réponse précédente :
{
"model": "grok-4.20-reasoning",
"input": "Parle-moi de l'IA.",
"previous_response_id": "resp-abc123"
}
Le serveur reconstruit le contexte complet pour vous. Moins de données à transmettre, moins de code à écrire, moins d’erreurs possibles.
Les fonctionnalités exclusives
Plusieurs fonctionnalités ne sont disponibles que via la Responses API :
- Outils serveur natifs :
web_search,x_search,code_interpretersont exécutés directement par les serveurs xAI, sans configuration de votre côté - Chaînage de conversations : via
previous_response_id, le modèle conserve tout le contexte sans que vous ayez à le renvoyer - Stockage persistant : avec
store: true, vos réponses sont conservées 30 jours et récupérables via GET - Raisonnement chiffré : récupérez le raisonnement interne des modèles Grok 4 sous forme chiffrée pour le réutiliser dans les requêtes suivantes
- Suivi des coûts granulaire :
cost_in_nano_usddans chaque réponse pour un contrôle précis de vos dépenses
Quand utiliser quel endpoint ?
Utilisez Chat Completions uniquement si vous migrez un projet existant depuis l’API OpenAI et que vous ne pouvez pas modifier votre code immédiatement.
Pour tout nouveau projet, utilisez la Responses API. Elle est plus simple, plus puissante, et c’est elle qui recevra les futures améliorations de la plateforme xAI.
Points clés à retenir
- La Responses API est l’endpoint principal de xAI — Chat Completions est legacy
- Elle est stateful : le serveur gère l’historique de conversation
- Elle offre des outils serveur natifs (recherche web, X, interpréteur de code)
- Le stockage persistant permet de reprendre des conversations jusqu’à 30 jours
- Tout nouveau projet devrait utiliser la Responses API