Decouvrir le Voice Agent de Grok
Un agent vocal conversationnel en temps reel
L’API Voice Agent de Grok vous permet de creer des assistants vocaux capables de converser en temps reel avec vos utilisateurs. Contrairement a un simple pipeline “transcription puis reponse textuelle puis synthese vocale”, le Voice Agent fonctionne en flux continu : l’utilisateur parle, le modele ecoute, comprend et repond vocalement, le tout dans une seule connexion WebSocket persistante.

Cette approche elimine la latence liee aux allers-retours HTTP traditionnels. Le resultat est une experience conversationnelle naturelle, proche d’un appel telephonique avec un interlocuteur humain.
Comment fonctionne la connexion
Le Voice Agent utilise le protocole WebSocket pour maintenir un canal de communication bidirectionnel. Vous vous connectez a l’endpoint wss://api.x.ai/v1/realtime en fournissant votre cle API dans le header d’autorisation :
const ws = new WebSocket("wss://api.x.ai/v1/realtime", {
headers: {
"Authorization": "Bearer " + XAI_API_KEY
}
});
Une fois la connexion etablie, le serveur envoie un evenement session.created confirmant que la session est active. Vous pouvez alors configurer les parametres de la conversation avec un message session.update.
Architecture du flux audio
Le flux de donnees suit un cycle precis :
- Entree : votre application capture l’audio du microphone, l’encode en base64, et l’envoie via
input_audio_buffer.append - Detection : le serveur detecte automatiquement quand l’utilisateur commence et finit de parler (VAD - Voice Activity Detection)
- Traitement : le modele Grok analyse la parole, comprend le contexte et genere une reponse
- Sortie : l’audio de reponse arrive en streaming via
response.output_audio.delta, chunk par chunk en base64
Ce cycle se repete naturellement tout au long de la conversation, sans intervention manuelle de votre part pour gerer les tours de parole.
Ce que le Voice Agent sait faire
Au-dela de la simple conversation, le Voice Agent peut utiliser des outils pendant l’echange vocal :
- Recherche web : le modele peut chercher des informations en temps reel
- Recherche sur X : interroger les publications de la plateforme X
- Fonctions personnalisees : appeler vos propres APIs (CRM, calendrier, base de donnees)
- Recherche de fichiers : parcourir des collections de documents vectorises
- Serveurs MCP : se connecter a des outils externes via le protocole Model Context Protocol
Cela signifie que votre assistant vocal peut, par exemple, consulter un calendrier pour proposer un creneau, verifier le statut d’une commande dans votre base de donnees, ou chercher une information sur le web, tout en continuant la conversation vocale.
Limites a connaitre
Avant de concevoir votre application, gardez en tete ces contraintes :
- Chaque session est limitee a 30 minutes maximum
- Vous pouvez avoir jusqu’a 100 sessions simultanees
- Le cout est de $0.05 par minute, soit $3.00 par heure
- L’audio est echange en format PCM 24 kHz par defaut (modifiable)
Points cles a retenir
- Le Voice Agent de Grok fonctionne via WebSocket pour une conversation vocale temps reel
- La detection de la parole (VAD) est geree cote serveur, simplifiant votre code
- L’agent peut utiliser des outils (web, X, fonctions, fichiers, MCP) pendant la conversation
- Le tarif est de $0.05/minute avec un maximum de 30 minutes par session et 100 sessions simultanees