Voice Agent et TTS
Les capacités audio de Grok
Depuis décembre 2025, xAI propose deux services audio via son API : le Voice Agent pour les conversations vocales en temps réel, et le Text-to-Speech (TTS) pour la synthèse vocale. Ces services permettent de construire des interfaces conversationnelles vocales complètes, du standard téléphonique automatisé à l’assistant vocal embarqué.
Voice Agent API
Le Voice Agent API permet de créer des conversations vocales bidirectionnelles en temps réel. L’utilisateur parle, le modèle écoute, comprend et répond oralement — le tout avec une latence suffisamment faible pour une conversation naturelle.
Caractéristiques principales
- Sessions concurrentes : jusqu’à 100 sessions simultanées
- Durée maximale : 30 minutes par session
- Tarification : $0.05 par minute, soit $3.00 par heure
- Temps réel : latence optimisée pour la conversation naturelle
Cas d’usage
Le Voice Agent est conçu pour des scénarios où l’interaction vocale apporte une valeur ajoutée par rapport au texte :
- Service client automatisé — accueil téléphonique, routage d’appels, réponses aux questions fréquentes
- Assistants vocaux embarqués — dans des applications mobiles ou des appareils IoT
- Tutoring vocal — accompagnement pédagogique par la voix
- Accessibilité — interface vocale pour les utilisateurs qui ne peuvent pas ou ne souhaitent pas taper
Considérations de coût
À $3.00 par heure, le Voice Agent est économique pour des interactions courtes et ponctuelles. Mais le coût peut devenir significatif pour des services à fort volume. Un centre d’appels traitant 1 000 heures de conversation par mois représenterait un budget de $3 000.
Le système de tiers s’applique également aux services Voice et Imagine, mais les montées en tier nécessitent une demande manuelle — contrairement aux modèles texte où c’est automatique.
Text-to-Speech (TTS)
Le service TTS convertit du texte en parole avec des voix synthétiques de haute qualité. Il se facture au volume de texte converti.
Tarification et limites
| Service | Coût | Limite |
|---|---|---|
| Text-to-Speech | $4.20 / 1M caractères | 100 requêtes concurrentes |
Pour estimer vos coûts : un article de blog de 5 000 caractères coûterait environ $0.02 à convertir en audio. Un livre audio de 500 000 caractères reviendrait à environ $2.10.
Voix disponibles
xAI propose plusieurs voix synthétiques avec des caractéristiques variées : tonalité, rythme, genre. Le choix de la voix se fait au moment de la requête API, ce qui permet d’adapter la voix au contexte — une voix professionnelle pour un rapport, une voix chaleureuse pour un tutoriel.
Applications du TTS
- Podcasts automatisés — transformer vos articles de blog en contenu audio
- Narration — ajouter une couche audio à vos applications éducatives
- Accessibilité — rendre du contenu textuel accessible aux personnes malvoyantes
- Notifications vocales — alertes et rappels parlés dans les applications
- Contenu multilingue — générer des versions audio dans différentes langues
Voice Agent vs TTS : quel service choisir ?
La distinction est simple :
- Voice Agent : pour les conversations interactives en temps réel. L’utilisateur parle, le modèle répond. C’est bidirectionnel.
- TTS : pour la conversion unidirectionnelle de texte en parole. Pas d’interaction, juste de la synthèse vocale.
Si vous construisez un assistant conversationnel, vous aurez besoin du Voice Agent. Si vous voulez simplement lire du texte à voix haute, le TTS suffit.
Intégration dans une architecture existante
Les services audio de Grok s’intègrent dans la même API que les modèles texte et image. Vous utilisez les mêmes clés API, le même système de facturation et le même tableau de bord sur console.x.ai.
Cette unification simplifie considérablement l’architecture : un même projet peut utiliser Grok 4.20 pour le raisonnement, grok-code-fast-1 pour le code, Grok Imagine pour les visuels et le Voice Agent pour l’interaction orale, le tout avec un seul compte développeur.
Points clés à retenir
- Le Voice Agent coûte $0.05/min ($3.00/h) pour des conversations en temps réel
- Le TTS coûte $4.20 par million de caractères pour la synthèse vocale
- Voice Agent : 100 sessions concurrentes, 30 min max par session
- TTS : 100 requêtes concurrentes
- Voice Agent = bidirectionnel, TTS = unidirectionnel
- Les montées de tier Voice/Imagine nécessitent une demande manuelle