Aller au contenu principal

Grok Voice : conversations vocales

Mis à jour le 29 juillet 2026

Parler avec Grok

Après le texte et les images, la voix. Vous pouvez tenir de véritables conversations orales avec l’assistant, et il faut d’emblée distinguer deux services que l’on confond souvent : le Voice Agent, conçu pour les conversations interactives en temps réel, et le Text-to-Speech (TTS), qui se contente de transformer un texte en audio. Le premier écoute et répond, le second lit. Choisir le mauvais des deux est la cause la plus fréquente de projets vocaux qui déçoivent.

Grok Voice Agent

Voice Agent : la conversation en temps réel

Le Voice Agent est le service le plus immersif : il vous permet de parler directement avec Grok comme avec un interlocuteur humain. Il repose sur une connexion WebSocket assurant un échange audio bidirectionnel en temps réel. Vous parlez dans votre microphone, Grok écoute et comprend votre message en continu, puis formule sa réponse vocalement ; la détection de tour de parole, ou VAD, gère automatiquement les silences et les transitions. C’est ce dernier point qui distingue une conversation d’un échange de messages vocaux : vous pouvez hésiter sans que le système croie que vous avez fini, et l’interrompre lorsqu’il part dans la mauvaise direction.

Cinq voix sont proposées, chacune avec sa personnalité, et le choix se raisonne en fonction de l’usage plutôt que du goût personnel.

VoixCaractèreUsage typique
EveÉnergique et enjouéeÉchanges dynamiques
AraChaleureuse et amicaleTon bienveillant
RexConfiant et clairContextes professionnels
SalDoux et équilibréConversation apaisée
LeoAutoritaire et puissantTon assertif

La restitution ne se limite pas au timbre. Des tags expressifs enrichissent les réponses : les pauses installent un rythme naturel, le rire allège un moment, le chuchotement crée un effet de proximité. Employés avec parcimonie, ils font la différence entre une voix correcte et une voix que l’on écoute jusqu’au bout ; à chaque phrase, ils produisent l’effet inverse.

Le Voice Agent peut également mobiliser des outils pendant la conversation : recherches web en temps réel, interrogation de bases de données, appel d’APIs personnalisées. Vous demandez oralement une information à jour et Grok vous répond oralement avec le résultat — un assistant de support consulte ainsi l’état réel d’une commande au lieu de réciter une procédure générique.

Text-to-Speech : la lecture d’un texte

Le TTS répond à un besoin plus simple : convertir un texte écrit en audio parlé. On l’emploie pour générer des narrations de vidéos ou de podcasts, produire des messages vocaux automatisés, rendre un contenu textuel accessible aux personnes malvoyantes, ou diffuser des annonces et des notifications vocales. Le service couvre plus de vingt langues, dont le français, et gère le code-switching, c’est-à-dire le changement de langue en cours de phrase — précieux dès qu’un texte français cite un titre anglais ou un nom de produit étranger, que les moteurs plus rigides écorchent.

L’appel API tient en quelques lignes :

response = client.audio.speech.create(
    input="Bienvenue dans cette formation sur Grok.",
    voice="eve",
    model="tts-1"
)

Le résultat est un fichier audio au format MP3, directement diffusable ou intégrable dans un montage.

Ce que la voix change en entreprise

Le premier terrain est le service client : déployé en assistant vocal, le Voice Agent traite les questions courantes et effectue des recherches en temps réel, absorbant le volume répétitif sans faire attendre l’appelant. La logique s’étend à la téléphonie existante, puisque xAI supporte les protocoles standards SIP et G.711 : l’intégration passe par des plateformes comme LiveKit, sans reconstruire l’infrastructure d’appels.

Le TTS sert surtout la production de contenu : vos articles, rapports et présentations existent en version audio, avec une voix choisie selon le ton recherché. Dans les deux cas, l’accessibilité mérite d’être posée dès la conception plutôt qu’ajoutée après coup — ces capacités rendent l’IA utilisable par des personnes que les interfaces textuelles tiennent à l’écart.

Ce que cela coûte

Le Voice Agent est facturé 0,05 $ par minute, soit 3,00 $ par heure, avec un maximum de 100 sessions simultanées et une durée maximale de 30 minutes par session. Le Text-to-Speech revient à 4,20 $ par million de caractères, avec un plafond de 100 requêtes simultanées. Ces deux plafonds de concurrence sont à vérifier avant tout déploiement grand public : ils dimensionnent le nombre d’appels que vous pouvez traiter en parallèle, et une campagne qui les dépasse se traduit par des appelants en attente, non par une facture plus élevée.

Tarifs relevés le 5 août 2026 — les prix évoluent régulièrement : avant tout calcul de budget, vérifiez la grille en vigueur sur la page officielle des modèles et tarifs xAI.

Points clés à retenir

  • Le Voice Agent permet des conversations orales en temps réel avec Grok via WebSocket
  • Cinq voix distinctes sont disponibles avec des personnalités différentes
  • Le TTS convertit du texte en audio MP3 dans plus de 20 langues
  • Le Voice Agent peut utiliser des outils (recherche web, APIs) pendant la conversation
  • Les protocoles de téléphonie standards sont supportés pour l’intégration entreprise