Aller au contenu principal

Langues et Synthèse Multilingue

Mis à jour le 29 juillet 2026

Vingt langues pour une audience mondiale

Le TTS de Grok couvre vingt langues, chacune avec ses accents et ses prononciations naturelles. La conséquence pratique est simple : une application audio destinée à un public international n’a plus besoin de jongler entre plusieurs fournisseurs de synthèse vocale, avec les écarts de qualité et les contrats séparés que cela suppose. Une même intégration, un même format de requête, et vous passez du français au japonais en changeant un seul paramètre.

Cette couverture pèse aussi sur la conception de vos produits. Une plateforme de e-learning qui publiait ses modules audio uniquement en anglais peut les décliner en dix langues sans réenregistrer un seul comédien, et sans renégocier de droits de voix.

Les langues supportées

Code BCP-47LangueRégion
frFrançaisFrance
enAnglaisInternational
deAllemandAllemagne
es-ESEspagnolEspagne
es-MXEspagnolMexique
pt-BRPortugaisBrésil
pt-PTPortugaisPortugal
itItalienItalie
jaJaponaisJapon
koCoréenCorée du Sud
zhChinoisChine
hiHindiInde
ar-EG / ar-SA / ar-AEArabeÉgypte / Arabie Saoudite / Émirats
ruRusseRussie
trTurcTurquie
idIndonésienIndonésie
viVietnamienVietnam
bnBengaliBangladesh / Inde

Déclarer la langue de chaque requête

Le paramètre language est obligatoire : aucune requête TTS ne part sans lui. Vous indiquez soit un code BCP-47 explicite, soit la valeur auto qui laisse le modèle déduire la langue à partir du texte fourni.

{
  "text": "Bonjour, comment allez-vous aujourd'hui ?",
  "voice_id": "ara",
  "language": "fr"
}

La détection automatique rend service quand la langue de l’utilisateur n’est pas connue à l’avance : un formulaire de contact ouvert à tous, un flux de commentaires, un chatbot international. Elle reste néanmoins une inférence, et une inférence se trompe. Sur une phrase de trois mots, ou sur un texte mêlant deux langues dès la première ligne, le modèle peut choisir le mauvais profil phonétique et vous livrer un français prononcé à l’anglaise. Chaque fois que vous connaissez la langue, écrivez-la : le résultat est plus fiable.

Le code-switching en cours de phrase

Le moteur sait changer de prononciation à l’intérieur d’une même phrase. Vous déclarez une langue principale, et les segments étrangers reçoivent malgré tout leur articulation d’origine.

{
  "text": "Le concept de machine learning est fondamental en intelligence artificielle.",
  "voice_id": "rex",
  "language": "fr"
}

Ici, « machine learning » sortira avec une prononciation anglaise pendant que le reste de la phrase conserve son accent français. Le gain est net sur tous les contenus techniques, scientifiques ou commerciaux, où le vocabulaire anglo-saxon s’invite naturellement : un module de formation sur le cloud, une revue de presse tech, une fiche produit truffée d’anglicismes.

Les variantes régionales

L’espagnol, le portugais et l’arabe existent en plusieurs variantes, et le choix n’est pas cosmétique : il touche la prononciation, l’intonation et une partie du vocabulaire. Entre es-ES et es-MX, vous arbitrez entre l’intonation et le lexique castillans d’un côté, mexicains de l’autre. Entre pt-BR et pt-PT, l’écart de prononciation est immédiatement perceptible pour un locuteur natif. Pour l’arabe, ar-EG, ar-SA et ar-AE correspondent aux registres égyptien, saoudien et émirati.

Prenez systématiquement la variante de votre public cible. Un tutoriel destiné au marché mexicain narré en castillan produit le même effet qu’une publicité française doublée avec un accent québécois : cela s’écoute, mais l’auditeur remarque que le contenu n’a pas été pensé pour lui.

Les réflexes qui évitent les mauvaises surprises

Un seul code langue par requête, jamais de mélange. Un texte français parsemé de termes anglais se déclare "fr", et vous laissez le code-switching faire son travail plutôt que de découper artificiellement le texte en morceaux de langues différentes.

Testez ensuite chaque langue avant de l’ouvrir à vos utilisateurs, avec des phrases représentatives de votre contenu réel et non avec un « bonjour » isolé. La qualité varie d’une langue à l’autre, et vous préférez découvrir un défaut de rythme en recette plutôt qu’en production.

Surveillez enfin les noms propres. Un patronyme polonais dans un texte français, une marque japonaise dans un texte espagnol : le moteur applique les règles de la langue déclarée et peut produire une lecture approximative. Quand la prononciation compte — un nom de client dans un message d’accueil, par exemple — écrivez-le phonétiquement dans le texte envoyé au TTS et vérifiez le rendu à l’oreille.

Points clés à retenir

  • Vingt langues sont supportées avec des variantes régionales pour l’espagnol, le portugais et l’arabe
  • Le paramètre language est obligatoire, avec auto comme option de détection automatique
  • Le code-switching permet de prononcer naturellement les mots étrangers dans une phrase
  • Utilisez toujours la variante régionale correspondant à votre public cible