Langues et Synthèse Multilingue
Mis à jour le 29 juillet 2026
Vingt langues pour une audience mondiale
Le TTS de Grok couvre vingt langues, chacune avec ses accents et ses prononciations naturelles. La conséquence pratique est simple : une application audio destinée à un public international n’a plus besoin de jongler entre plusieurs fournisseurs de synthèse vocale, avec les écarts de qualité et les contrats séparés que cela suppose. Une même intégration, un même format de requête, et vous passez du français au japonais en changeant un seul paramètre.
Cette couverture pèse aussi sur la conception de vos produits. Une plateforme de e-learning qui publiait ses modules audio uniquement en anglais peut les décliner en dix langues sans réenregistrer un seul comédien, et sans renégocier de droits de voix.
Les langues supportées
| Code BCP-47 | Langue | Région |
|---|---|---|
fr | Français | France |
en | Anglais | International |
de | Allemand | Allemagne |
es-ES | Espagnol | Espagne |
es-MX | Espagnol | Mexique |
pt-BR | Portugais | Brésil |
pt-PT | Portugais | Portugal |
it | Italien | Italie |
ja | Japonais | Japon |
ko | Coréen | Corée du Sud |
zh | Chinois | Chine |
hi | Hindi | Inde |
ar-EG / ar-SA / ar-AE | Arabe | Égypte / Arabie Saoudite / Émirats |
ru | Russe | Russie |
tr | Turc | Turquie |
id | Indonésien | Indonésie |
vi | Vietnamien | Vietnam |
bn | Bengali | Bangladesh / Inde |
Déclarer la langue de chaque requête
Le paramètre language est obligatoire : aucune requête TTS ne part sans lui. Vous indiquez soit un code BCP-47 explicite, soit la valeur auto qui laisse le modèle déduire la langue à partir du texte fourni.
{
"text": "Bonjour, comment allez-vous aujourd'hui ?",
"voice_id": "ara",
"language": "fr"
}
La détection automatique rend service quand la langue de l’utilisateur n’est pas connue à l’avance : un formulaire de contact ouvert à tous, un flux de commentaires, un chatbot international. Elle reste néanmoins une inférence, et une inférence se trompe. Sur une phrase de trois mots, ou sur un texte mêlant deux langues dès la première ligne, le modèle peut choisir le mauvais profil phonétique et vous livrer un français prononcé à l’anglaise. Chaque fois que vous connaissez la langue, écrivez-la : le résultat est plus fiable.
Le code-switching en cours de phrase
Le moteur sait changer de prononciation à l’intérieur d’une même phrase. Vous déclarez une langue principale, et les segments étrangers reçoivent malgré tout leur articulation d’origine.
{
"text": "Le concept de machine learning est fondamental en intelligence artificielle.",
"voice_id": "rex",
"language": "fr"
}
Ici, « machine learning » sortira avec une prononciation anglaise pendant que le reste de la phrase conserve son accent français. Le gain est net sur tous les contenus techniques, scientifiques ou commerciaux, où le vocabulaire anglo-saxon s’invite naturellement : un module de formation sur le cloud, une revue de presse tech, une fiche produit truffée d’anglicismes.
Les variantes régionales
L’espagnol, le portugais et l’arabe existent en plusieurs variantes, et le choix n’est pas cosmétique : il touche la prononciation, l’intonation et une partie du vocabulaire. Entre es-ES et es-MX, vous arbitrez entre l’intonation et le lexique castillans d’un côté, mexicains de l’autre. Entre pt-BR et pt-PT, l’écart de prononciation est immédiatement perceptible pour un locuteur natif. Pour l’arabe, ar-EG, ar-SA et ar-AE correspondent aux registres égyptien, saoudien et émirati.
Prenez systématiquement la variante de votre public cible. Un tutoriel destiné au marché mexicain narré en castillan produit le même effet qu’une publicité française doublée avec un accent québécois : cela s’écoute, mais l’auditeur remarque que le contenu n’a pas été pensé pour lui.
Les réflexes qui évitent les mauvaises surprises
Un seul code langue par requête, jamais de mélange. Un texte français parsemé de termes anglais se déclare "fr", et vous laissez le code-switching faire son travail plutôt que de découper artificiellement le texte en morceaux de langues différentes.
Testez ensuite chaque langue avant de l’ouvrir à vos utilisateurs, avec des phrases représentatives de votre contenu réel et non avec un « bonjour » isolé. La qualité varie d’une langue à l’autre, et vous préférez découvrir un défaut de rythme en recette plutôt qu’en production.
Surveillez enfin les noms propres. Un patronyme polonais dans un texte français, une marque japonaise dans un texte espagnol : le moteur applique les règles de la langue déclarée et peut produire une lecture approximative. Quand la prononciation compte — un nom de client dans un message d’accueil, par exemple — écrivez-le phonétiquement dans le texte envoyé au TTS et vérifiez le rendu à l’oreille.
Points clés à retenir
- Vingt langues sont supportées avec des variantes régionales pour l’espagnol, le portugais et l’arabe
- Le paramètre
languageest obligatoire, avecautocomme option de détection automatique - Le code-switching permet de prononcer naturellement les mots étrangers dans une phrase
- Utilisez toujours la variante régionale correspondant à votre public cible