Paramètres de la requête TTS
Mis à jour le 30 juillet 2026
Configurer précisément votre synthèse vocale
L’endpoint POST /v1/tts accepte quatre paramètres dans le corps JSON de la requête. Chacun vous donne un contrôle précis sur la sortie audio générée. Comprendre ces paramètres vous permet d’adapter la synthèse à votre cas d’usage.
Le paramètre text
Le champ text est le seul paramètre requis avec language. Il accepte une chaîne de caractères d’une longueur maximale de 15 000 caractères. Ce texte peut contenir du texte brut ou des tags expressifs (que vous découvrirez dans la section suivante).
{
"text": "Bonjour et bienvenue. Aujourd'hui, nous allons parler de l'intelligence artificielle."
}
Si votre texte dépasse 15 000 caractères, l’API retourne une erreur 400. Pour les textes plus longs, vous devez les découper en segments et faire plusieurs appels. Pensez à découper aux frontières naturelles (fins de phrases, fins de paragraphes) pour obtenir un résultat fluide.
Le paramètre voice_id
Ce paramètre définit la voix utilisée pour la synthèse. Il est optionnel et vaut eve par défaut. Les identifiants sont insensibles à la casse : Eve, EVE et eve sont équivalents.
Les cinq voix disponibles sont :
- eve : énergique et enjouée, idéale pour les démos et annonces
- ara : chaleureuse et amicale, adaptée au support client et à la narration
- rex : confiant et clair, parfait pour les présentations business et tutoriels
- sal : doux et équilibré, voix polyvalente
- leo : autoritaire, adapté aux instructions et au contenu éducatif
{
"text": "Bienvenue dans ce tutoriel.",
"voice_id": "rex",
"language": "fr"
}
Chaque voix a été entraînée pour produire un rendu naturel dans les 20 langues supportées. Le choix de la voix n’affecte pas le prix.
Le paramètre language
Ce paramètre est requis. Il accepte un code BCP-47 ou la valeur spéciale auto pour la détection automatique de la langue.
Les 20 langues supportées sont :
| Code | Langue | Code | Langue |
|---|---|---|---|
en | Anglais | ko | Coréen |
fr | Français | hi | Hindi |
de | Allemand | bn | Bengali |
es-ES | Espagnol (Espagne) | ar-EG | Arabe (Égypte) |
es-MX | Espagnol (Mexique) | ar-SA | Arabe (Arabie S.) |
pt-BR | Portugais (Brésil) | ar-AE | Arabe (EAU) |
pt-PT | Portugais (Portugal) | tr | Turc |
it | Italien | id | Indonésien |
ru | Russe | vi | Vietnamien |
zh | Chinois | ja | Japonais |
La détection automatique (auto) fonctionne bien pour les textes monolingues, mais pour les textes qui mélangent plusieurs langues, spécifiez explicitement la langue principale.
Le paramètre output_format
Ce paramètre optionnel est un objet JSON qui contrôle le format de sortie audio. Il contient trois sous-paramètres :
codec
Le codec définit le format d’encodage :
mp3(défaut) : format compressé, idéal pour le web et le streamingwav: format sans perte, meilleure qualité mais fichiers plus volumineuxpcm: audio brut sans en-tête, pour le traitement en pipelinemulaw/ulaw: codec G.711 mu-law pour la téléphoniealaw: codec G.711 A-law pour la téléphonie
sample_rate
La fréquence d’échantillonnage en hertz. Les valeurs acceptées sont : 8000, 16000, 22050, 24000 (défaut), 44100, 48000.
bit_rate
Le débit binaire en bits par seconde, applicable uniquement au codec MP3. Les valeurs acceptées sont : 32000, 64000, 96000, 128000 (défaut), 192000.
{
"text": "Audio haute qualité pour la production.",
"voice_id": "ara",
"language": "fr",
"output_format": {
"codec": "wav",
"sample_rate": 48000
}
}
Combinaisons recommandées
| Cas d’usage | codec | sample_rate | bit_rate |
|---|---|---|---|
| Web / streaming | mp3 | 24000 | 128000 |
| Production audio | wav | 48000 | — |
| Téléphonie VoIP | mulaw | 8000 | — |
| Pipeline ML | pcm | 16000 | — |
Points clés à retenir
textetlanguagesont les seuls paramètres requisvoice_idest optionnel (défaut :eve) et insensible à la casseoutput_formatpermet de contrôler codec, sample rate et bit rate- Le format MP3 à 24 kHz / 128 kbps est un bon compromis qualité/taille par défaut
- Pour la téléphonie, utilisez
mulawoualawà 8 kHz