Parametres de la requete TTS
Configurer precisement votre synthese vocale
L’endpoint POST /v1/tts accepte quatre parametres dans le corps JSON de la requete. Chacun vous donne un controle precis sur la sortie audio generee. Comprendre ces parametres vous permet d’adapter la synthese a votre cas d’usage.
Le parametre text
Le champ text est le seul parametre requis avec language. Il accepte une chaine de caracteres d’une longueur maximale de 15 000 caracteres. Ce texte peut contenir du texte brut ou des tags expressifs (que vous decouvrirez dans la section suivante).
{
"text": "Bonjour et bienvenue. Aujourd'hui, nous allons parler de l'intelligence artificielle."
}
Si votre texte depasse 15 000 caracteres, l’API retourne une erreur 400. Pour les textes plus longs, vous devez les decouper en segments et faire plusieurs appels. Pensez a decouper aux frontieres naturelles (fins de phrases, fins de paragraphes) pour obtenir un resultat fluide.
Le parametre voice_id
Ce parametre definit la voix utilisee pour la synthese. Il est optionnel et vaut eve par defaut. Les identifiants sont insensibles a la casse : Eve, EVE et eve sont equivalents.
Les cinq voix disponibles sont :
- eve : energique et enjouee, ideale pour les demos et annonces
- ara : chaleureuse et amicale, adaptee au support client et a la narration
- rex : confiant et clair, parfait pour les presentations business et tutoriels
- sal : doux et equilibre, voix polyvalente
- leo : autoritaire, adapte aux instructions et au contenu educatif
{
"text": "Bienvenue dans ce tutoriel.",
"voice_id": "rex",
"language": "fr"
}
Chaque voix a ete entrainee pour produire un rendu naturel dans les 20 langues supportees. Le choix de la voix n’affecte pas le prix.
Le parametre language
Ce parametre est requis. Il accepte un code BCP-47 ou la valeur speciale auto pour la detection automatique de la langue.
Les 20 langues supportees sont :
| Code | Langue | Code | Langue |
|---|---|---|---|
en | Anglais | ko | Coreen |
fr | Francais | hi | Hindi |
de | Allemand | bn | Bengali |
es-ES | Espagnol (Espagne) | ar-EG | Arabe (Egypte) |
es-MX | Espagnol (Mexique) | ar-SA | Arabe (Arabie S.) |
pt-BR | Portugais (Bresil) | ar-AE | Arabe (EAU) |
pt-PT | Portugais (Portugal) | tr | Turc |
it | Italien | id | Indonesien |
ru | Russe | vi | Vietnamien |
zh | Chinois | ja | Japonais |
La detection automatique (auto) fonctionne bien pour les textes monolingues, mais pour les textes qui melangent plusieurs langues, specifiez explicitement la langue principale.
Le parametre output_format
Ce parametre optionnel est un objet JSON qui controle le format de sortie audio. Il contient trois sous-parametres :
codec
Le codec definit le format d’encodage :
mp3(defaut) : format compresse, ideal pour le web et le streamingwav: format sans perte, meilleure qualite mais fichiers plus volumineuxpcm: audio brut sans en-tete, pour le traitement en pipelinemulaw/ulaw: codec G.711 mu-law pour la telephoniealaw: codec G.711 A-law pour la telephonie
sample_rate
La frequence d’echantillonnage en hertz. Les valeurs acceptees sont : 8000, 16000, 22050, 24000 (defaut), 44100, 48000.
bit_rate
Le debit binaire en bits par seconde, applicable uniquement au codec MP3. Les valeurs acceptees sont : 32000, 64000, 96000, 128000 (defaut), 192000.
{
"text": "Audio haute qualite pour la production.",
"voice_id": "ara",
"language": "fr",
"output_format": {
"codec": "wav",
"sample_rate": 48000
}
}
Combinaisons recommandees
| Cas d’usage | codec | sample_rate | bit_rate |
|---|---|---|---|
| Web / streaming | mp3 | 24000 | 128000 |
| Production audio | wav | 48000 | — |
| Telephonie VoIP | mulaw | 8000 | — |
| Pipeline ML | pcm | 16000 | — |
Points cles a retenir
textetlanguagesont les seuls parametres requisvoice_idest optionnel (defaut :eve) et insensible a la casseoutput_formatpermet de controler codec, sample rate et bit rate- Le format MP3 a 24 kHz / 128 kbps est un bon compromis qualite/taille par defaut
- Pour la telephonie, utilisez
mulawoualawa 8 kHz