Aller au contenu principal

Parametres de la requete TTS

Configurer precisement votre synthese vocale

L’endpoint POST /v1/tts accepte quatre parametres dans le corps JSON de la requete. Chacun vous donne un controle precis sur la sortie audio generee. Comprendre ces parametres vous permet d’adapter la synthese a votre cas d’usage.

Le parametre text

Le champ text est le seul parametre requis avec language. Il accepte une chaine de caracteres d’une longueur maximale de 15 000 caracteres. Ce texte peut contenir du texte brut ou des tags expressifs (que vous decouvrirez dans la section suivante).

{
  "text": "Bonjour et bienvenue. Aujourd'hui, nous allons parler de l'intelligence artificielle."
}

Si votre texte depasse 15 000 caracteres, l’API retourne une erreur 400. Pour les textes plus longs, vous devez les decouper en segments et faire plusieurs appels. Pensez a decouper aux frontieres naturelles (fins de phrases, fins de paragraphes) pour obtenir un resultat fluide.

Le parametre voice_id

Ce parametre definit la voix utilisee pour la synthese. Il est optionnel et vaut eve par defaut. Les identifiants sont insensibles a la casse : Eve, EVE et eve sont equivalents.

Les cinq voix disponibles sont :

  • eve : energique et enjouee, ideale pour les demos et annonces
  • ara : chaleureuse et amicale, adaptee au support client et a la narration
  • rex : confiant et clair, parfait pour les presentations business et tutoriels
  • sal : doux et equilibre, voix polyvalente
  • leo : autoritaire, adapte aux instructions et au contenu educatif
{
  "text": "Bienvenue dans ce tutoriel.",
  "voice_id": "rex",
  "language": "fr"
}

Chaque voix a ete entrainee pour produire un rendu naturel dans les 20 langues supportees. Le choix de la voix n’affecte pas le prix.

Le parametre language

Ce parametre est requis. Il accepte un code BCP-47 ou la valeur speciale auto pour la detection automatique de la langue.

Les 20 langues supportees sont :

CodeLangueCodeLangue
enAnglaiskoCoreen
frFrancaishiHindi
deAllemandbnBengali
es-ESEspagnol (Espagne)ar-EGArabe (Egypte)
es-MXEspagnol (Mexique)ar-SAArabe (Arabie S.)
pt-BRPortugais (Bresil)ar-AEArabe (EAU)
pt-PTPortugais (Portugal)trTurc
itItalienidIndonesien
ruRusseviVietnamien
zhChinoisjaJaponais

La detection automatique (auto) fonctionne bien pour les textes monolingues, mais pour les textes qui melangent plusieurs langues, specifiez explicitement la langue principale.

Le parametre output_format

Ce parametre optionnel est un objet JSON qui controle le format de sortie audio. Il contient trois sous-parametres :

codec

Le codec definit le format d’encodage :

  • mp3 (defaut) : format compresse, ideal pour le web et le streaming
  • wav : format sans perte, meilleure qualite mais fichiers plus volumineux
  • pcm : audio brut sans en-tete, pour le traitement en pipeline
  • mulaw / ulaw : codec G.711 mu-law pour la telephonie
  • alaw : codec G.711 A-law pour la telephonie

sample_rate

La frequence d’echantillonnage en hertz. Les valeurs acceptees sont : 8000, 16000, 22050, 24000 (defaut), 44100, 48000.

bit_rate

Le debit binaire en bits par seconde, applicable uniquement au codec MP3. Les valeurs acceptees sont : 32000, 64000, 96000, 128000 (defaut), 192000.

{
  "text": "Audio haute qualite pour la production.",
  "voice_id": "ara",
  "language": "fr",
  "output_format": {
    "codec": "wav",
    "sample_rate": 48000
  }
}

Combinaisons recommandees

Cas d’usagecodecsample_ratebit_rate
Web / streamingmp324000128000
Production audiowav48000
Telephonie VoIPmulaw8000
Pipeline MLpcm16000

Points cles a retenir

  • text et language sont les seuls parametres requis
  • voice_id est optionnel (defaut : eve) et insensible a la casse
  • output_format permet de controler codec, sample rate et bit rate
  • Le format MP3 a 24 kHz / 128 kbps est un bon compromis qualite/taille par defaut
  • Pour la telephonie, utilisez mulaw ou alaw a 8 kHz