Aller au contenu principal

Paramètres de la requête TTS

Mis à jour le 30 juillet 2026

Configurer précisément votre synthèse vocale

L’endpoint POST /v1/tts accepte quatre paramètres dans le corps JSON de la requête. Chacun vous donne un contrôle précis sur la sortie audio générée. Comprendre ces paramètres vous permet d’adapter la synthèse à votre cas d’usage.

Le paramètre text

Le champ text est le seul paramètre requis avec language. Il accepte une chaîne de caractères d’une longueur maximale de 15 000 caractères. Ce texte peut contenir du texte brut ou des tags expressifs (que vous découvrirez dans la section suivante).

{
  "text": "Bonjour et bienvenue. Aujourd'hui, nous allons parler de l'intelligence artificielle."
}

Si votre texte dépasse 15 000 caractères, l’API retourne une erreur 400. Pour les textes plus longs, vous devez les découper en segments et faire plusieurs appels. Pensez à découper aux frontières naturelles (fins de phrases, fins de paragraphes) pour obtenir un résultat fluide.

Le paramètre voice_id

Ce paramètre définit la voix utilisée pour la synthèse. Il est optionnel et vaut eve par défaut. Les identifiants sont insensibles à la casse : Eve, EVE et eve sont équivalents.

Les cinq voix disponibles sont :

  • eve : énergique et enjouée, idéale pour les démos et annonces
  • ara : chaleureuse et amicale, adaptée au support client et à la narration
  • rex : confiant et clair, parfait pour les présentations business et tutoriels
  • sal : doux et équilibré, voix polyvalente
  • leo : autoritaire, adapté aux instructions et au contenu éducatif
{
  "text": "Bienvenue dans ce tutoriel.",
  "voice_id": "rex",
  "language": "fr"
}

Chaque voix a été entraînée pour produire un rendu naturel dans les 20 langues supportées. Le choix de la voix n’affecte pas le prix.

Le paramètre language

Ce paramètre est requis. Il accepte un code BCP-47 ou la valeur spéciale auto pour la détection automatique de la langue.

Les 20 langues supportées sont :

CodeLangueCodeLangue
enAnglaiskoCoréen
frFrançaishiHindi
deAllemandbnBengali
es-ESEspagnol (Espagne)ar-EGArabe (Égypte)
es-MXEspagnol (Mexique)ar-SAArabe (Arabie S.)
pt-BRPortugais (Brésil)ar-AEArabe (EAU)
pt-PTPortugais (Portugal)trTurc
itItalienidIndonésien
ruRusseviVietnamien
zhChinoisjaJaponais

La détection automatique (auto) fonctionne bien pour les textes monolingues, mais pour les textes qui mélangent plusieurs langues, spécifiez explicitement la langue principale.

Le paramètre output_format

Ce paramètre optionnel est un objet JSON qui contrôle le format de sortie audio. Il contient trois sous-paramètres :

codec

Le codec définit le format d’encodage :

  • mp3 (défaut) : format compressé, idéal pour le web et le streaming
  • wav : format sans perte, meilleure qualité mais fichiers plus volumineux
  • pcm : audio brut sans en-tête, pour le traitement en pipeline
  • mulaw / ulaw : codec G.711 mu-law pour la téléphonie
  • alaw : codec G.711 A-law pour la téléphonie

sample_rate

La fréquence d’échantillonnage en hertz. Les valeurs acceptées sont : 8000, 16000, 22050, 24000 (défaut), 44100, 48000.

bit_rate

Le débit binaire en bits par seconde, applicable uniquement au codec MP3. Les valeurs acceptées sont : 32000, 64000, 96000, 128000 (défaut), 192000.

{
  "text": "Audio haute qualité pour la production.",
  "voice_id": "ara",
  "language": "fr",
  "output_format": {
    "codec": "wav",
    "sample_rate": 48000
  }
}

Combinaisons recommandées

Cas d’usagecodecsample_ratebit_rate
Web / streamingmp324000128000
Production audiowav48000
Téléphonie VoIPmulaw8000
Pipeline MLpcm16000

Points clés à retenir

  • text et language sont les seuls paramètres requis
  • voice_id est optionnel (défaut : eve) et insensible à la casse
  • output_format permet de contrôler codec, sample rate et bit rate
  • Le format MP3 à 24 kHz / 128 kbps est un bon compromis qualité/taille par défaut
  • Pour la téléphonie, utilisez mulaw ou alaw à 8 kHz