Aller au contenu principal

Créer une voix personnalisée

Mis à jour le 29 juillet 2026

De l’enregistrement à la voix clonée

Créer une voix personnalisée avec Voxtral tient en deux étapes : préparer un échantillon audio de qualité, puis l’envoyer à l’API avec les bons paramètres. La seconde vous prendra dix minutes, la première mérite un peu plus d’attention — c’est elle qui décide du résultat. Cette leçon vous guide pas à pas dans la création de votre première voix.

Préparer votre échantillon audio

L’échantillon audio est le fondement de votre voix : sa qualité détermine directement la qualité de la synthèse vocale produite. Le modèle ne corrige rien, il reproduit ce qu’il entend.

L’API accepte des échantillons de 3 à 30 secondes, et cette fourchette recouvre trois régimes différents. Entre 3 et 10 secondes, le modèle capture le timbre de base, mais avec moins de nuances : la voix sera reconnaissable sans être vraiment ressemblante. Entre 10 et 20 secondes, vous obtenez un bon compromis entre qualité et simplicité, suffisant pour la plupart des projets. Entre 20 et 30 secondes, vous donnez au modèle de quoi saisir les subtilités — le rythme, les intonations, ces micro-variations qui font qu’un proche vous reconnaît en deux mots.

Reste à savoir quoi dire, question qui bloque plus de gens qu’on ne l’imagine au moment d’appuyer sur le bouton d’enregistrement. Voici un script de référence que Mistral recommande :

« Je suis en train d’enregistrer un échantillon audio pour cloner ma voix. Une fois terminé, je pourrai générer de la parole qui me ressemble. C’est incroyable comment l’IA peut capturer ma façon de parler, mon ton, mon rythme, et même les petites particularités qui rendent ma voix unique. »

Ce texte n’a rien d’arbitraire : il est conçu pour couvrir une variété de sons et d’intonations en français, avec des voyelles ouvertes et fermées, des consonnes explosives et une phrase exclamative. Côté fichier, l’API accepte les formats courants — MP3, WAV, FLAC, OGG — et le fichier est encodé en base64 avant l’envoi.

Code Python complet

Voici le code pour créer une voix avec tous les paramètres disponibles :

import base64
from pathlib import Path
from mistralai.client import Mistral

client = Mistral(api_key="votre-cle-api")

# Lire et encoder l'échantillon audio
audio_path = Path("mon-echantillon.mp3")
sample_audio_b64 = base64.b64encode(audio_path.read_bytes()).decode()

# Créer la voix avec tous les paramètres
voice = client.audio.voices.create(
    name="narrateur-podcast-fr",
    sample_audio=sample_audio_b64,
    sample_filename=audio_path.name,
    languages=["fr", "en"],
    gender="male",
    age=40,
    tags=["podcast", "narrateur", "professionnel"]
)

print(f"Voix créée avec succès !")
print(f"  ID : {voice.id}")
print(f"  Nom : {voice.name}")
print(f"  Langues : {voice.languages}")

Deux paramètres seulement sont obligatoires :

  • name : le nom d’affichage de votre voix. Choisissez un nom descriptif qui vous permet de l’identifier facilement (ex: assistant-support-fr, podcast-intro)
  • sample_audio : l’échantillon audio encodé en base64. C’est le seul paramètre qui ne peut pas être modifié après création

Les autres sont optionnels, mais chacun rend un service concret :

  • sample_filename : le nom du fichier original. Aide l’API à détecter le format audio
  • slug : un identifiant URL-friendly. Si omis, il est généré automatiquement à partir du nom
  • languages : un tableau de codes de langues ISO (ex: ["fr", "en", "es"]). Indique les langues dans lesquelles cette voix est optimisée
  • gender : "male" ou "female". Utilisé pour le filtrage dans l’interface
  • age : un entier représentant l’âge approximatif du locuteur. Aide à catégoriser la voix
  • tags : un tableau de chaînes libres pour organiser vos voix (ex: ["commercial", "dynamique"])

Sur un projet à une seule voix, on est tenté de tout omettre. Sur un catalogue de trente voix réparties entre plusieurs clients, les tags et les langues renseignés dès la création vous épargneront des heures de tri.

Enregistrer depuis le navigateur

Si vous préférez ne pas manipuler de fichiers audio, Mistral Studio permet d’enregistrer directement depuis votre navigateur :

  1. Rendez-vous dans la section Audio > Text to Speech
  2. Cliquez sur My Voices puis Add a new voice
  3. Entrez le nom de votre voix
  4. Cliquez sur le bouton d’enregistrement et parlez pendant 10 à 30 secondes
  5. Validez — votre voix est immédiatement disponible

Cette méthode convient parfaitement aux tests rapides, ou lorsque la personne qui prête sa voix n’est pas celle qui écrit le code — un comédien ou un dirigeant se prêtera plus volontiers à l’exercice devant un navigateur que devant un terminal.

Vérifier votre voix

Ne passez jamais à la suite sans avoir écouté le résultat. Dès la création terminée, générez une phrase de test :

response = client.audio.speech.complete(
    model="voxtral-mini-tts-2603",
    input="Bonjour, ceci est un test de ma voix personnalisée.",
    voice_id=voice.id,
    response_format="mp3",
)

Path("test-voix.mp3").write_bytes(
    base64.b64decode(response.audio_data)
)
print("Fichier test-voix.mp3 généré — écoutez le résultat !")

Écoutez au casque, pas sur les haut-parleurs d’un ordinateur portable : les défauts de timbre y sont inaudibles. Si le résultat ne vous satisfait pas, créez une nouvelle voix avec un meilleur échantillon plutôt que de réutiliser le même — l’API ne permet de toute façon pas de remplacer l’audio d’une voix existante, et insister sur un enregistrement médiocre ne fera que reporter le problème.

Points clés à retenir

  • L’échantillon audio doit durer entre 3 et 30 secondes, idéalement 10-20 secondes
  • Le fichier audio est encodé en base64 avant l’envoi à l’API
  • Les paramètres name et sample_audio sont obligatoires, les autres sont optionnels
  • Mistral Studio permet d’enregistrer directement depuis le navigateur
  • Testez toujours votre voix immédiatement après création