Créer une voix personnalisée
De l’enregistrement à la voix clonée
Créer une voix personnalisée avec Voxtral est un processus en deux étapes : préparer un échantillon audio de qualité, puis l’envoyer à l’API avec les bons paramètres. Cette leçon vous guide pas à pas dans la création de votre première voix.
Préparer votre échantillon audio
L’échantillon audio est le fondement de votre voix. Sa qualité détermine directement la qualité de la synthèse vocale produite.
Durée recommandée
L’API accepte des échantillons de 3 à 30 secondes. En pratique :
- 3-10 secondes : suffisant pour capturer le timbre de base, mais avec moins de nuances
- 10-20 secondes : bon compromis entre qualité et simplicité
- 20-30 secondes : idéal pour capturer les subtilités de la voix (rythme, intonations)
Contenu de l’enregistrement
Si vous ne savez pas quoi dire, voici un script de référence que Mistral recommande :
« Je suis en train d’enregistrer un échantillon audio pour cloner ma voix. Une fois terminé, je pourrai générer de la parole qui me ressemble. C’est incroyable comment l’IA peut capturer ma façon de parler, mon ton, mon rythme, et même les petites particularités qui rendent ma voix unique. »
Ce texte est conçu pour couvrir une variété de sons et d’intonations en français.
Formats acceptés
L’API accepte les fichiers audio dans les formats courants : MP3, WAV, FLAC, OGG. Le fichier est encodé en base64 avant l’envoi.
Code Python complet
Voici le code pour créer une voix avec tous les paramètres disponibles :
import base64
from pathlib import Path
from mistralai.client import Mistral
client = Mistral(api_key="votre-cle-api")
# Lire et encoder l'échantillon audio
audio_path = Path("mon-echantillon.mp3")
sample_audio_b64 = base64.b64encode(audio_path.read_bytes()).decode()
# Créer la voix avec tous les paramètres
voice = client.audio.voices.create(
name="narrateur-podcast-fr",
sample_audio=sample_audio_b64,
sample_filename=audio_path.name,
languages=["fr", "en"],
gender="male",
age=40,
tags=["podcast", "narrateur", "professionnel"]
)
print(f"Voix créée avec succès !")
print(f" ID : {voice.id}")
print(f" Nom : {voice.name}")
print(f" Langues : {voice.languages}")
Détail des paramètres
Paramètres obligatoires
name: le nom d’affichage de votre voix. Choisissez un nom descriptif qui vous permet de l’identifier facilement (ex:assistant-support-fr,podcast-intro)sample_audio: l’échantillon audio encodé en base64. C’est le seul paramètre qui ne peut pas être modifié après création
Paramètres optionnels
sample_filename: le nom du fichier original. Aide l’API à détecter le format audioslug: un identifiant URL-friendly. Si omis, il est généré automatiquement à partir du nomlanguages: un tableau de codes de langues ISO (ex:["fr", "en", "es"]). Indique les langues dans lesquelles cette voix est optimiséegender:"male"ou"female". Utilisé pour le filtrage dans l’interfaceage: un entier représentant l’âge approximatif du locuteur. Aide à catégoriser la voixtags: un tableau de chaînes libres pour organiser vos voix (ex:["commercial", "dynamique"])
Enregistrer depuis le navigateur
Si vous préférez ne pas manipuler de fichiers audio, Mistral Studio permet d’enregistrer directement depuis votre navigateur :
- Rendez-vous dans la section Audio > Text to Speech
- Cliquez sur My Voices puis Add a new voice
- Entrez le nom de votre voix
- Cliquez sur le bouton d’enregistrement et parlez pendant 10 à 30 secondes
- Validez — votre voix est immédiatement disponible
Cette méthode est idéale pour des tests rapides ou si vous n’êtes pas à l’aise avec le code.
Vérifier votre voix
Après création, testez immédiatement votre voix pour vérifier la qualité :
response = client.audio.speech.complete(
model="voxtral-mini-tts-2603",
input="Bonjour, ceci est un test de ma voix personnalisée.",
voice_id=voice.id,
response_format="mp3",
)
Path("test-voix.mp3").write_bytes(
base64.b64decode(response.audio_data)
)
print("Fichier test-voix.mp3 généré — écoutez le résultat !")
Si le résultat ne vous satisfait pas, créez une nouvelle voix avec un meilleur échantillon plutôt que de réutiliser le même.
Points clés à retenir
- L’échantillon audio doit durer entre 3 et 30 secondes, idéalement 10-20 secondes
- Le fichier audio est encodé en base64 avant l’envoi à l’API
- Les paramètres
nameetsample_audiosont obligatoires, les autres sont optionnels - Mistral Studio permet d’enregistrer directement depuis le navigateur
- Testez toujours votre voix immédiatement après création