Aller au contenu principal

Introduction aux Capacités Audio de Mistral

Quand l’IA apprend à écouter et à parler

Après la vision, l’audio représente la deuxième grande révolution multimodale de Mistral AI. Avec la famille de modèles Voxtral, Le Chat ne se contente plus de lire et d’écrire du texte — il peut désormais transcrire de la parole, participer à des conversations vocales et générer de la voix à partir de texte. Cette leçon vous présente l’ensemble de ces capacités.

La famille Voxtral

Mistral a développé une gamme complète de modèles audio sous le nom Voxtral. Chaque modèle remplit un rôle précis dans la chaîne audio :

  • Voxtral Mini Transcribe — le modèle de transcription par lots (Speech-to-Text). Il convertit un fichier audio en texte écrit, avec une précision remarquable.
  • Voxtral Realtime — le modèle de transcription en temps réel. Conçu pour les conversations vocales avec une latence ultra-faible, configurable sous 200 millisecondes.
  • Voxtral TTS — le modèle de synthèse vocale (Text-to-Speech). Il transforme du texte en voix naturelle, avec possibilité de cloner une voix à partir de quelques secondes d’enregistrement.
Fonctionnalité Modèle Langues Latence
Transcription (STT batch) Voxtral Mini Transcribe V2 13 langues Quelques secondes par fichier
Transcription temps réel (STT) Voxtral Realtime 13 langues < 200 ms
Synthèse vocale (TTS) Voxtral TTS 9+ langues ~90 ms (modèle)

Speech-to-Text : de la voix au texte

La transcription audio est la capacité de convertir un enregistrement vocal en texte écrit. Voxtral Mini Transcribe se distingue par plusieurs atouts :

  • Haute précision avec un faible taux d’erreur par mot, même sur des enregistrements de qualité moyenne
  • Diarisation — le modèle identifie automatiquement les différents locuteurs dans une conversation (« Locuteur 1 a dit… Locuteur 2 a répondu… »)
  • Robustesse au bruit — il maintient une bonne précision dans des environnements bruyants (café, rue, réunion à plusieurs)
  • Audio long — il peut traiter jusqu’à 3 heures d’enregistrement en une seule requête
  • 13 langues supportées : anglais, français, espagnol, allemand, italien, portugais, néerlandais, chinois, hindi, arabe, russe, japonais, coréen

Text-to-Speech : du texte à la voix

La synthèse vocale fonctionne dans l’autre sens : vous fournissez du texte, et Voxtral TTS le lit à voix haute avec une voix naturelle. Les caractéristiques principales :

  • Clonage vocal — à partir de seulement 2 à 3 secondes d’enregistrement de votre voix, le modèle peut générer de la parole qui vous ressemble
  • Voice-as-an-instruction — le modèle reproduit l’intonation, le rythme et l’émotion de l’échantillon vocal de référence, sans avoir besoin de balises de prosodie
  • Multilingue — anglais, français, espagnol, portugais, italien, néerlandais, allemand, hindi, arabe, avec possibilité de mélanger les langues
  • Streaming — la voix commence à être générée en environ 90 millisecondes, ce qui permet des interactions quasi instantanées

À quoi sert l’audio dans Le Chat ?

En tant qu’utilisateur de Le Chat, les capacités audio vous permettent de :

  • Transcrire une réunion : uploadez l’enregistrement et obtenez un compte-rendu texte
  • Discuter à la voix : activez le mode vocal pour une conversation naturelle
  • Écouter les réponses : demandez à Le Chat de vous lire sa réponse à voix haute
  • Dicter vos messages : parlez au lieu de taper

Dans les leçons suivantes, nous détaillerons chacun de ces usages pas à pas.

Points clés à retenir

  • Voxtral est la famille de modèles audio de Mistral, couvrant transcription, temps réel et synthèse vocale
  • La transcription supporte 13 langues, la diarisation et jusqu’à 3 heures d’audio
  • La synthèse vocale peut cloner une voix en quelques secondes et parler en 9+ langues
  • Dans Le Chat, tout est intégré : vous pouvez transcrire, parler et écouter sans outil externe