Introduction aux Capacités Audio de Mistral
Mis à jour le 28 juillet 2026
Quand l’IA apprend à écouter et à parler
Après la vision, l’audio représente la deuxième grande révolution multimodale de Mistral AI. Avec la famille de modèles Voxtral, Le Chat ne se contente plus de lire et d’écrire du texte — il peut désormais transcrire de la parole, participer à des conversations vocales et générer de la voix à partir de texte. Autrement dit, la boucle est complète : l’IA vous écoute, vous comprend et vous répond à voix haute. Cette leçon vous présente l’ensemble de ces capacités avant que les leçons suivantes ne les détaillent une à une.
La famille Voxtral
Mistral a développé une gamme complète de modèles audio sous le nom Voxtral, et chacun remplit un rôle précis dans la chaîne audio. Voxtral Mini Transcribe est le modèle de transcription par lots (Speech-to-Text) : vous lui donnez un fichier audio, il vous rend un texte écrit avec une précision remarquable — c’est lui qui travaille quand vous uploadez l’enregistrement d’une réunion. Voxtral Realtime est son pendant temps réel : conçu pour les conversations vocales, il transcrit au fil de la parole avec une latence ultra-faible, configurable sous 200 millisecondes — c’est lui qui rend possible le mode vocal fluide de Le Chat. Enfin, Voxtral TTS fait le chemin inverse : la synthèse vocale (Text-to-Speech) transforme du texte en voix naturelle, avec la possibilité de cloner une voix à partir de quelques secondes d’enregistrement seulement.
| Fonctionnalité | Modèle | Langues | Latence |
|---|---|---|---|
| Transcription (STT batch) | Voxtral Mini Transcribe V2 | 13 langues | Quelques secondes par fichier |
| Transcription temps réel (STT) | Voxtral Realtime | 13 langues | Sous 200 ms |
| Synthèse vocale (TTS) | Voxtral TTS | 9+ langues | ~90 ms (modèle) |
Speech-to-Text : de la voix au texte
La transcription audio est la capacité de convertir un enregistrement vocal en texte écrit, et Voxtral Mini Transcribe se distingue sur plusieurs plans. Sa précision d’abord : le taux d’erreur par mot reste faible, même sur des enregistrements de qualité moyenne — le genre de fichier capté avec un téléphone posé au milieu d’une table de réunion. Il pratique aussi la diarisation, c’est-à-dire l’identification automatique des différents locuteurs dans une conversation : la transcription distingue « Locuteur 1 » et « Locuteur 2 », ce qui change tout pour un compte-rendu de réunion. Sa robustesse au bruit lui permet de maintenir une bonne précision dans des environnements difficiles — café, rue, réunion à plusieurs voix. Il encaisse enfin des enregistrements longs, jusqu’à 3 heures d’audio en une seule requête, de quoi couvrir une conférence entière.
Côté langues, 13 sont supportées : anglais, français, espagnol, allemand, italien, portugais, néerlandais, chinois, hindi, arabe, russe, japonais et coréen. Pour un usage européen courant, vous êtes largement couvert.
Text-to-Speech : du texte à la voix
La synthèse vocale fonctionne dans l’autre sens : vous fournissez du texte, et Voxtral TTS le lit à voix haute avec une voix naturelle. Sa caractéristique la plus spectaculaire est le clonage vocal : à partir de seulement 2 à 3 secondes d’enregistrement de votre voix, le modèle peut générer de la parole qui vous ressemble. Ce clonage repose sur le principe du voice-as-an-instruction : le modèle reproduit l’intonation, le rythme et l’émotion de l’échantillon vocal de référence, sans qu’il soit nécessaire d’annoter le texte avec des balises de prosodie — l’échantillon lui-même sert de consigne.
Le modèle est multilingue — anglais, français, espagnol, portugais, italien, néerlandais, allemand, hindi, arabe — et sait même mélanger les langues au sein d’un même passage. Enfin, il fonctionne en streaming : la voix commence à être générée en environ 90 millisecondes, ce qui permet des interactions quasi instantanées plutôt qu’une attente entre votre question et la réponse parlée.
À quoi sert l’audio dans Le Chat ?
Concrètement, en tant qu’utilisateur de Le Chat, ces capacités se traduisent en quatre gestes du quotidien. Vous pouvez transcrire une réunion : uploadez l’enregistrement et obtenez un compte-rendu texte en quelques secondes. Vous pouvez discuter à la voix en activant le mode vocal, pour une conversation naturelle sans clavier. Vous pouvez écouter les réponses en demandant à Le Chat de vous lire son texte à voix haute — pratique en marchant ou en cuisinant. Et vous pouvez dicter vos messages, en parlant au lieu de taper.
Dans les leçons suivantes, nous détaillerons chacun de ces usages pas à pas : la transcription de fichiers d’abord, puis le mode vocal en temps réel, et enfin la synthèse vocale.
Points clés à retenir
- Voxtral est la famille de modèles audio de Mistral, couvrant transcription, temps réel et synthèse vocale
- La transcription supporte 13 langues, la diarisation et jusqu’à 3 heures d’audio
- La synthèse vocale peut cloner une voix en quelques secondes et parler en 9+ langues
- Dans Le Chat, tout est intégré : vous pouvez transcrire, parler et écouter sans outil externe