Aller au contenu principal

Les Modèles Voxtral pour la Transcription

Mis à jour le 29 juillet 2026

Trois modèles, trois usages

Mistral AI propose trois modèles dans la famille Voxtral pour le traitement audio, chacun optimisé pour un cas d’usage précis. Le choix du modèle n’est pas un détail de configuration : il détermine ce que vous pourrez faire ensuite, puisque la diarisation n’existe que d’un côté et le streaming que de l’autre. Prenez cette décision en premier, avant d’écrire la moindre ligne de code.

Voxtral Mini Transcribe V2 — la transcription offline

C’est le modèle phare pour la transcription batch : vous lui envoyez un fichier audio complet, il retourne le texte transcrit. Son identifiant API est voxtral-mini-latest.

Son taux d’erreur mot (WER) figure parmi les plus bas du marché, et il embarque tout ce qui manque habituellement à un transcripteur brut. La diarisation identifie automatiquement les locuteurs, le context biasing injecte un vocabulaire propre à votre domaine, les timestamps sont disponibles à la granularité du mot ou du segment. Il accepte des fichiers jusqu’à 3 heures d’audio en une seule requête, reconnaît 13 langues avec détection automatique, et reste précis dans des environnements bruités.

Concrètement, c’est le modèle à privilégier dès que l’audio existe déjà sous forme de fichier : enregistrement de réunion, podcast, interview, cours, transcription médicale ou juridique.

Exemple d’appel minimal

from mistralai import Mistral

client = Mistral(api_key="VOTRE_CLE_API")

with open("reunion.mp3", "rb") as f:
    response = client.audio.transcriptions.complete(
        model="voxtral-mini-latest",
        file={"content": f, "file_name": "reunion.mp3"}
    )

print(response.text)

Voxtral Realtime — la transcription temps réel

Ce modèle est conçu pour la transcription en streaming avec une latence ultra-faible. Son identifiant API est voxtral-mini-transcribe-realtime-2602.

Sa latence est configurable et peut descendre sous 200 ms : l’architecture transcrit au fil de l’arrivée de l’audio plutôt que d’attendre la fin de la phrase. Il couvre les mêmes 13 langues et pèse 4 milliards de paramètres, ce qui reste assez compact pour un déploiement edge, sur une machine locale ou un boîtier embarqué. Il est publié en open weights sous licence Apache 2.0 sur le Hugging Face Hub et se branche directement sur un flux microphone en temps réel.

Sa limitation tient à son architecture : pas de diarisation, celle-ci étant incompatible avec le streaming temps réel. Vous l’utiliserez pour des sous-titres en direct, un assistant vocal, de la dictée ou la transcription d’une conférence pendant qu’elle se déroule.

Exemple d’appel minimal

from mistralai import Mistral
from mistralai.models import AudioFormat

client = Mistral(api_key="VOTRE_CLE_API")
audio_format = AudioFormat(encoding="pcm_s16le", sample_rate=16000)

async for event in client.audio.realtime.transcribe_stream(
    audio_stream=mon_flux_audio,
    model="voxtral-mini-transcribe-realtime-2602",
    audio_format=audio_format,
):
    print(event.text, end="", flush=True)

Voxtral Small — le chat audio multimodal

Le troisième modèle change de nature. Voxtral Small, identifiant voxtral-small-latest, n’est pas un transcripteur pur mais un modèle conversationnel capable de comprendre l’audio. Il accepte un fichier sonore en entrée dans une conversation chat et répond à vos questions sur son contenu, en combinant compréhension audio et génération de texte.

Cette différence se traduit dans le code : il passe par l’endpoint /chat/completions, et non par /audio/transcriptions. Vous ne lui demanderez donc pas « transcris-moi ce fichier » mais « résume cette conversation », « quel budget a été évoqué », « le client a-t-il exprimé une réclamation ».

Exemple d’appel

import base64
from mistralai import Mistral

client = Mistral(api_key="VOTRE_CLE_API")

with open("audio.mp3", "rb") as f:
    audio_base64 = base64.b64encode(f.read()).decode("utf-8")

response = client.chat.complete(
    model="voxtral-small-latest",
    messages=[{
        "role": "user",
        "content": [
            {"type": "input_audio", "input_audio": audio_base64},
            {"type": "text", "text": "Résumez cette conversation en 3 points clés."}
        ]
    }]
)

print(response.choices[0].message.content)

Choisir en une minute

Face à un nouveau projet, posez-vous la question du besoin dominant plutôt que celle des fonctionnalités disponibles. Le tableau ci-dessous résume les cinq situations les plus fréquentes.

Votre besoinModèle à retenir
Un fichier audio enregistré, du texte brut en sortieVoxtral Mini Transcribe V2 (offline)
Identifier les locuteursVoxtral Mini Transcribe V2 (seul modèle avec diarisation)
Transcrire en direct (micro, flux audio)Voxtral Realtime
Poser des questions sur un audioVoxtral Small (chat)
Déployer on-premiseVoxtral Realtime (open weights Apache 2.0)

Une erreur classique consiste à partir sur le modèle temps réel parce qu’il paraît plus moderne, puis à découvrir en fin de projet que le compte-rendu de réunion attendu exige de séparer les intervenants. Si votre livrable mentionne « qui a dit quoi », le mode offline est votre seule option.

Points clés à retenir

  • Voxtral Mini Transcribe V2 : transcription batch haute précision avec diarisation et context biasing
  • Voxtral Realtime : streaming ultra-faible latence, open weights, déploiement edge possible
  • Voxtral Small : chat audio multimodal pour comprendre et analyser le contenu audio
  • La diarisation n’est disponible qu’en mode offline (Voxtral Mini Transcribe V2)
  • Tous les modèles supportent 13 langues dont le français