Aller au contenu principal

Les Modèles Voxtral pour la Transcription

Trois modèles, trois usages

Mistral AI propose trois modèles dans la famille Voxtral pour le traitement audio. Chacun est optimisé pour un cas d’usage précis. Bien choisir son modèle est la première étape pour obtenir des résultats de qualité.

Voxtral Mini Transcribe V2 — Transcription offline

C’est le modèle phare pour la transcription batch. Vous lui envoyez un fichier audio complet et il retourne le texte transcrit.

Identifiant API : voxtral-mini-latest

Caractéristiques :

  • Taux d’erreur mot (WER) parmi les plus bas du marché
  • Diarisation intégrée — identification automatique des locuteurs
  • Context biasing — vocabulaire personnalisé pour votre domaine
  • Timestamps — granularité au mot ou au segment
  • Fichiers jusqu’à 3 heures d’audio en une requête
  • 13 langues avec détection automatique
  • Robustesse aux environnements bruités

C’est le modèle à privilégier pour : les enregistrements de réunions, les podcasts, les interviews, les cours, les transcriptions médicales ou juridiques — tout fichier audio déjà enregistré.

Exemple d’appel minimal

from mistralai import Mistral

client = Mistral(api_key="VOTRE_CLE_API")

with open("reunion.mp3", "rb") as f:
    response = client.audio.transcriptions.complete(
        model="voxtral-mini-latest",
        file={"content": f, "file_name": "reunion.mp3"}
    )

print(response.text)

Voxtral Realtime — Transcription temps réel

Ce modèle est conçu pour la transcription en streaming avec une latence ultra-faible.

Identifiant API : voxtral-mini-transcribe-realtime-2602

Caractéristiques :

  • Latence configurable, pouvant descendre sous 200 ms
  • Architecture streaming — transcription au fil de l’arrivée de l’audio
  • 13 langues supportées
  • 4 milliards de paramètres — suffisamment compact pour un déploiement edge
  • Open weights — licence Apache 2.0, disponible sur Hugging Face Hub
  • Compatible avec les flux microphone en temps réel

Limitations : pas de diarisation (incompatible avec le streaming temps réel).

C’est le modèle pour : les sous-titres en direct, les assistants vocaux, la dictée, les transcriptions de conférences en temps réel.

Exemple d’appel minimal

from mistralai import Mistral
from mistralai.models import AudioFormat

client = Mistral(api_key="VOTRE_CLE_API")
audio_format = AudioFormat(encoding="pcm_s16le", sample_rate=16000)

async for event in client.audio.realtime.transcribe_stream(
    audio_stream=mon_flux_audio,
    model="voxtral-mini-transcribe-realtime-2602",
    audio_format=audio_format,
):
    print(event.text, end="", flush=True)

Voxtral Small — Chat audio multimodal

Ce modèle n’est pas un transcripteur pur — c’est un modèle conversationnel capable de comprendre l’audio.

Identifiant API : voxtral-small-latest

Caractéristiques :

  • Accepte l’audio en entrée dans une conversation chat
  • Peut répondre à des questions sur le contenu audio
  • Combine compréhension audio et génération de texte
  • Utilise l’endpoint /chat/completions (pas /audio/transcriptions)

C’est le modèle pour : résumer un enregistrement, extraire des informations spécifiques d’un audio, répondre à des questions sur un fichier sonore.

Exemple d’appel

import base64
from mistralai import Mistral

client = Mistral(api_key="VOTRE_CLE_API")

with open("audio.mp3", "rb") as f:
    audio_base64 = base64.b64encode(f.read()).decode("utf-8")

response = client.chat.complete(
    model="voxtral-small-latest",
    messages=[{
        "role": "user",
        "content": [
            {"type": "input_audio", "input_audio": audio_base64},
            {"type": "text", "text": "Résumez cette conversation en 3 points clés."}
        ]
    }]
)

print(response.choices[0].message.content)

Comment choisir le bon modèle

Voici un guide de décision rapide :

  • Vous avez un fichier audio enregistré et voulez du texte brut → Voxtral Mini Transcribe V2 (offline)
  • Vous avez besoin d’identifier les locuteurs → Voxtral Mini Transcribe V2 (seul modèle avec diarisation)
  • Vous transcrivez en direct (micro, flux audio) → Voxtral Realtime
  • Vous voulez poser des questions sur un audio → Voxtral Small (chat)
  • Vous devez déployer on-premise → Voxtral Realtime (open weights Apache 2.0)

Points clés à retenir

  • Voxtral Mini Transcribe V2 : transcription batch haute précision avec diarisation et context biasing
  • Voxtral Realtime : streaming ultra-faible latence, open weights, déploiement edge possible
  • Voxtral Small : chat audio multimodal pour comprendre et analyser le contenu audio
  • La diarisation n’est disponible qu’en mode offline (Voxtral Mini Transcribe V2)
  • Tous les modèles supportent 13 langues dont le français