Aller au contenu principal

Prochaines Étapes : Au-delà de la Transcription

Mis à jour le 29 juillet 2026

Ce que vous avez appris

Vous êtes arrivé au bout des deux modes de transcription de Voxtral. En mode offline, vous transcrivez des fichiers audio avec diarisation, timestamps et context biasing grâce à Voxtral Mini Transcribe V2. En mode realtime, vous transcrivez un flux continu avec une latence configurable via Voxtral Realtime, vous capturez le microphone et vous exploitez le pattern dual delay. Pour chacune de ces fonctionnalités, vous disposez de code Python complet et des réflexes nécessaires pour passer en production.

La transcription n’est pourtant qu’une moitié de l’histoire : l’écosystème audio de Mistral AI permet aussi le chemin inverse, et c’est de la combinaison des deux que naissent les applications réellement conversationnelles.

Voxtral TTS : rendre la parole

Voxtral TTS est le pendant exact de la transcription : il transforme du texte en parole naturelle. Il pratique le clonage vocal zero-shot, c’est-à-dire qu’il reproduit une voix à partir de deux à trois secondes d’audio seulement, sans entraînement préalable. Il repose également sur le principe de la voice-as-an-instruction : le modèle suit l’intonation, le rythme et l’émotion du prompt vocal qu’on lui fournit, sans qu’il soit nécessaire d’insérer des balises de prosodie dans le texte — vous montrez le ton attendu au lieu de le décrire. Côté langues, il couvre l’anglais, le français, l’espagnol, le portugais, l’italien, le néerlandais, l’allemand, l’hindi et l’arabe. Il fonctionne enfin en streaming, avec une latence modèle d’environ 90 millisecondes et un temps jusqu’au premier audio d’environ 0,8 seconde en PCM, ce qui le rend compatible avec une conversation en direct.

Concrètement, Voxtral TTS donne une voix à vos applications : assistants vocaux, narration automatique, accessibilité, doublage.

Le pipeline complet : STT, LLM, TTS

Assemblées, les trois briques forment une boucle complète. L’audio de l’utilisateur devient du texte, le texte est compris et traité par un modèle de langage, et la réponse redevient de l’audio.

Audio utilisateur → Voxtral STT → Texte

                              Mistral LLM (raisonnement)

                         Réponse texte → Voxtral TTS → Audio réponse

Le code ci-dessous matérialise ce pipeline. Les deux premières étapes vous sont familières : transcription en streaming à 300 millisecondes pour capter la question, puis appel au LLM avec un prompt système qui impose un registre oral. La troisième reste en commentaire, l’API de synthèse faisant l’objet d’une formation dédiée ; le pattern d’appel y figure pour situer son insertion.

import asyncio
import os
from mistralai import Mistral
from mistralai.models import (
    AudioFormat,
    TranscriptionStreamTextDelta,
    TranscriptionStreamDone
)


async def pipeline_vocal_complet(source_audio_utilisateur):
    """Pipeline complet : écouter, comprendre, répondre."""
    client = Mistral(api_key=os.environ["MISTRAL_API_KEY"])

    # Étape 1 : Transcrire la parole de l'utilisateur (STT)
    audio_format = AudioFormat(encoding="pcm_s16le", sample_rate=16000)
    question_parts = []

    print("Écoute en cours...", flush=True)

    async for event in client.audio.realtime.transcribe_stream(
        audio_stream=source_audio_utilisateur,
        model="voxtral-mini-transcribe-realtime-2602",
        audio_format=audio_format,
        target_streaming_delay_ms=300,
    ):
        if isinstance(event, TranscriptionStreamTextDelta):
            question_parts.append(event.text)
        elif isinstance(event, TranscriptionStreamDone):
            break

    question = "".join(question_parts).strip()
    print(f"Question : {question}")

    # Étape 2 : Générer une réponse intelligente (LLM)
    reponse_llm = client.chat.complete(
        model="mistral-large-latest",
        messages=[
            {
                "role": "system",
                "content": "Vous êtes un assistant vocal. "
                           "Répondez de manière concise et naturelle, "
                           "comme dans une conversation orale."
            },
            {"role": "user", "content": question}
        ]
    )

    reponse_texte = reponse_llm.choices[0].message.content
    print(f"Réponse : {reponse_texte}")

    # Étape 3 : Synthétiser la réponse en audio (TTS)
    # Note : l'API TTS sera couverte dans une formation dédiée
    # Voici le pattern d'appel :
    #
    # audio_response = client.audio.speech.create(
    #     model="voxtral-tts-latest",
    #     input=reponse_texte,
    #     voice="voix_choisie"
    # )
    #
    # Lire l'audio via un lecteur (PyAudio, sounddevice, etc.)

    return {
        "question": question,
        "reponse": reponse_texte
    }

Ce que ce pipeline rend possible

L’assistant vocal d’entreprise est l’application la plus immédiate : il comprend les questions des employés et répond en s’appuyant sur la base de connaissances interne. La transcription en temps réel capture la question, le LLM interroge une base vectorielle en RAG, et le TTS restitue la réponse à voix haute.

L’agent de centre d’appels pousse la logique plus loin en mobilisant les deux modes de transcription à la fois. Pendant l’appel, Voxtral Realtime transcrit la conversation en direct ; Mistral LLM analyse l’intention du client ; Voxtral TTS formule la réponse vocale. Une fois l’appel terminé, une passe offline avec diarisation produit un compte rendu structuré indiquant qui a dit quoi — précisément ce que le temps réel ne peut pas fournir.

L’outil de traduction vocale enchaîne trois modèles sur un même flux : Voxtral STT transcrit la parole source parmi ses 13 langues, Mistral LLM traduit, et Voxtral TTS restitue dans l’une de ses 9 langues cibles. La narration automatique, enfin, transforme articles, rapports ou courriels en audio pour une écoute en mobilité, le LLM adaptant le texte à une lecture orale avant la synthèse.

Un pipeline vocal entièrement souverain

L’atout décisif de cet écosystème tient à la possibilité de tout héberger chez vous. Voxtral Realtime est publié en open weights sous licence Apache 2.0 et se déploie sur vos propres serveurs. Mistral Large 3 est accessible via des partenaires cloud européens ou en on-premise. Voxtral TTS admet lui aussi un déploiement privé. Autrement dit, la chaîne complète — écouter, comprendre, répondre — peut fonctionner sans qu’aucune donnée ne quitte votre infrastructure. Pour la santé, la défense, la finance ou l’administration publique, cette propriété ne relève pas du confort : elle conditionne la faisabilité même du projet.

Pour aller plus loin

La documentation officielle de Mistral consacre des pages à l’audio et reste la référence pour suivre les évolutions des modèles et de l’API. Le Hugging Face Hub héberge les modèles Voxtral en open weights, avec documentation et exemples. Le forum Mistral rassemble des retours d’expérience souvent plus proches de vos contraintes réelles que les démonstrations officielles, et les autres formations de Corsen Academy couvrent le reste de l’écosystème Mistral AI.

Récapitulatif de la formation

Vous connaissez les modèles Voxtral et leurs rôles respectifs : Mini Transcribe V2 pour l’offline, Realtime pour le streaming, Small pour le chat audio. Vous maîtrisez la transcription offline dans toutes ses dimensions — appel API, timestamps, diarisation, context biasing — comme la transcription temps réel avec son streaming, sa capture microphone via PyAudio, son contrôle de latence et son pattern dual delay. Vous avez construit des cas d’usage complets, du sous-titrage aux comptes rendus en passant par la dictée, les assistants vocaux et les conférences, et vous savez exploiter tout cela en production. Il ne vous manque plus que la voix de retour pour boucler la conversation.

Points clés à retenir

  • Voxtral TTS complète la boucle : STT (transcription) puis LLM (raisonnement) puis TTS (synthèse)
  • Le pipeline vocal complet permet des assistants vocaux, agents de centres d’appels et traducteurs
  • Le déploiement souverain est possible grâce aux modèles open weights (Apache 2.0)
  • La transcription est la brique fondamentale sur laquelle se construisent les applications vocales
  • Continuez votre apprentissage avec les formations dédiées au TTS et aux pipelines vocaux avancés

Testez vos connaissances

Offline, temps réel, production : la transcription sous tous les angles.

1. Offline ou temps réel : comment choisir ?

Réponse : Offline pour les fichiers existants (réunions enregistrées, archives) avec la meilleure précision ; temps réel pour le direct (sous-titrage, assistants vocaux) où la latence prime.

2. Que fournissent timestamps et diarisation ?

Réponse : Les timestamps situent chaque segment dans le temps (sous-titres, navigation) ; la diarisation identifie qui parle — ensemble, ils transforment l’audio en compte rendu exploitable.

3. À quoi sert le context biasing ?

Réponse : À souffler au modèle le vocabulaire attendu (noms propres, termes métier) pour améliorer la précision là où la transcription générique échoue.

4. Quels sont les ingrédients du temps réel en Python ?

Réponse : La capture micro (PyAudio), l’envoi en flux à l’API et la gestion du compromis latence/précision — les paramètres de latence se règlent selon l’usage.

5. Que surveille-t-on pour la production ?

Réponse : La qualité audio en entrée, les coûts par heure transcrite, la latence de bout en bout et les erreurs sur le vocabulaire critique — avec le biasing et les tests comme leviers.

Le choix offline/temps réel structure tout le reste — le guide du cours vous donne la grille, vos cas d’usage font la décision.