Aller au contenu principal

Le modèle OCR 3

Un VLM spécialisé pour l’extraction documentaire

Le modèle mistral-ocr-latest (OCR 3, version 25.12) est un modèle de vision (VLM) fine-tuné spécifiquement pour l’extraction de texte depuis des documents. Contrairement aux modèles généralistes comme Pixtral ou GPT-4o, il est optimisé pour cette tâche unique, ce qui lui confère une précision supérieure pour un coût moindre.

Caractéristiques techniques

Architecture VLM

OCR 3 repose sur une architecture de tokenisation entrelacée : le modèle traite simultanément les tokens textuels et les tokens visuels. Cette approche lui permet de comprendre non seulement les caractères individuels, mais aussi la structure globale du document (colonnes, hiérarchie des titres, relations entre texte et images).

Tier Premier

OCR 3 fait partie du tier Premier de Mistral AI. Cela signifie :

  • Haute disponibilité via l’API La Plateforme
  • Mises à jour régulières sans interruption de service
  • SLA entreprise disponible pour les déploiements critiques

Support multilingue

Le modèle gère nativement plus de 50 langues, y compris :

  • Les langues latines (français, anglais, espagnol, allemand, italien, portugais…)
  • Les langues asiatiques (chinois, japonais, coréen)
  • L’arabe et l’hébreu (scripts de droite à gauche)
  • Le cyrillique (russe, ukrainien)
  • L’écriture manuscrite dans toutes ces langues

Sortie structurée par page

Pour chaque page traitée, OCR 3 retourne un objet JSON contenant :

{
    "index": 0,              # Numéro de page (0-indexé)
    "markdown": "## Titre\n\nContenu...",  # Texte en Markdown
    "images": [...],         # Images extraites (base64 optionnel)
    "tables": [...],         # Tableaux détectés
    "hyperlinks": [...],     # Liens hypertexte préservés
    "header": "En-tête",     # En-tête de page (optionnel)
    "footer": "Pied de page", # Pied de page (optionnel)
    "dimensions": {          # Dimensions de la page
        "width": 612,
        "height": 792
    }
}

Formatage des tableaux

Vous pouvez choisir le format de sortie des tableaux via le paramètre table_format :

  • null (défaut) : tableaux en ligne dans le Markdown
  • "markdown" : tableaux en format Markdown standard avec pipes |
  • "html" : tableaux en HTML complet avec balises <table>, <tr>, <td>

Images extraites

Le modèle segmente automatiquement les images présentes dans le document. Avec l’option include_image_base64=True, vous récupérez chaque image en base64, prête à être sauvegardée ou traitée.

Comparaison avec les alternatives

vs Tesseract (OCR classique)

Tesseract fonctionne bien sur du texte imprimé simple, mais échoue sur :

  • Les tableaux (aucune compréhension de la structure)
  • L’écriture manuscrite
  • Les mises en page multi-colonnes
  • Les documents de mauvaise qualité

OCR 3, étant un VLM, comprend visuellement la page et reconstruit sa structure sémantique.

vs Modèles généralistes (Pixtral, GPT-4o, Gemini)

Les modèles généralistes peuvent traiter des documents, mais :

  • Ils consomment beaucoup plus de tokens (les images prennent énormément de tokens)
  • Ils ne sont pas optimisés pour l’extraction fidèle
  • Ils hallucinent plus facilement sur les chiffres et tableaux
  • Ils coûtent significativement plus cher à grande échelle

OCR 3 est fine-tuné pour la fidélité d’extraction, pas la génération.

Benchmarks

OCR 3 se positionne comme le modèle OCR le plus précis disponible via API. Les benchmarks montrent des performances supérieures sur :

  • L’extraction de texte : précision quasi parfaite sur les documents imprimés
  • Les tableaux : reconstruction fidèle de la structure tabulaire
  • L’écriture manuscrite : reconnaissance multilingue de haute qualité
  • Les mises en page complexes : colonnes, encarts, graphiques intégrés

Modèle d’identifiant

Pour utiliser OCR 3 dans vos appels API, utilisez toujours l’identifiant :

model = "mistral-ocr-latest"

Cet identifiant pointe toujours vers la dernière version stable du modèle. Les mises à jour sont transparentes et rétrocompatibles.

Points clés à retenir

  • OCR 3 est un VLM fine-tuné, pas un OCR classique par reconnaissance de motifs
  • Il produit du Markdown structuré page par page avec images, tableaux et métadonnées
  • Le support multilingue couvre 50+ langues, y compris l’écriture manuscrite
  • Il surpasse les OCR classiques et les modèles généralistes en précision d’extraction
  • L’identifiant mistral-ocr-latest garantit l’accès à la dernière version