Aller au contenu principal

Introduction à Document AI et l'OCR Intelligent

Bien plus qu’un simple lecteur de documents

Vous avez vu dans la section Vision que Le Chat peut lire du texte dans une image. Mais quand il s’agit de traiter des documents complexes — PDF de dizaines de pages, formulaires scannés, rapports financiers avec tableaux imbriqués — il faut un outil spécialisé. C’est exactement ce que propose Document AI de Mistral, propulsé par le moteur OCR 3.

Qu’est-ce que l’OCR ?

OCR signifie Optical Character Recognition (Reconnaissance Optique de Caractères). C’est la technologie qui permet de convertir une image contenant du texte — un scan, une photo, un PDF image — en texte numérique exploitable. Vous pouvez ensuite copier, chercher ou analyser ce texte comme n’importe quel document numérique.

L’OCR existe depuis des décennies, mais les solutions traditionnelles (comme Tesseract) présentaient des limitations significatives :

  • Mise en page perdue : le texte est extrait en vrac, sans respecter la structure du document
  • Tableaux ignorés : les colonnes et lignes des tableaux sont mélangées
  • Écriture manuscrite : quasi impossible à lire
  • Documents multilingues : résultats médiocres dès qu’on sort de l’anglais
  • Images dans le texte : les graphiques et diagrammes sont complètement ignorés

La révolution de l’OCR par IA

Le moteur OCR 3 de Mistral change radicalement la donne. Au lieu d’utiliser des techniques classiques de reconnaissance de caractères, il s’appuie sur un modèle de langage multimodal (VLM) spécialement entraîné pour comprendre les documents. La différence est fondamentale :

  • L’OCR classique reconnaît des caractères individuels et tente de les assembler en mots
  • L’OCR par IA de Mistral comprend le document dans son ensemble — sa structure, son contenu, son contexte

Ce que Document AI sait faire

  • Extraire du texte depuis des PDF, images et documents scannés, en conservant la mise en page d’origine
  • Reconstituer les tableaux avec leurs en-têtes, colonnes et données, en format Markdown propre
  • Lire l’écriture manuscrite — notes de médecin, formulaires remplis à la main, annotations
  • Traiter les documents multilingues avec une précision élevée dans de nombreuses langues
  • Décrire les images et graphiques contenus dans le document, en générant des légendes textuelles
  • Comprendre le contexte pour répondre à des questions sur le contenu du document

OCR 3 en chiffres

Le moteur OCR 3 de Mistral se distingue par ses performances :

  • Précision de pointe sur les benchmarks de reconnaissance de texte, d’écriture manuscrite et de tableaux
  • Jusqu’à 2 000 pages par minute de traitement sur un seul GPU
  • Support multiformat : PDF, Word, images scannées, photos de qualité variable
  • Sortie structurée : le résultat est du Markdown propre avec les images référencées, pas du texte brut

Quelle différence avec la vision de Le Chat ?

Vous vous demandez peut-être : « Pourquoi ne pas simplement uploader mon PDF dans Le Chat et utiliser la vision ? »

La vision de Le Chat (section 1 de ce cours) est parfaite pour analyser une image isolée — une photo, un graphique, une capture d’écran. Mais pour des documents de plusieurs pages avec des mises en page complexes, Document AI offre des avantages décisifs :

  • Traitement page par page avec reconstitution de la structure globale du document
  • Extraction de tableaux fidèle à l’original, pas une approximation
  • Annotations et métadonnées : vous pouvez demander au modèle d’extraire des informations spécifiques (auteur, date, montants)
  • Questions-réponses documentaires : posez des questions précises sur le contenu de documents longs

En pratique, pour une seule image avec du texte, utilisez la vision. Pour un document de plusieurs pages que vous voulez analyser en profondeur, utilisez Document AI.

Ce que vous allez apprendre

Dans les leçons suivantes de cette section, vous découvrirez :

  • Comment charger un PDF dans Le Chat et obtenir une extraction automatique
  • Comment extraire des données structurées — tableaux, en-têtes, chiffres — depuis n’importe quel document
  • Comment poser des questions sur le contenu d’un document et obtenir des réponses précises

Points clés à retenir

  • Document AI est la solution de Mistral pour le traitement intelligent de documents, propulsée par OCR 3
  • Contrairement à l’OCR classique, OCR 3 comprend la structure et le contexte des documents
  • Il gère les tableaux, l’écriture manuscrite, les documents multilingues et les images intégrées
  • Pour une image simple, utilisez la vision ; pour un document complexe, utilisez Document AI
  • Le traitement est rapide : jusqu’à 2 000 pages par minute