Introduction à Document AI et l'OCR Intelligent
Mis à jour le 28 juillet 2026
Bien plus qu’un simple lecteur de documents
Vous avez vu dans la section Vision que Le Chat peut lire du texte dans une image. Mais quand il s’agit de traiter des documents complexes — un PDF de plusieurs dizaines de pages, un formulaire scanné, un rapport financier truffé de tableaux imbriqués — il faut un outil spécialisé. C’est exactement ce que propose Document AI de Mistral, propulsé par le moteur OCR 3. Cette leçon pose les fondations de toute la section : comprendre ce qu’est l’OCR, en quoi l’approche de Mistral rompt avec les solutions classiques, et surtout quand l’utiliser plutôt que la vision.
OCR signifie Optical Character Recognition — Reconnaissance Optique de Caractères. C’est la technologie qui convertit une image contenant du texte, qu’il s’agisse d’un scan, d’une photo ou d’un PDF image, en texte numérique exploitable : un texte que vous pouvez copier, rechercher ou analyser comme n’importe quel document né numérique. L’enjeu est quotidien : pensez à cette facture reçue en photo par un collègue, ou à ce contrat scanné il y a dix ans dont vous cherchez une clause précise. Sans OCR, ces documents sont des images muettes.
Pourquoi l’OCR classique ne suffisait pas
L’OCR existe depuis des décennies, mais les solutions traditionnelles — Tesseract est l’exemple le plus connu — présentaient des limitations significatives que quiconque a déjà scanné un document connaît bien. La mise en page était perdue : le texte sortait en vrac, sans respecter la structure du document, et un rapport soigneusement organisé devenait une bouillie de paragraphes. Les tableaux étaient ignorés, colonnes et lignes mélangées au point de rendre les données inutilisables. L’écriture manuscrite restait quasi impossible à lire. Les documents multilingues donnaient des résultats médiocres dès qu’on sortait de l’anglais. Et les images intégrées au texte — graphiques, diagrammes — étaient purement et simplement passées sous silence.
Le moteur OCR 3 de Mistral change radicalement la donne, et la raison tient à son architecture. Au lieu d’utiliser des techniques classiques de reconnaissance de caractères, il s’appuie sur un modèle de langage multimodal (VLM) spécialement entraîné pour comprendre les documents. La différence est fondamentale : l’OCR classique reconnaît des caractères individuels et tente de les assembler en mots, un peu comme quelqu’un qui déchiffrerait lettre par lettre sans comprendre la phrase. L’OCR par IA de Mistral, lui, comprend le document dans son ensemble — sa structure, son contenu, son contexte. Face à un mot partiellement effacé, il peut le déduire du contexte, comme le ferait un lecteur humain.
Concrètement, Document AI sait extraire du texte depuis des PDF, images et documents scannés en conservant la mise en page d’origine. Il reconstitue les tableaux avec leurs en-têtes, colonnes et données, restitués en format Markdown propre. Il lit l’écriture manuscrite — notes de médecin, formulaires remplis à la main, annotations en marge. Il traite les documents multilingues avec une précision élevée dans de nombreuses langues, décrit les images et graphiques contenus dans le document en générant des légendes textuelles, et comprend le contexte suffisamment pour répondre à des questions sur le contenu.
OCR 3 en chiffres
Côté performances, le moteur affiche une précision de pointe sur les benchmarks de reconnaissance de texte, d’écriture manuscrite et de tableaux. Il traite jusqu’à 2 000 pages par minute sur un seul GPU — de quoi absorber des archives entières. Il accepte de multiples formats : PDF, Word, images scannées, photos de qualité variable. Et sa sortie est structurée : le résultat est du Markdown propre avec les images référencées, pas du texte brut à retravailler.
Quelle différence avec la vision de Le Chat ?
Vous vous demandez peut-être : « Pourquoi ne pas simplement uploader mon PDF dans Le Chat et utiliser la vision ? » La question est légitime, et la réponse structure toute votre pratique. La vision de Le Chat, vue en première section de ce cours, est parfaite pour analyser une image isolée — une photo, un graphique, une capture d’écran. Mais pour des documents de plusieurs pages avec des mises en page complexes, Document AI offre des avantages décisifs : un traitement page par page avec reconstitution de la structure globale du document, une extraction de tableaux fidèle à l’original et non une approximation, des annotations et métadonnées que vous pouvez demander explicitement — auteur, date, montants — et un véritable questions-réponses documentaire sur des documents longs.
Retenez la règle pratique : pour une seule image avec du texte, la vision suffit ; pour un document de plusieurs pages que vous voulez analyser en profondeur, c’est Document AI qu’il faut mobiliser. Un juriste qui photographie une clause pour la faire expliquer utilise la vision ; le même juriste qui charge le contrat complet de 40 pages pour en auditer les obligations utilise Document AI.
Dans les leçons suivantes de cette section, vous apprendrez à charger un PDF dans Le Chat et obtenir une extraction automatique, à extraire des données structurées — tableaux, en-têtes, chiffres — depuis n’importe quel document, puis à poser des questions sur le contenu d’un document et obtenir des réponses précises.
Points clés à retenir
- Document AI est la solution de Mistral pour le traitement intelligent de documents, propulsée par OCR 3
- Contrairement à l’OCR classique, OCR 3 comprend la structure et le contexte des documents
- Il gère les tableaux, l’écriture manuscrite, les documents multilingues et les images intégrées
- Pour une image simple, utilisez la vision ; pour un document complexe, utilisez Document AI
- Le traitement est rapide : jusqu’à 2 000 pages par minute