Introduction à Document AI
Pourquoi Document AI change la donne
Les entreprises traitent chaque jour des milliers de documents : factures, contrats, rapports médicaux, formulaires administratifs. Pendant des décennies, la reconnaissance optique de caractères (OCR) traditionnelle a tenté de résoudre ce problème, mais avec des résultats souvent décevants face aux mises en page complexes, à l’écriture manuscrite ou aux documents multilingues.
Mistral AI a développé Document AI, une solution complète qui va bien au-delà de l’OCR classique. Elle combine un modèle de vision (VLM) spécialisé avec des capacités d’extraction structurée et d’intelligence documentaire.
Les trois services de Document AI
Document AI repose sur trois services complémentaires, tous accessibles via l’API Mistral :
1. OCR Processor
Le coeur du système. Le modèle mistral-ocr-latest (OCR 3, version 25.12) extrait le texte depuis des documents scannés, des PDF, des images et des présentations. Contrairement à un OCR classique comme Tesseract, il préserve la structure du document : titres, paragraphes, tableaux, listes, hyperliens.
2. Annotations documentaires
Ce service permet d’annoter et d’extraire des données structurées depuis vos documents. Vous définissez un schéma Pydantic (nom du patient, montant de la facture, clauses contractuelles…) et le modèle extrait ces informations automatiquement.
3. Document QnA
Combinez l’OCR avec un LLM Mistral pour poser des questions en langage naturel sur le contenu de vos documents. Idéal pour interroger des archives, analyser des rapports ou comparer des contrats.
OCR classique vs Document AI
L’OCR traditionnel (Tesseract, Adobe Acrobat, etc.) fonctionne par reconnaissance de motifs pixel par pixel. Il échoue régulièrement sur :
- Les mises en page complexes : colonnes multiples, en-têtes imbriqués, contenus mixtes texte/image
- L’écriture manuscrite : notes de médecin, formulaires remplis à la main
- Les tableaux : fusion de cellules, bordures manquantes, alignements irréguliers
- Les documents multilingues : mélange de scripts (latin, arabe, asiatique)
- Les scans de mauvaise qualité : bruit, rotation, flou
Document AI utilise un modèle de vision fine-tuné (VLM) qui comprend la sémantique du document. Il ne se contente pas de reconnaître des caractères : il comprend la structure, le contexte et les relations entre les éléments.
Sortie en Markdown structuré
Une différence fondamentale : Document AI produit du Markdown structuré, pas du texte brut. Chaque page est découpée avec :
- Le contenu textuel en Markdown (titres, listes, paragraphes)
- Les tableaux formatés (Markdown ou HTML)
- Les images extraites avec leurs positions
- Les hyperliens préservés
- Les en-têtes et pieds de page (optionnel)
Cette sortie structurée est directement exploitable pour l’indexation RAG, l’archivage ou l’affichage.
Formats supportés
Document AI accepte les formats suivants :
- PDF : documents scannés ou natifs
- Images : PNG, JPEG, AVIF
- Présentations : PPTX
- Documents : DOCX
La taille maximale est de 50 Mo par fichier, avec un maximum de 1 000 pages.
Ce que vous allez apprendre
Ce cours vous guide à travers les trois services de Document AI :
- Leçons 1-3 : Vue d’ensemble, modèle OCR 3, cas d’usage
- Leçons 4-8 : OCR avancé — API, code Python, tableaux, headers/footers, optimisation
- Leçons 9-12 : Annotations — extraction de métadonnées, batch processing, cas d’usage
- Leçons 13-16 : QnA documentaire — questions sur documents, multi-documents, RAG, pipeline de production
Points clés à retenir
- Document AI combine OCR, annotations structurées et QnA en une seule solution
- Le modèle OCR 3 dépasse largement les solutions OCR traditionnelles en précision et flexibilité
- La sortie Markdown structurée facilite l’intégration dans vos pipelines existants
- Trois services complémentaires couvrent l’ensemble du cycle de vie documentaire