Aller au contenu principal

Introduction à Document AI

Pourquoi Document AI change la donne

Les entreprises traitent chaque jour des milliers de documents : factures, contrats, rapports médicaux, formulaires administratifs. Pendant des décennies, la reconnaissance optique de caractères (OCR) traditionnelle a tenté de résoudre ce problème, mais avec des résultats souvent décevants face aux mises en page complexes, à l’écriture manuscrite ou aux documents multilingues.

Mistral AI a développé Document AI, une solution complète qui va bien au-delà de l’OCR classique. Elle combine un modèle de vision (VLM) spécialisé avec des capacités d’extraction structurée et d’intelligence documentaire.

2 000
Pages/min par GPU
3
Services intégrés
50+
Langues supportées
6
Formats supportés

Les trois services de Document AI

Document AI repose sur trois services complémentaires, tous accessibles via l’API Mistral :

1. OCR Processor

Le coeur du système. Le modèle mistral-ocr-latest (OCR 3, version 25.12) extrait le texte depuis des documents scannés, des PDF, des images et des présentations. Contrairement à un OCR classique comme Tesseract, il préserve la structure du document : titres, paragraphes, tableaux, listes, hyperliens.

2. Annotations documentaires

Ce service permet d’annoter et d’extraire des données structurées depuis vos documents. Vous définissez un schéma Pydantic (nom du patient, montant de la facture, clauses contractuelles…) et le modèle extrait ces informations automatiquement.

3. Document QnA

Combinez l’OCR avec un LLM Mistral pour poser des questions en langage naturel sur le contenu de vos documents. Idéal pour interroger des archives, analyser des rapports ou comparer des contrats.

OCR classique vs Document AI

L’OCR traditionnel (Tesseract, Adobe Acrobat, etc.) fonctionne par reconnaissance de motifs pixel par pixel. Il échoue régulièrement sur :

  • Les mises en page complexes : colonnes multiples, en-têtes imbriqués, contenus mixtes texte/image
  • L’écriture manuscrite : notes de médecin, formulaires remplis à la main
  • Les tableaux : fusion de cellules, bordures manquantes, alignements irréguliers
  • Les documents multilingues : mélange de scripts (latin, arabe, asiatique)
  • Les scans de mauvaise qualité : bruit, rotation, flou

Document AI utilise un modèle de vision fine-tuné (VLM) qui comprend la sémantique du document. Il ne se contente pas de reconnaître des caractères : il comprend la structure, le contexte et les relations entre les éléments.

Sortie en Markdown structuré

Une différence fondamentale : Document AI produit du Markdown structuré, pas du texte brut. Chaque page est découpée avec :

  • Le contenu textuel en Markdown (titres, listes, paragraphes)
  • Les tableaux formatés (Markdown ou HTML)
  • Les images extraites avec leurs positions
  • Les hyperliens préservés
  • Les en-têtes et pieds de page (optionnel)

Cette sortie structurée est directement exploitable pour l’indexation RAG, l’archivage ou l’affichage.

Formats supportés

Document AI accepte les formats suivants :

  • PDF : documents scannés ou natifs
  • Images : PNG, JPEG, AVIF
  • Présentations : PPTX
  • Documents : DOCX

La taille maximale est de 50 Mo par fichier, avec un maximum de 1 000 pages.

Ce que vous allez apprendre

Ce cours vous guide à travers les trois services de Document AI :

  1. Leçons 1-3 : Vue d’ensemble, modèle OCR 3, cas d’usage
  2. Leçons 4-8 : OCR avancé — API, code Python, tableaux, headers/footers, optimisation
  3. Leçons 9-12 : Annotations — extraction de métadonnées, batch processing, cas d’usage
  4. Leçons 13-16 : QnA documentaire — questions sur documents, multi-documents, RAG, pipeline de production

Points clés à retenir

  • Document AI combine OCR, annotations structurées et QnA en une seule solution
  • Le modèle OCR 3 dépasse largement les solutions OCR traditionnelles en précision et flexibilité
  • La sortie Markdown structurée facilite l’intégration dans vos pipelines existants
  • Trois services complémentaires couvrent l’ensemble du cycle de vie documentaire