Extraction Structurée : Tableaux, En-têtes et Données Chiffrées
Mis à jour le 28 juillet 2026
Passer du document brut aux données organisées
Extraire du texte d’un document, c’est bien. Mais la vraie valeur apparaît quand vous obtenez des données structurées : des tableaux propres, des chiffres identifiés, des en-têtes classifiés. C’est la différence entre recevoir la photocopie d’un bilan et recevoir le même bilan dans un tableur exploitable. Document AI de Mistral excelle précisément dans cette tâche : il ne se contente pas de lire le texte, il comprend la structure du document et restitue les informations dans un format directement utilisable.
Les tableaux, terrain de prédilection
Les tableaux sont omniprésents dans les documents professionnels — bilans financiers, grilles tarifaires, plannings, résultats d’études — et c’est historiquement là que l’OCR classique échouait le plus lamentablement, mélangeant colonnes et lignes en bouillie. Le moteur OCR 3 les traite au contraire avec une précision remarquable. Quand vous chargez un document contenant un tableau dans Le Chat, le modèle identifie d’abord les bordures du tableau, même quand elles sont subtiles ou en couleur. Il reconnaît ensuite les en-têtes et les distingue des données, puis associe chaque cellule à sa colonne et à sa ligne. Il gère même les cas difficiles : cellules fusionnées, sous-totaux, notes de bas de tableau — autant de pièges classiques qu’un tableur mal converti transforme en erreurs silencieuses.
Pour obtenir un résultat exploitable, prenez l’habitude de préciser le format souhaité dans votre demande. « Extrais le tableau de la page 3 au format Markdown » vous donne un tableau lisible directement dans Le Chat ; « Convertis ce tableau en CSV que je puisse coller dans Excel » prépare l’import dans un tableur ; « Extrais uniquement la colonne “Montant” et la colonne “Date” » filtre à la source ce dont vous avez besoin. Le format Markdown est souvent le plus pratique au quotidien : lisible immédiatement, facile à copier-coller dans d’autres outils.
En-têtes, hiérarchie et structure
Au-delà des tableaux, Document AI sait reconstituer la hiérarchie du document : les titres et sous-titres sont identifiés et classés par niveau (h1, h2, h3), les paragraphes sont distingués les uns des autres même sans saut de ligne visible, les listes à puces ou numérotées sont correctement reconstituées, et les notes de bas de page sont associées à leur référence. Cette capacité est précieuse quand vous travaillez avec des rapports longs ou des documents juridiques, où la structure porte autant de sens que le texte : savoir qu’une clause figure dans la section « Garanties » plutôt que dans « Divers » change son interprétation.
Vous pouvez donc formuler des demandes structurelles : « Donne-moi la table des matières de ce document », « Liste tous les titres de section avec leur numéro de page », ou encore « Extrais uniquement les paragraphes qui parlent de garantie » — cette dernière requête combinant la structure et le sens.
Les données chiffrées, avec leur contexte
Les documents financiers, devis, factures et rapports d’activité regorgent de chiffres : montants financiers (chiffre d’affaires, totaux, TVA, remises), dates de signature ou d’échéance, pourcentages de parts de marché ou de marge, identifiants comme les numéros de facture, références client ou SIRET. Ce qui distingue Document AI, c’est qu’il ne se contente pas d’extraire des nombres — il comprend leur contexte. Si vous demandez « Quel est le chiffre d’affaires annuel ? », il cherchera spécifiquement le nombre associé à cette notion, même s’il est noyé dans un tableau de 50 lignes. Un OCR classique vous aurait rendu cinquante nombres sans étiquette ; ici, vous obtenez le bon.
Cette compréhension permet d’aller plus loin que l’extraction : vous pouvez demander des calculs et des vérifications. « Le total de la colonne “Montant HT” est-il correct ? » fait recompter le modèle ; « Quelle est la différence entre le budget prévisionnel et le réalisé ? » croise deux colonnes ; « Quel poste de dépense représente la plus grande part ? » transforme le tableau en analyse.
Pour les utilisateurs avancés, l’export JSON structure la sortie pour vos outils : « Extrais les informations de cette facture au format JSON : numéro, date, montant HT, TVA, montant TTC, fournisseur » ou « Crée un objet JSON avec les données de chaque ligne du tableau ». Ce format est idéal si les données doivent ensuite alimenter un tableur, une base de données ou un autre logiciel.
En pratique
Voyez comment ces capacités s’assemblent sur trois situations courantes. Vous recevez une pile de factures en PDF : pour chacune, demandez « Extrais de cette facture : le nom du fournisseur, la date, le numéro de facture, le montant HT, la TVA et le montant TTC. Présente sous forme de tableau » — et votre saisie comptable est préparée. Face à un rapport annuel de 50 pages : « Extrais tous les tableaux financiers de ce rapport et présente-les en Markdown. Identifie le chiffre d’affaires, le résultat net et la marge opérationnelle. » Pour départager deux devis, chargez-les puis demandez : « Compare les prix de ces deux devis pour les mêmes prestations. Identifie les différences de tarif. »
Quelques règles de méthode pour finir. Soyez spécifique sur ce que vous cherchez — un tableau en particulier, une colonne, un type de donnée — et indiquez toujours le format de sortie voulu (Markdown, CSV, JSON, liste). Pour les documents scannés, une résolution de 150 DPI minimum est recommandée pour une extraction fiable. Si le document est très dense, traitez page par page : « Extrais le tableau de la page 7 » donnera un meilleur résultat qu’un « Extrais tous les tableaux » global. Et pour tout usage critique, croisez les données extraites avec le document original — l’extraction est un accélérateur, pas une décharge de responsabilité.
Points clés à retenir
- Document AI reconstitue fidèlement les tableaux avec en-têtes, colonnes et cellules fusionnées
- Vous pouvez demander une extraction en Markdown, CSV ou JSON selon vos besoins
- Le modèle comprend le contexte des données chiffrées et peut répondre à des questions précises
- La structure hiérarchique du document (titres, sous-titres, listes) est préservée
- Vérifiez toujours les extractions pour les usages critiques