OCR 4 : l'intelligence documentaire nouvelle génération
Mis à jour le 28 juillet 2026
Annoncé le 23 juin 2026, Mistral OCR 4 (v4.0) succède à OCR 3 comme service d’intelligence documentaire de Mistral — un domaine où l’éditeur revendique l’état de l’art. Derrière ce numéro de version se cache un changement qui intéresse directement quiconque construit des pipelines documentaires : la sortie du modèle n’est plus seulement du texte, c’est du texte situé et structuré.
Ce qu’apporte réellement OCR 4
La description officielle d’OCR 4 insiste sur deux capacités structurantes, et il vaut la peine de comprendre ce que chacune change concrètement.
La première, ce sont les boîtes englobantes au niveau du paragraphe (paragraph-level bounding boxes). Chaque bloc de texte reconnu est désormais localisé précisément dans la page : le modèle ne vous dit plus seulement « voici ce qui est écrit », il vous dit « voici ce qui est écrit, et voici exactement où ». Cette information de position paraît anecdotique tant qu’on n’a pas eu à répondre à la question d’un auditeur ou d’un client : « d’où sort cette donnée ? ». Avec des coordonnées par paragraphe, vous pouvez surligner dans le document source la zone exacte dont provient une réponse — c’est la traçabilité, et pour les usages en conformité, c’est souvent la fonctionnalité qui fait basculer une décision d’achat.
La seconde capacité, ce sont les blocs structurels : le document n’est pas restitué comme un texte plat, mais comme une structure — titres, paragraphes, tableaux, zones. La nuance est décisive. Un OCR classique vous rend un long ruban de caractères où le titre de section, la note de bas de page et la cellule de tableau se retrouvent concaténés dans l’ordre où le moteur les a rencontrés. OCR 4 vous rend un document typé, où chaque bloc sait ce qu’il est.
Pourquoi la structure compte autant que le texte
Prenez le cas le plus courant en 2026 : un système de RAG construit sur des PDF internes. La qualité des réponses dépend directement de la qualité du découpage en fragments. Avec un texte plat, ce découpage devient hasardeux : un fragment peut couper un tableau en deux, coller la fin d’un paragraphe au titre de la section suivante, ou noyer une note de bas de page au milieu d’un raisonnement. Le modèle de langage en aval reçoit alors des fragments incohérents, et aucune ingénierie de prompt ne rattrapera un contexte mal découpé.
Avec des blocs typés et localisés, la situation s’inverse. Vous découpez le document le long de ses frontières naturelles — un paragraphe reste un paragraphe, un tableau se reconstruit comme un tableau — et chaque fragment emporte avec lui ses coordonnées dans la page source. Le même raisonnement vaut pour l’extraction de données de factures ou la numérisation d’archives : ce n’est pas la reconnaissance des caractères qui fait la différence entre un pipeline fiable et un pipeline fragile, c’est la fidélité de la structure restituée. C’est précisément là qu’OCR 4 se distingue de son prédécesseur.
Impact sur nos cours Document AI
Notre formation « Document AI & OCR » a été écrite autour d’OCR 3, et il faut être clair sur ce qui vieillit et ce qui ne vieillit pas. La démarche enseignée — préparation des documents, qualité de numérisation, post-traitement des sorties — reste entièrement valable : ce sont des invariants du travail documentaire, indépendants de la version du modèle. En revanche, la leçon consacrée au « modèle OCR 3 » décrit désormais la génération précédente. Retenez la règle de lecture : OCR 4 appartient à la même famille d’API, avec une structure plus riche en sortie.
Un détail pratique mérite d’être répété, parce qu’il survit à toutes les montées de version : la qualité d’entrée reste déterminante. Un document scanné à basse résolution, avec des taches ou un contraste médiocre, restera difficile à traiter, quelle que soit la sophistication du modèle. Avant d’incriminer OCR 4 sur un résultat décevant, regardez d’abord ce que vous lui avez donné à lire — c’est le premier réflexe du praticien, et il évite bien des faux diagnostics.
Source officielle : mistral.ai/news — annonce du 23 juin 2026, et docs.mistral.ai
Points clés à retenir
- OCR 4 (v4.0) remplace OCR 3 comme modèle documentaire de référence
- Nouveautés structurantes : boîtes englobantes par paragraphe et blocs structurels
- La structure améliore le RAG, l’extraction et la traçabilité des réponses
- La qualité de numérisation d’entrée reste le premier facteur de réussite