Aller au contenu principal

Introduction à la Vision par IA avec Mistral

Quand les modèles IA apprennent à voir

Jusqu’à récemment, les assistants IA ne comprenaient que le texte. Vous pouviez leur poser des questions, leur demander de rédiger un e-mail ou de résumer un document — mais impossible de leur montrer une photo et d’obtenir une analyse pertinente. Avec les modèles multimodaux de Mistral AI, cette limitation appartient au passé.

La vision par IA désigne la capacité d’un modèle de langage à analyser le contenu visuel d’une image — une photo, un graphique, une capture d’écran, un schéma — et à en fournir une interprétation textuelle. Concrètement, vous uploadez une image dans Le Chat (l’assistant de Mistral) et le modèle vous répond comme s’il voyait réellement ce que vous lui montrez.

4+
Modèles vision disponibles
9+
Langues audio supportées
OCR 3
Moteur de reconnaissance documentaire
~90 ms
Latence TTS Voxtral

Pourquoi la vision change tout

Imaginez que vous receviez un graphique de ventes trimestrielles par e-mail. Avant, il fallait l’ouvrir dans un tableur, lire les chiffres, interpréter les tendances. Désormais, vous pouvez simplement coller cette image dans Le Chat et demander : « Quelle est la tendance principale ? » ou « Compare le Q1 et le Q3 ». Le modèle identifie les axes, les légendes, les valeurs, et vous fournit une réponse en langage naturel.

Cette capacité s’applique à de nombreux domaines du quotidien :

  • Photographies : décrire le contenu d’une photo, identifier des objets, des lieux ou des personnes
  • Documents scannés : lire le texte d’une carte de visite, d’un ticket de caisse ou d’un formulaire papier
  • Graphiques et diagrammes : extraire les données clés d’un camembert, d’un histogramme ou d’un diagramme en barres
  • Captures d’écran : analyser une interface, un message d’erreur ou un tableau de bord

Les modèles vision de Mistral

Mistral propose plusieurs modèles capables de traiter des images, chacun avec ses forces :

  • Mistral Large 3 — le modèle phare, le plus performant pour l’analyse visuelle complexe. Idéal quand vous avez besoin de précision maximale sur des images détaillées.
  • Mistral Medium 3.1 — un excellent compromis entre performance et rapidité. Parfait pour un usage quotidien dans Le Chat.
  • Mistral Small 3.2 — plus léger, il répond rapidement tout en conservant une bonne qualité d’analyse. Adapté aux tâches simples comme décrire une photo.
  • Ministral 3 — décliné en versions 14B, 8B et 3B paramètres. Ce sont les modèles les plus compacts, conçus pour des réponses rapides sur des analyses visuelles basiques.

Pour vous en tant qu’utilisateur de Le Chat, vous n’avez pas à choisir manuellement le modèle — l’interface sélectionne automatiquement le plus adapté à votre demande. Mais il est utile de comprendre que derrière une simple image uploadée, c’est un réseau de neurones multimodal qui travaille.

Ce que vous allez apprendre dans cette section

Cette première section du cours vous guide pas à pas dans l’utilisation de la vision IA via Le Chat de Mistral :

  • Comment uploader une image et poser des questions dessus
  • Comment analyser des graphiques et extraire des données de tableaux
  • Comment comparer plusieurs images dans une même conversation
  • Les cas d’usage créatifs qui dépassent la simple description d’image

Aucune compétence technique n’est requise. Si vous savez utiliser Le Chat pour écrire un message, vous savez déjà analyser une image — il suffit de la glisser dans la conversation.

Points clés à retenir

  • La vision IA permet aux modèles Mistral d’analyser des images en plus du texte
  • Plusieurs modèles sont disponibles, du plus puissant (Large 3) au plus compact (Ministral 3)
  • L’analyse fonctionne sur les photos, graphiques, documents scannés et captures d’écran
  • Dans Le Chat, il suffit d’uploader une image pour commencer — aucun code nécessaire