Aller au contenu principal

Comprendre et analyser des images

Mis à jour le 29 juillet 2026

La vision de Grok

Grok ne se limite pas au texte. Les modèles grok-4.5 et supérieurs intègrent des capacités de vision qui leur permettent d’analyser des images fournies en entrée. Vous pouvez soumettre une photo, une capture d’écran, un graphique ou tout autre visuel, et Grok vous en donnera une description détaillée, une analyse ou une réponse contextuelle. Cela déplace la frontière de ce que vous pouvez lui confier : un tableau de bord photographié, une facture froissée ou une maquette d’application deviennent des documents exploitables au même titre qu’un texte collé dans la conversation.

Comment soumettre une image

Sur grok.com, l’opération tient en quatre gestes :

  1. Cliquez sur le bouton d’attachment dans le champ de saisie
  2. Sélectionnez l’image depuis votre appareil
  3. Ajoutez éventuellement un message textuel pour guider l’analyse
  4. Envoyez votre message

Sur mobile, vous pouvez également prendre une photo directement avec l’appareil photo de votre smartphone et l’envoyer à Grok pour analyse — c’est le mode le plus rapide devant un panneau, un menu ou un écran que vous ne pouvez pas copier-coller.

Pour les développeurs, l’envoi d’images se fait via un tableau mixte d’objets dans le champ input :

response = client.responses.create(
    model="grok-4.5",
    input=[
        {"type": "input_image", "image_url": "https://exemple.com/photo.jpg"},
        {"type": "input_text", "text": "Décris cette image en détail"}
    ]
)

Les images peuvent être fournies sous forme d’URL publique ou encodées en base64. Le choix n’est pas anodin : une URL publique suppose une image accessible depuis l’extérieur, ce qui exclut les documents internes ; le base64 alourdit la requête mais reste la seule option pour un fichier confidentiel.

Ce que vous pouvez réellement demander

La description reste l’usage le plus immédiat. Grok détaille les objets présents, les couleurs, la composition, l’ambiance, les personnes et leurs expressions. Encore faut-il cadrer la demande, sans quoi vous obtiendrez un inventaire plat :

Décris cette photographie en détail.
Quel est le sujet principal et quels éléments
secondaires observes-tu ?

L’extraction de texte, ou OCR, est sans doute l’usage le plus rentable au quotidien. Grok lit et retranscrit le texte des photos de documents, des captures d’écran, des panneaux et affiches, des menus de restaurant ou des cartes de visite — autant de cas où retaper l’information à la main coûte plusieurs minutes. Demander une mise en forme dans la foulée évite un second aller-retour :

Extrais tout le texte visible sur cette image
et structure-le de manière lisible.

L’analyse de graphiques et de diagrammes va plus loin que la lecture : Grok interprète des graphiques statistiques, des diagrammes de flux et des schémas techniques, et sait dire ce qu’ils racontent. C’est particulièrement utile quand un rapport PDF enferme sa conclusion dans une figure :

Analyse ce graphique. Quelles sont les tendances principales
et quelles conclusions peut-on en tirer ?

Vous pouvez aussi soumettre plusieurs images dans une même requête pour que Grok les compare, ce qui transforme une revue de design en conversation :

Voici deux versions d'un design. Quelles sont les
différences principales entre les deux ?

Les designers et les développeurs exploitent enfin cette vision sur leurs propres écrans, en demandant une critique d’ergonomie plutôt qu’une description :

Analyse cette capture d'écran d'application mobile.
Quels problèmes d'ergonomie identifies-tu ?

Régler le niveau de détail

Via l’API, le paramètre detail contrôle la profondeur de l’analyse d’image et accepte trois valeurs :

  • auto : le modèle choisit le niveau approprié (par défaut)
  • low : analyse rapide et économique, utilise moins de tokens
  • high : analyse détaillée et approfondie, consomme plus de tokens

Ce réglage arbitre entre précision et coût, cas par cas. Pour un simple OCR sur une facture, low suffit et divise la dépense sur des milliers de documents ; pour une analyse artistique fine ou un graphique dense, high évite les contresens.

Les contraintes à connaître

ContrainteValeur
Taille maximale20 MiB par image
Formats acceptésJPG, JPEG et PNG uniquement
Nombre d’imagesPas de limite par requête
ConsommationEntre 256 et 1 792 tokens selon la taille et le niveau de détail

Quelques réflexes tirent le meilleur de ces capacités. Cadrez votre demande plutôt que de réclamer une description générale : « combien de références sont en rupture sur cette capture » vaut mieux que « décris cette image ». Redimensionnez les fichiers volumineux, qui ralentissent le traitement sans rien apporter. Accompagnez toujours l’image d’un message textuel, car le contexte améliore nettement la pertinence de la réponse. Et respectez la logique des formats : JPG pour les photographies, PNG pour les captures d’écran et tout visuel contenant du texte, dont la compression JPG brouille les caractères fins et fait échouer l’OCR.

Points clés à retenir

  • Les modèles grok-4.5 et supérieurs peuvent analyser des images soumises en entrée
  • Les cas d’usage incluent la description, l’OCR, l’analyse de graphiques et la comparaison
  • Les images peuvent être fournies par URL ou en base64
  • Le paramètre de détail permet de contrôler le compromis entre précision et coût
  • Taille maximale de 20 MiB, formats JPG et PNG uniquement