Aller au contenu principal

Compréhension d'images dans Web Search

Analyser les images trouvées sur le web

Web Search ne se limite pas au texte. Avec le paramètre enable_image_understanding, vous pouvez demander au modèle d’analyser les images qu’il trouve pendant sa recherche web. Cette fonctionnalité étend considérablement les capacités de recherche, notamment pour les questions visuelles ou les sujets où les images apportent des informations complémentaires au texte.

Activation

L’activation se fait via le paramètre enable_image_understanding ajouté à la configuration de Web Search :

{
  "tools": [{
    "type": "web_search",
    "enable_image_understanding": true
  }]
}

Quand ce paramètre est activé, le modèle peut utiliser l’outil interne view_image pour analyser les images rencontrées pendant la recherche. Il décide automatiquement quelles images sont pertinentes à examiner.

Syntaxe par SDK

xAI SDK

response = client.responses.create(
    model="grok-4.20-reasoning",
    input="Montre-moi l'architecture du transformer et explique chaque composant",
    tools=[client.tools.web_search(
        enable_image_understanding=True
    )]
)

OpenAI SDK

response = client.responses.create(
    model="grok-4.20-reasoning",
    input="Montre-moi l'architecture du transformer",
    tools=[{
        "type": "web_search",
        "enable_image_understanding": True
    }]
)

Vercel AI SDK

tools: [xai.tools.webSearch({
  enableImageUnderstanding: true
})]

Cas d’usage

Analyse de diagrammes techniques

Le modèle peut trouver et interpréter des diagrammes d’architecture, des schémas de flux, ou des graphiques techniques. C’est particulièrement utile pour des questions sur des architectures logicielles ou des processus industriels.

Comparaison visuelle de produits

Pour des requêtes de type comparatif, le modèle peut analyser les captures d’écran ou les photos de produits trouvées sur le web et en tirer des observations pertinentes.

Analyse de données visuelles

Si votre question porte sur des données présentées sous forme de graphiques ou de tableaux visuels, la compréhension d’images permet au modèle d’extraire les informations de ces représentations visuelles.

Combinaison avec les autres paramètres

La compréhension d’images se combine avec le filtrage de domaines :

response = client.responses.create(
    model="grok-4.20-reasoning",
    input="Analyse les derniers benchmarks de performance des LLM",
    tools=[{
        "type": "web_search",
        "allowed_domains": ["arxiv.org", "huggingface.co"],
        "enable_image_understanding": True
    }]
)

Le modèle recherchera uniquement sur les domaines autorisés et pourra analyser les graphiques de benchmark trouvés dans les publications.

Impact sur les coûts

L’activation de la compréhension d’images augmente la consommation de tokens. L’analyse de chaque image génère des tokens supplémentaires en entrée (l’image encodée) et en sortie (la description/analyse). Le coût par invocation reste identique (0,005 $), mais le volume de tokens par requête peut augmenter significativement.

N’activez cette fonctionnalité que lorsque les images apportent une valeur ajoutée réelle à votre cas d’usage. Pour des recherches purement textuelles, laissez ce paramètre désactivé pour optimiser vos coûts.

La compréhension d’images est disponible pour Web Search et X Search. Cependant, la compréhension vidéo (enable_video_understanding) est exclusive à X Search. Web Search ne peut pas analyser les vidéos trouvées sur le web.

Points clés à retenir

  • Activez avec enable_image_understanding: true dans la configuration Web Search
  • Le modèle utilise view_image en interne pour analyser les images pertinentes
  • Utile pour les diagrammes, graphiques, captures d’écran et comparaisons visuelles
  • Augmente la consommation de tokens — à activer uniquement quand c’est pertinent
  • Se combine avec le filtrage de domaines pour un contrôle précis des sources
  • La compréhension vidéo est exclusive à X Search