Aller au contenu principal

Modes de recherche : keyword, semantic, hybrid

Mis à jour le 29 juillet 2026

Trois approches pour trouver l’information

Le champ retrieval_mode accepte trois valeurs, et ce choix n’est pas cosmétique : il détermine ce que le moteur compare. Un mode regarde les mots, un autre regarde le sens, le troisième fait les deux. Selon vos documents et la manière dont vos utilisateurs formulent leurs questions, l’écart de pertinence entre deux modes peut être spectaculaire sur la même collection.

Le mode keyword : la correspondance littérale

Le mode keyword se comporte comme un moteur de recherche classique. Il confronte les mots de votre requête au texte indexé et remonte les passages qui contiennent effectivement ces mots.

{
  "query": "taux TVA 20%",
  "source": { "collection_ids": ["col_fiscal"] },
  "retrieval_mode": { "type": "keyword" }
}

Sa force tient à sa littéralité. Sur une référence produit « XR-2847 », un numéro de facture, un article de loi ou un acronyme métier, il ne se trompe pas : soit la chaîne est là, soit elle n’y est pas. Il ne calcule aucun embedding, ce qui le rend rapide. Sa faiblesse est le revers exact de cette qualité : il ne comprend rien. Si votre document parle de « taxe sur la valeur ajoutée » quand l’utilisateur écrit « TVA », la correspondance n’a pas lieu et vous récupérez zéro résultat sur un document qui contenait pourtant la réponse. Tout dépend alors de la coïncidence de vocabulaire entre le rédacteur et le lecteur, ce qui est un pari risqué dès que vos utilisateurs ne sont pas les auteurs des documents.

Le mode semantic : la compréhension du sens

Le mode semantic transforme la requête et les chunks en vecteurs, puis compare les significations plutôt que les caractères. Il remonte donc des passages pertinents même quand aucun mot n’est partagé.

{
  "query": "comment réduire les impôts sur les ventes",
  "source": { "collection_ids": ["col_fiscal"] },
  "retrieval_mode": { "type": "semantic" }
}

Cette requête ne contient ni « TVA » ni « exonération », et pourtant elle fera remonter les passages traitant de TVA, de taxe sur la valeur ajoutée, de déductions fiscales ou d’exonérations. C’est précisément ce que vous voulez pour un assistant grand public : vos utilisateurs interrogent avec leurs mots, pas avec le lexique de votre service juridique. Le mode encaisse les synonymes sans broncher — « remboursement », « avoir » et « crédit » se rapprochent naturellement dans l’espace vectoriel. En contrepartie, il perd en précision là où la précision est absolue : un code produit « XR-2847 » ressemble sémantiquement à « XR-2874 », et le moteur peut vous rendre le mauvais. Chaque requête suppose en outre un calcul d’embeddings, donc un coût computationnel qui n’existe pas en mode keyword.

Le mode hybrid : les deux signaux à la fois

Le mode hybrid est le mode par défaut et celui que recommande xAI, parce qu’il refuse le compromis. Prenez une requête juridique typique, qui mélange une référence exacte et une notion floue.

{
  "query": "article L.121-3 responsabilité du dirigeant",
  "source": { "collection_ids": ["col_juridique"] },
  "retrieval_mode": { "type": "hybrid" }
}

Le traitement se fait en trois temps. Le moteur exécute d’abord une recherche keyword pour attraper les correspondances exactes, ici la chaîne « L.121-3 ». Il lance en parallèle une recherche sémantique qui va chercher les passages conceptuellement liés à la responsabilité du dirigeant, même lorsqu’ils n’emploient pas ces mots-là. Il fusionne enfin les deux listes et les réordonne pour maximiser la pertinence globale.

Le résultat capture à la fois les articles qui citent nommément L.121-3 et les commentaires qui traitent de la responsabilité des dirigeants sans mentionner l’article. Le rappel s’améliore nettement : vous manquez moins de documents pertinents, quel que soit le registre de la question. C’est pour cette raison que hybrid convient aussi bien à une requête technique qu’à une phrase conversationnelle, et qu’il constitue le choix par défaut raisonnable.

Deux situations justifient malgré tout de sortir de ce réglage. Si vous cherchez une signature de fonction précise dans une base de code, le bruit sémantique vous dessert et keyword sera plus net. À l’inverse, pour une exploration large — « qu’avons-nous écrit autour de la fidélisation ? » — sans terme pivot à faire correspondre, semantic ratisse plus large et vous fait découvrir des documents que vous ne cherchiez pas.

Comparatif des modes

Critèrekeywordsemantichybrid
Termes exactsExcellentMoyenBon
SynonymesFaibleExcellentBon
Langage naturelFaibleExcellentExcellent
Codes/référencesExcellentFaibleBon
RecommandationCas spécifiquesExplorationPar défaut

Une manière simple de trancher : prenez dix questions réelles de vos utilisateurs, lancez-les dans les trois modes sur la même collection et comparez les cinq premiers résultats. En un quart d’heure, vous saurez si votre corpus penche vers le vocabulaire exact ou vers le sens.

Points clés à retenir

  • Le mode keyword cherche les correspondances exactes — idéal pour les termes techniques et les références
  • Le mode semantic comprend le sens — idéal pour les questions en langage naturel
  • Le mode hybrid combine les deux — c’est le choix par défaut recommandé
  • Utilisez keyword pour les recherches de codes, identifiants ou valeurs exactes
  • Utilisez hybrid dans tous les autres cas