Optimiser la pertinence de vos recherches
La qualite des resultats depend de vous
Le moteur de recherche de xAI est performant, mais la pertinence des resultats depend largement de la qualite de vos donnees et de vos requetes. Cette lecon couvre les techniques pour maximiser la precision de vos recherches dans les collections.
Structurer vos documents pour la recherche
Utilisez des titres clairs
Le moteur de recherche s’appuie sur la structure du document pour decouper le contenu en chunks. Des titres et sous-titres explicites ameliorent ce decoupage :
- Bon : “Politique de remboursement pour les achats en ligne”
- Mauvais : “Section 3.2.1”
Evitez les documents trop longs
Un PDF de 500 pages sera decoupe en centaines de chunks. Plus il y a de chunks, plus le risque de resultats peu pertinents augmente. Preferez :
- Decouper les gros documents en sections thematiques
- Un document de 20-50 pages par sujet plutot qu’un document omnibus
Incluez du contexte dans le texte
Chaque chunk doit etre comprehensible seul. Evitez les references anaphoriques (“comme mentionne ci-dessus”) qui perdent leur sens une fois le texte decoupe.
Rediger de meilleures requetes
Soyez specifique
La precision de la requete influe directement sur la pertinence des resultats :
- Vague : “securite” → retourne trop de resultats disparates
- Precis : “configuration du pare-feu pour les connexions entrantes sur le port 443” → resultats cibles
Utilisez le vocabulaire du domaine
Si vos documents utilisent un vocabulaire technique specifique, reprenez-le dans vos requetes. Le mode hybrid combine correspondance exacte et comprehension semantique, mais les termes exacts restent un signal fort.
Formulez des questions completes
Le mode semantic fonctionne mieux avec des questions en langage naturel qu’avec des mots-cles isoles :
- Mots-cles : “timeout connexion API”
- Question : “Comment configurer le delai d’expiration des connexions a l’API ?”
Exploiter les metadonnees
Filtrage par champs
Si vous avez defini des metadonnees avec inject_into_chunk, elles enrichissent les chunks et ameliorent la correspondance. Par exemple, si vos documents ont un champ department injecte dans les chunks, une recherche mentionnant “equipe marketing” trouvera plus facilement les documents du departement marketing.
Organisation en collections thematiques
Plutot qu’une seule enorme collection, creez des collections thematiques :
col_docs_techniques: documentation techniquecol_procedures_internes: processus et procedurescol_support_client: FAQ et guides utilisateur
Interrogez ensuite uniquement la collection pertinente. Moins de documents a fouiller signifie des resultats plus precis et des couts reduits.
Choisir le bon mode de recherche
Le choix du mode depend de votre requete :
- Recherche d’un code ou d’une reference precise : mode
keyword - Question conceptuelle en langage naturel : mode
semantic - Cas general ou doute : mode
hybrid(par defaut)
Evaluer et iterer
Testez vos collections
Avant de deployer en production, testez vos collections avec des requetes types :
- Formulez 10-20 questions representant des cas reels
- Executez-les et evaluez la pertinence des resultats
- Identifiez les requetes qui retournent des resultats inadequats
- Ajustez : ameliorez les documents, ajoutez des metadonnees, reformulez les requetes
Surveillez les scores de pertinence
Chaque resultat de recherche inclut un score entre 0 et 1. Si vos resultats ont systematiquement des scores bas (< 0.5), cela peut indiquer :
- Des documents mal structures
- Des requetes trop vagues
- Un manque de contenu couvrant le sujet recherche
Points cles a retenir
- La qualite des resultats depend de la structure des documents, de la precision des requetes et de l’organisation des collections
- Des titres explicites et des documents de taille raisonnable ameliorent le decoupage en chunks
- Des questions completes en langage naturel donnent de meilleurs resultats que des mots-cles isoles
- Les metadonnees
inject_into_chunkenrichissent les chunks et ameliorent la pertinence - Testez vos collections avec des requetes types avant le deploiement en production