Aller au contenu principal

Connecteurs internes

Enterprise Search est aussi performant que les données auxquelles il a accès. Les connecteurs sont les passerelles qui relient vos outils métiers — stockage de fichiers, bases de connaissances, messagerie — à l’index sémantique de Mistral.

Cette leçon passe en revue les connecteurs disponibles, leurs spécificités et les bonnes pratiques de configuration.

Les connecteurs disponibles

Google Workspace

Le connecteur Google Workspace indexe :

  • Google Drive — documents, feuilles de calcul, présentations, PDF et fichiers uploadés
  • Google Docs — contenu textuel avec mise en forme
  • Gmail (optionnel) — emails et pièces jointes selon la politique de votre organisation

La synchronisation est bidirectionnelle pour les permissions : si vous retirez l’accès d’un collaborateur à un dossier Drive, Enterprise Search reflète ce changement automatiquement.

Microsoft 365 / SharePoint

Le connecteur Microsoft indexe :

  • SharePoint Online — sites, bibliothèques de documents, listes
  • OneDrive — fichiers personnels et partagés
  • Microsoft Teams (optionnel) — messages dans les canaux, fichiers partagés dans les conversations

La configuration utilise l’API Microsoft Graph. L’administrateur accorde les permissions nécessaires via Azure AD, sans donner accès au contenu des emails individuels.

Confluence (Atlassian)

Le connecteur Confluence indexe :

  • Pages et articles de blog
  • Commentaires et pièces jointes
  • Espaces restreints (en respectant les permissions Confluence)
  • Labels et métadonnées

Confluence est souvent la source la plus riche en documentation technique et en procédures internes. Le connecteur est particulièrement efficace sur ce type de contenu structuré.

Slack

Le connecteur Slack indexe :

  • Messages dans les canaux publics
  • Messages dans les canaux privés (uniquement pour les membres autorisés)
  • Fichiers partagés dans les conversations
  • Threads de discussion

L’indexation de Slack est précieuse pour capturer les décisions informelles et les échanges d’expertise qui ne sont jamais formalisés dans un document officiel.

Autres connecteurs

Mistral élargit régulièrement son catalogue de connecteurs. En avril 2026, sont également disponibles ou en bêta :

  • Notion — pages et bases de données
  • Jira — tickets et projets (descriptions, commentaires, pièces jointes)
  • Box — fichiers et dossiers
  • Zendesk — articles de la base de connaissances
  • API générique — pour connecter des sources internes propriétaires via un connecteur personnalisé

Configuration et bonnes pratiques

Principe de moindre privilège

Lors de la configuration des connecteurs, accordez uniquement les permissions nécessaires. Par exemple :

  • Si vous n’avez pas besoin d’indexer les emails, ne connectez pas Gmail
  • Limitez l’indexation à des espaces Confluence ou des sites SharePoint spécifiques
  • Excluez les dossiers contenant des données personnelles sensibles (dossiers RH individuels, données médicales)

Filtrage des sources

Chaque connecteur permet de définir des règles de filtrage :

  • Par dossier ou espace — indexer uniquement les espaces « Documentation » et « Procédures », pas les espaces personnels
  • Par type de fichier — exclure les fichiers vidéo, audio ou les exécutables
  • Par date — ne pas indexer les documents antérieurs à une certaine date
  • Par label ou tag — indexer uniquement les documents marqués comme « validés »

Fréquence de synchronisation

La synchronisation incrémentale est automatique. Vous pouvez configurer :

  • Temps réel — les modifications sont prises en compte en quelques minutes (recommandé pour Slack et les outils collaboratifs)
  • Horaire — synchronisation toutes les heures (adapté pour SharePoint et Drive)
  • Quotidienne — synchronisation une fois par jour (suffisant pour les bases de connaissances stables comme Confluence)

Gestion des doublons

Si le même document existe dans Google Drive et dans Confluence, Enterprise Search le détecte et n’affiche qu’un seul résultat. L’algorithme de dédoublonnage compare le contenu, pas le nom du fichier.

Formats de fichiers supportés

Enterprise Search traite les formats suivants :

  • Texte — PDF, Word (.docx), Excel (.xlsx), PowerPoint (.pptx), Google Docs/Sheets/Slides, texte brut, Markdown
  • Images avec texte — PDF scannés (OCR intégré), images avec du texte (PNG, JPEG)
  • Données structurées — CSV, JSON, tableaux dans des documents
  • Web — pages HTML, articles de base de connaissances

Les fichiers binaires (vidéo, audio, exécutables) ne sont pas indexés.

Supervision des connecteurs

La console d’administration permet de suivre l’état de chaque connecteur :

  • Nombre de documents indexés par source
  • Date de dernière synchronisation
  • Erreurs d’indexation (fichiers corrompus, permissions insuffisantes)
  • Volume de données par connecteur

Un connecteur en erreur n’affecte pas les autres — la recherche continue de fonctionner sur les sources opérationnelles.

Points clés à retenir

  • Les connecteurs Google Workspace, Microsoft 365, Confluence et Slack couvrent la majorité des besoins
  • Appliquez le principe de moindre privilège : n’indexez que ce qui est nécessaire
  • Configurez le filtrage par dossier, type de fichier et date pour optimiser la pertinence des résultats
  • Supervisez régulièrement l’état des connecteurs via la console d’administration