Concepts Clés de l'IA Générative
Maîtriser le vocabulaire essentiel
Pour utiliser efficacement les outils Mistral AI et dialoguer avec des équipes techniques, il est indispensable de maîtriser un ensemble de concepts clés. Cette leçon couvre les termes les plus importants que vous rencontrerez régulièrement.
RAG — Retrieval-Augmented Generation
Le RAG (génération augmentée par la récupération) est l’une des techniques les plus utilisées pour améliorer la qualité des réponses d’un LLM. Le principe est simple : au lieu de compter uniquement sur les connaissances internes du modèle, on lui fournit des informations pertinentes extraites d’une base de données externe.
Comment ça fonctionne
- L’utilisateur pose une question
- Un système de recherche identifie les documents pertinents dans une base de connaissances
- Ces documents sont injectés dans le contexte du modèle
- Le modèle génère sa réponse en s’appuyant sur ces informations fraîches
Pourquoi c’est important
Le RAG résout un problème fondamental des LLM : leurs connaissances sont figées à la date de leur entraînement. Avec le RAG, le modèle peut répondre à des questions sur des événements récents, des données internes à votre entreprise, ou des documents spécifiques que vous lui fournissez.
C’est la technique qui sous-tend les fonctionnalités de recherche web de Le Chat et la plupart des chatbots d’entreprise.
Embeddings — Les représentations vectorielles
Les embeddings sont des représentations numériques du texte sous forme de vecteurs (listes de nombres). Chaque mot, phrase ou document est transformé en un point dans un espace mathématique de haute dimension.
L’idée clé
Deux textes sémantiquement proches auront des embeddings proches dans l’espace vectoriel. Par exemple, “chien” et “canidé” auront des embeddings voisins, tandis que “chien” et “tableur” seront éloignés.
Applications pratiques
- Recherche sémantique : trouver des documents par le sens, pas seulement par les mots-clés
- Classification : regrouper automatiquement des textes par thème
- Détection de similitude : identifier les doublons ou les contenus proches
- RAG : sélectionner les documents pertinents pour enrichir le contexte du modèle
Mistral propose des modèles d’embeddings dédiés (Mistral Embed, Codestral Embed) qui transforment votre texte en vecteurs exploitables.
Fine-tuning — L’adaptation sur mesure
Le fine-tuning consiste à poursuivre l’entraînement d’un modèle pré-entraîné avec vos propres données pour l’adapter à un besoin spécifique. C’est comme prendre un médecin généraliste et le former en spécialiste.
Cas d’usage du fine-tuning
- Adapter le ton et le style du modèle à votre marque
- Intégrer un vocabulaire métier spécifique (juridique, médical, financier)
- Améliorer les performances sur une tâche précise (classification d’emails, extraction d’entités)
- Distillation : transférer les connaissances d’un grand modèle vers un petit pour réduire les coûts
Fine-tuning chez Mistral
La plateforme Forge de Mistral permet de fine-tuner les modèles Open. Vous préparez un jeu de données (paires question-réponse), vous lancez l’entraînement, et vous obtenez un modèle personnalisé que vous pouvez déployer via l’API.
Température — Le curseur de créativité
La température est un paramètre qui contrôle le degré de “créativité” (ou aléatoire) dans les réponses du modèle.
Comment ça marche
- Température basse (0 à 0.3) : le modèle choisit les réponses les plus probables. Résultat : réponses prévisibles, précises, reproductibles. Idéal pour les tâches factuelles, l’extraction de données, le code.
- Température moyenne (0.4 à 0.7) : un bon équilibre entre cohérence et variété. Convient à la plupart des usages conversationnels.
- Température haute (0.8 à 1.0) : le modèle explore des réponses moins évidentes. Plus de créativité, mais aussi plus de risques d’erreurs. Utile pour le brainstorming, la rédaction créative.
En pratique
Sur Le Chat, la température est gérée automatiquement. Via l’API, vous pouvez la définir précisément pour chaque requête. C’est un levier puissant pour ajuster le comportement du modèle à votre cas d’usage.
Hallucinations — Quand le modèle invente
Les hallucinations sont des réponses qui semblent plausibles mais sont factuellement incorrectes. Le modèle “invente” des informations avec un ton confiant.
Pourquoi ça arrive
Un LLM prédit des tokens probables, pas des faits vérifiés. Il peut produire des réponses cohérentes sur le plan linguistique mais fausses sur le plan factuel, notamment pour :
- Des dates, chiffres ou statistiques précis
- Des citations attribuées à des personnes réelles
- Des références à des études ou des articles
- Des détails techniques spécifiques
Comment les limiter
- Utilisez le RAG pour ancrer les réponses dans des sources vérifiées
- Baissez la température pour favoriser les réponses les plus probables
- Demandez des sources au modèle et vérifiez-les
- Utilisez le grounding : connecter le modèle à des bases de données ou des API pour ancrer ses réponses dans la réalité
- Ne faites jamais aveuglément confiance à une réponse sur des sujets critiques
Grounding — L’ancrage dans la réalité
Le grounding (ancrage) désigne l’ensemble des techniques qui connectent un modèle à des sources d’information fiables et à jour. Le RAG est une forme de grounding, mais le concept est plus large :
- Recherche web : le modèle accède à Internet pour vérifier des faits
- Connexion à des bases de données : le modèle interroge vos données internes
- Function calling : le modèle appelle des API externes pour obtenir des données en temps réel (météo, cours de bourse, état d’un système)
Le grounding est essentiel pour passer d’un assistant qui “sait des choses” à un assistant qui “peut vérifier des choses”.
Prompt — L’instruction au modèle
Le prompt est le texte que vous envoyez au modèle. C’est votre instruction, votre question, votre demande. La qualité du prompt détermine largement la qualité de la réponse.
On distingue :
- Le system prompt : les instructions générales données au modèle en amont (ton, rôle, contraintes). Configurable via l’API.
- Le user prompt : votre message concret, la question ou la tâche.
- Le few-shot prompting : fournir des exemples de réponses attendues pour guider le modèle.
Points clés à retenir
- Le RAG enrichit les réponses du modèle avec des données externes fraîches
- Les embeddings transforment le texte en vecteurs pour la recherche sémantique
- Le fine-tuning adapte un modèle à vos besoins spécifiques via Forge
- La température contrôle l’équilibre entre précision et créativité
- Les hallucinations sont des réponses plausibles mais fausses — à surveiller systématiquement
- Le grounding ancre le modèle dans des données réelles et vérifiables