Aller au contenu principal

Processus Forge

Mis à jour le 28 juillet 2026

De l’évaluation au déploiement : le parcours complet

Un projet Forge suit quatre phases, accompagné par un Field Deployment Engineer (FDE) de Mistral. Vous ne configurez rien seul depuis une console : le projet est un engagement conjoint entre votre organisation et Mistral AI, avec des jalons définis, des livrables mesurables et un calendrier prévisible : 2 à 4 semaines d’évaluation, 4 à 8 semaines de préparation des données, 4 à 6 semaines d’entraînement et d’itération, 2 à 4 semaines de déploiement et de mise sous monitoring, soit 3 à 6 mois selon la complexité du cas d’usage et la qualité des données. Connaître ce séquencement à l’avance vous évitera de promettre un résultat en six semaines à votre direction.

Phase 1 : évaluation (2 à 4 semaines)

L’objectif est de déterminer si Forge est la bonne approche et de fixer les critères de succès. L’équipe Mistral travaille avec votre sponsor métier et votre équipe technique sur quatre chantiers. L’audit du cas d’usage commence par les questions les plus simples et les plus dérangeantes : quel problème résolvez-vous exactement, le prompt engineering et le RAG ont-ils vraiment été testés, et pourquoi ne suffisent-ils pas ? L’évaluation des données mesure le volume disponible et son état réel — structuré ou non, annoté ou non, à jour ou périmé.

Vient la mesure de la baseline, étape que beaucoup sautent et regrettent ensuite : on évalue les performances du modèle généraliste sur les tâches cibles, faute de quoi rien ne permettra de quantifier ce que Forge a apporté. La phase se conclut par la définition des KPI — précision, rappel, temps de traitement, satisfaction utilisateur.

Le livrable est un document de cadrage réunissant la définition du cas d’usage, l’inventaire des données, la baseline, les KPI cibles et le planning prévisionnel. Un go/no-go conjoint le sanctionne : si les données sont insuffisantes ou si le cas d’usage ne justifie pas Forge, l’équipe Mistral vous réorientera vers le RAG ou le prompt engineering. Un refus à ce stade vous économise plusieurs mois de travail et un budget conséquent.

Phase 2 : préparation des données (4 à 8 semaines)

Cette phase constitue le jeu de données d’entraînement. C’est la plus critique et la plus chronophage, la qualité du modèle dépendant directement de celle des données qui l’ont formé. Le travail commence par la collecte : extraction des documents, des exemples et des cas d’usage depuis vos systèmes internes. Suit le nettoyage — suppression des doublons, des documents obsolètes et des données corrompues —, puis la structuration, qui transforme les données brutes en paires instruction-réponse exploitables par l’entraînement. Lorsque le cas d’usage l’exige, une annotation par vos experts métiers ajoute labels, catégories ou métadonnées. Une validation finale par ces mêmes experts vérifie que le corpus reflète les pratiques réelles et le niveau de qualité attendu.

Actez la répartition des rôles par écrit dès le départ : votre équipe data prend en charge la collecte, le nettoyage et la structuration ; vos experts métiers assurent l’annotation et la validation ; le FDE Mistral apporte l’accompagnement méthodologique, valide le format et formule ses recommandations sur le volume et la qualité.

Quatre écueils reviennent systématiquement. Un corpus qui surreprésente certains cas produit un modèle biaisé dans les mêmes proportions. Des documents obsolètes engendrent un modèle qui répond avec assurance selon des procédures périmées, plus dangereux qu’une absence de réponse. Quelques centaines d’exemples ne suffisent jamais à un fine-tuning de qualité. Enfin, si vous devez arbitrer, choisissez un corpus plus petit mais homogène plutôt qu’un corpus massif de qualité inégale.

Phase 3 : entraînement et itération (4 à 6 semaines)

Le modèle de base est fine-tuné sur votre jeu de données, puis évalué sur un jeu de validation composé de données qu’il n’a jamais vues pendant l’entraînement. Les résultats sont comparés à la baseline et aux KPI cibles définis en phase 1, et chaque écart déclenche une itération : ajustement des hyperparamètres, enrichissement du jeu de données, correction des erreurs identifiées. En parallèle, vos experts conduisent la validation métier en confrontant le modèle à des cas réels — un modèle qui satisfait les métriques mais échoue sur les dossiers du quotidien n’est pas prêt.

En pratique, 2 à 4 itérations de 1 à 2 semaines chacune sont nécessaires pour atteindre le niveau visé. Tout le volet technique est porté par le FDE : configuration de l’entraînement, optimisation des hyperparamètres, diagnostic des problèmes de performance, recommandations pour améliorer les données. Votre équipe n’a pas besoin de compétences en machine learning ; le FDE est votre interface technique avec la plateforme Forge.

Phase 4 : déploiement et monitoring (2 à 4 semaines)

Le modèle personnalisé est déployé sur l’infrastructure cible — cloud Mistral, VPC dédié ou on-premise — puis intégré à votre environnement via Le Chat Enterprise, Enterprise Search ou vos applications internes par API. Des tests de charge valident les performances en conditions de production, une formation prépare les utilisateurs finaux à un modèle qui ne se comporte pas exactement comme un généraliste, et des tableaux de bord suivent la performance, les volumes et la satisfaction.

Ce monitoring alimente directement le pilotage : il détecte une dégradation progressive de la performance, des cas d’usage que personne n’avait anticipés, et les signaux qui appellent un réentraînement, comme l’arrivée de nouvelles données ou l’évolution des procédures. Un modèle Forge n’est pas figé — prévoyez un cycle trimestriel pour les domaines qui évoluent régulièrement, semestriel pour les domaines stables, et à la demande lors des changements majeurs : nouvelle réglementation, fusion, lancement de produit.

Budget et ressources à provisionner

Côté Mistral, l’engagement porte sur un FDE dédié pendant toute la durée du projet, l’infrastructure d’entraînement (GPU) et le support technique et méthodologique. De votre côté, réservez du temps de sponsor métier à hauteur de 10 à 20 % de son agenda, une équipe data d’une à deux personnes à temps partiel pendant la phase 2, quelques heures hebdomadaires d’experts métiers pour la validation, et un budget projet variable selon la complexité, à cadrer lors de la phase d’évaluation. Provisionnez réellement ces charges : un projet dont le sponsor n’a pas dégagé ce temps s’enlise en phase 2.

Points clés à retenir

  • Le processus Forge dure 3 à 6 mois en quatre phases : évaluation, données, entraînement, déploiement
  • La phase de préparation des données est la plus critique — la qualité des données détermine la qualité du modèle
  • Un FDE Mistral vous accompagne de bout en bout — votre équipe n’a pas besoin de compétences en machine learning
  • Prévoyez un cycle de réentraînement pour maintenir la performance dans le temps