Aller au contenu principal

Héberger Devstral en Local

Mis à jour le 29 juillet 2026

Pourquoi héberger Devstral localement ?

Devstral appartient à l’Open tier de Mistral AI : ses poids sont publiés en open-source sous licence Apache 2.0. Concrètement, vous pouvez le déployer sur vos propres serveurs sans envoyer une seule ligne de votre code à une API externe — ce qui, pour certaines organisations, fait la différence entre un projet autorisé et un projet refusé.

Les motivations se recoupent souvent. La confidentialité vient en tête : votre code ne quitte jamais votre infrastructure, ce qui coupe court aux discussions sur les conditions d’usage d’un fournisseur. La latence suit, puisqu’aucun aller-retour réseau vers l’API Mistral ne s’intercale entre la frappe et la suggestion. Le coût change de nature : vous payez un GPU à prix fixe au lieu d’une facturation à l’usage, ce qui devient avantageux dès qu’une équipe entière sollicite le modèle toute la journée. Viennent enfin la conformité, exigée par certaines réglementations et par des secteurs comme la banque ou la défense, et la disponibilité, puisque plus aucun service tiers ne peut interrompre votre travail.

Le modèle recommandé

Devstral Small 2 (24B-Instruct-2512) est le modèle recommandé pour l’hébergement local. Avec 24 milliards de paramètres, il offre le meilleur rapport performance/ressources de la gamme : assez grand pour un usage agentique sérieux, assez compact pour tenir sur du matériel accessible. Il se télécharge depuis Hugging Face sous l’identifiant mistralai/Devstral-Small-2-24B-Instruct-2512.

Prérequis GPU

Le matériel détermine directement la qualité de l’expérience, et il vaut mieux le choisir avant que la déception ne s’installe.

ConfigurationMatérielPrécisionContextePerformanceCoût
RecommandéeNVIDIA H100 (80 Go) ou A100 (80 Go)FP8jusqu’à ~128k tokensexcellente, comparable à l’API Mistralserveur dédié ou cloud (environ 2-4 EUR/heure sur les clouds publics)
AlternativeNVIDIA RTX 4090 (24 Go VRAM)4-bit (quantization)environ 32k tokensbonne pour le développement, latence légèrement plus élevéeenviron 500-700 EUR pour un PC de bureau ou 0.5-1 EUR/heure en cloud
CPU-onlyRAM suffisante (64 Go+)lente, acceptable pour des tâches ponctuellesprototypage uniquement, pas pour la production

La ligne RTX 4090 est celle que rencontrent la plupart des développeurs individuels : la quantification 4-bit fait tenir le modèle dans 24 Go de VRAM au prix d’un contexte réduit à environ 32k tokens, ce qui reste confortable pour un agent qui travaille sur quelques fichiers à la fois. La configuration CPU-only, elle, n’a de sens que pour valider une installation avant d’acheter du matériel.

Déploiement avec vLLM

vLLM est le framework d’inférence recommandé par Mistral AI et le plus performant pour servir des modèles de langage. Son installation ne demande qu’une commande.

pip install vllm

Le serveur se lance ensuite en une ligne, avec les deux options qui rendent le modèle utilisable en mode agent.

vllm serve mistralai/Devstral-Small-2-24B-Instruct-2512 \
  --tool-call-parser mistral \
  --enable-auto-tool-choice \
  --port 8080

Trois variantes couvrent l’essentiel des situations réelles : répartir le modèle sur plusieurs GPU, réduire la précision quand la VRAM manque, ou rogner le contexte pour la même raison.

# Multi-GPU (si vous avez 2+ GPU)
vllm serve mistralai/Devstral-Small-2-24B-Instruct-2512 \
  --tool-call-parser mistral \
  --enable-auto-tool-choice \
  --tensor-parallel-size 2 \
  --port 8080

# Précision réduite (pour GPU avec moins de VRAM)
vllm serve mistralai/Devstral-Small-2-24B-Instruct-2512 \
  --tool-call-parser mistral \
  --enable-auto-tool-choice \
  --dtype float16 \
  --port 8080

# Contexte réduit (pour économiser la VRAM)
vllm serve mistralai/Devstral-Small-2-24B-Instruct-2512 \
  --tool-call-parser mistral \
  --enable-auto-tool-choice \
  --max-model-len 32768 \
  --port 8080

Voici ce que chaque flag contrôle :

  • --tool-call-parser mistral — active le parsing des appels d’outils au format Mistral
  • --enable-auto-tool-choice — permet au modèle de décider quand appeler un outil
  • --tensor-parallel-size — répartit le modèle sur plusieurs GPU
  • --dtype — contrôle la précision (float16, bfloat16, float32)
  • --max-model-len — limite la taille du contexte pour économiser la VRAM

Les deux premiers méritent une attention particulière : les omettre donne un serveur qui fonctionne parfaitement en conversation et qui échoue silencieusement dès qu’un agent tente d’appeler un outil. C’est la cause la plus fréquente d’un déploiement local jugé « décevant ».

Utiliser le serveur local

Une fois vLLM lancé, le port 8080 expose une API compatible OpenAI. Le SDK Mistral s’y branche en changeant simplement l’URL du serveur, la clé n’ayant plus d’utilité.

from mistralai import Mistral

# Pointer vers le serveur local
client = Mistral(
    api_key="dummy",  # Pas de clé nécessaire en local
    server_url="http://localhost:8080",
)

response = client.chat.complete(
    model="mistralai/Devstral-Small-2-24B-Instruct-2512",
    messages=[
        {"role": "user", "content": "Analyse ce code et propose des améliorations."}
    ],
)

Le SDK OpenAI fonctionne tout aussi bien, ce qui vous permet de basculer un code existant vers Devstral local sans le réécrire.

from openai import OpenAI

client = OpenAI(
    api_key="dummy",
    base_url="http://localhost:8080/v1",
)

response = client.chat.completions.create(
    model="mistralai/Devstral-Small-2-24B-Instruct-2512",
    messages=[
        {"role": "user", "content": "Explique ce code."}
    ],
)

Frameworks alternatifs

vLLM n’est pas la seule voie. Pour les configurations à faible VRAM, llama.cpp propose une quantification plus agressive et se contente d’un fichier GGUF téléchargé.

# Télécharger le modèle quantifié GGUF
# Lancer le serveur
./llama-server -m devstral-small-2-Q4_K_M.gguf --port 8080

Ollama simplifie encore le déploiement pour un développeur seul, avec un ollama run devstral qui gère téléchargement et lancement. LM Studio, enfin, offre une interface graphique pour télécharger et exécuter des modèles localement sans jamais toucher à la ligne de commande — un bon point d’entrée pour un premier essai avant de monter une installation sérieuse.

Connecter Vibe au serveur local

Le dernier maillon consiste à retrouver l’expérience agentique complète décrite à la leçon 8, mais entièrement hors ligne. Lancez le serveur vLLM sur le port 8080, tapez /config dans Vibe, sélectionnez « local » comme modèle : le port 8080 étant utilisé par défaut, il n’y a rien d’autre à renseigner. Vous disposez alors de l’agent, de ses outils et de sa boucle, sans qu’aucune donnée ne sorte de votre machine.

Points clés à retenir

  • Devstral Small 2 (24B) est déployable en local grâce à sa licence Apache 2.0
  • vLLM est le framework recommandé pour servir le modèle
  • Un H100/A100 offre la meilleure expérience ; un RTX 4090 en 4-bit est viable
  • Le serveur vLLM expose une API compatible OpenAI, utilisable avec tout SDK
  • Les alternatives (llama.cpp, Ollama, LM Studio) conviennent pour des usages plus légers
  • Vibe CLI se connecte nativement au serveur local