Héberger Devstral en Local
Mis à jour le 29 juillet 2026
Pourquoi héberger Devstral localement ?
Devstral appartient à l’Open tier de Mistral AI : ses poids sont publiés en open-source sous licence Apache 2.0. Concrètement, vous pouvez le déployer sur vos propres serveurs sans envoyer une seule ligne de votre code à une API externe — ce qui, pour certaines organisations, fait la différence entre un projet autorisé et un projet refusé.
Les motivations se recoupent souvent. La confidentialité vient en tête : votre code ne quitte jamais votre infrastructure, ce qui coupe court aux discussions sur les conditions d’usage d’un fournisseur. La latence suit, puisqu’aucun aller-retour réseau vers l’API Mistral ne s’intercale entre la frappe et la suggestion. Le coût change de nature : vous payez un GPU à prix fixe au lieu d’une facturation à l’usage, ce qui devient avantageux dès qu’une équipe entière sollicite le modèle toute la journée. Viennent enfin la conformité, exigée par certaines réglementations et par des secteurs comme la banque ou la défense, et la disponibilité, puisque plus aucun service tiers ne peut interrompre votre travail.
Le modèle recommandé
Devstral Small 2 (24B-Instruct-2512) est le modèle recommandé pour l’hébergement local. Avec 24 milliards de paramètres, il offre le meilleur rapport performance/ressources de la gamme : assez grand pour un usage agentique sérieux, assez compact pour tenir sur du matériel accessible. Il se télécharge depuis Hugging Face sous l’identifiant mistralai/Devstral-Small-2-24B-Instruct-2512.
Prérequis GPU
Le matériel détermine directement la qualité de l’expérience, et il vaut mieux le choisir avant que la déception ne s’installe.
| Configuration | Matériel | Précision | Contexte | Performance | Coût |
|---|---|---|---|---|---|
| Recommandée | NVIDIA H100 (80 Go) ou A100 (80 Go) | FP8 | jusqu’à ~128k tokens | excellente, comparable à l’API Mistral | serveur dédié ou cloud (environ 2-4 EUR/heure sur les clouds publics) |
| Alternative | NVIDIA RTX 4090 (24 Go VRAM) | 4-bit (quantization) | environ 32k tokens | bonne pour le développement, latence légèrement plus élevée | environ 500-700 EUR pour un PC de bureau ou 0.5-1 EUR/heure en cloud |
| CPU-only | RAM suffisante (64 Go+) | — | — | lente, acceptable pour des tâches ponctuelles | prototypage uniquement, pas pour la production |
La ligne RTX 4090 est celle que rencontrent la plupart des développeurs individuels : la quantification 4-bit fait tenir le modèle dans 24 Go de VRAM au prix d’un contexte réduit à environ 32k tokens, ce qui reste confortable pour un agent qui travaille sur quelques fichiers à la fois. La configuration CPU-only, elle, n’a de sens que pour valider une installation avant d’acheter du matériel.
Déploiement avec vLLM
vLLM est le framework d’inférence recommandé par Mistral AI et le plus performant pour servir des modèles de langage. Son installation ne demande qu’une commande.
pip install vllm
Le serveur se lance ensuite en une ligne, avec les deux options qui rendent le modèle utilisable en mode agent.
vllm serve mistralai/Devstral-Small-2-24B-Instruct-2512 \
--tool-call-parser mistral \
--enable-auto-tool-choice \
--port 8080
Trois variantes couvrent l’essentiel des situations réelles : répartir le modèle sur plusieurs GPU, réduire la précision quand la VRAM manque, ou rogner le contexte pour la même raison.
# Multi-GPU (si vous avez 2+ GPU)
vllm serve mistralai/Devstral-Small-2-24B-Instruct-2512 \
--tool-call-parser mistral \
--enable-auto-tool-choice \
--tensor-parallel-size 2 \
--port 8080
# Précision réduite (pour GPU avec moins de VRAM)
vllm serve mistralai/Devstral-Small-2-24B-Instruct-2512 \
--tool-call-parser mistral \
--enable-auto-tool-choice \
--dtype float16 \
--port 8080
# Contexte réduit (pour économiser la VRAM)
vllm serve mistralai/Devstral-Small-2-24B-Instruct-2512 \
--tool-call-parser mistral \
--enable-auto-tool-choice \
--max-model-len 32768 \
--port 8080
Voici ce que chaque flag contrôle :
--tool-call-parser mistral— active le parsing des appels d’outils au format Mistral--enable-auto-tool-choice— permet au modèle de décider quand appeler un outil--tensor-parallel-size— répartit le modèle sur plusieurs GPU--dtype— contrôle la précision (float16, bfloat16, float32)--max-model-len— limite la taille du contexte pour économiser la VRAM
Les deux premiers méritent une attention particulière : les omettre donne un serveur qui fonctionne parfaitement en conversation et qui échoue silencieusement dès qu’un agent tente d’appeler un outil. C’est la cause la plus fréquente d’un déploiement local jugé « décevant ».
Utiliser le serveur local
Une fois vLLM lancé, le port 8080 expose une API compatible OpenAI. Le SDK Mistral s’y branche en changeant simplement l’URL du serveur, la clé n’ayant plus d’utilité.
from mistralai import Mistral
# Pointer vers le serveur local
client = Mistral(
api_key="dummy", # Pas de clé nécessaire en local
server_url="http://localhost:8080",
)
response = client.chat.complete(
model="mistralai/Devstral-Small-2-24B-Instruct-2512",
messages=[
{"role": "user", "content": "Analyse ce code et propose des améliorations."}
],
)
Le SDK OpenAI fonctionne tout aussi bien, ce qui vous permet de basculer un code existant vers Devstral local sans le réécrire.
from openai import OpenAI
client = OpenAI(
api_key="dummy",
base_url="http://localhost:8080/v1",
)
response = client.chat.completions.create(
model="mistralai/Devstral-Small-2-24B-Instruct-2512",
messages=[
{"role": "user", "content": "Explique ce code."}
],
)
Frameworks alternatifs
vLLM n’est pas la seule voie. Pour les configurations à faible VRAM, llama.cpp propose une quantification plus agressive et se contente d’un fichier GGUF téléchargé.
# Télécharger le modèle quantifié GGUF
# Lancer le serveur
./llama-server -m devstral-small-2-Q4_K_M.gguf --port 8080
Ollama simplifie encore le déploiement pour un développeur seul, avec un ollama run devstral qui gère téléchargement et lancement. LM Studio, enfin, offre une interface graphique pour télécharger et exécuter des modèles localement sans jamais toucher à la ligne de commande — un bon point d’entrée pour un premier essai avant de monter une installation sérieuse.
Connecter Vibe au serveur local
Le dernier maillon consiste à retrouver l’expérience agentique complète décrite à la leçon 8, mais entièrement hors ligne. Lancez le serveur vLLM sur le port 8080, tapez /config dans Vibe, sélectionnez « local » comme modèle : le port 8080 étant utilisé par défaut, il n’y a rien d’autre à renseigner. Vous disposez alors de l’agent, de ses outils et de sa boucle, sans qu’aucune donnée ne sorte de votre machine.
Points clés à retenir
- Devstral Small 2 (24B) est déployable en local grâce à sa licence Apache 2.0
- vLLM est le framework recommandé pour servir le modèle
- Un H100/A100 offre la meilleure expérience ; un RTX 4090 en 4-bit est viable
- Le serveur vLLM expose une API compatible OpenAI, utilisable avec tout SDK
- Les alternatives (llama.cpp, Ollama, LM Studio) conviennent pour des usages plus légers
- Vibe CLI se connecte nativement au serveur local