Réduire la Latence avec les Predicted Outputs
Mis à jour le 29 juillet 2026
Le problème de la latence en production
En production, chaque milliseconde compte. Lorsqu’un utilisateur attend la réponse d’un LLM pour une modification mineure de code ou de texte, la latence standard de génération token par token peut sembler disproportionnée. Si 90 % de la sortie attendue est déjà connue, pourquoi le modèle devrait-il la régénérer intégralement ?
Les Predicted Outputs (sorties prédites) résolvent ce problème. En fournissant au modèle une prédiction de ce que sera la sortie, vous lui permettez d’allouer ses ressources de calcul uniquement sur les parties qui diffèrent réellement, réduisant drastiquement le temps de réponse.
Le concept : prédire pour accélérer
Le principe est simple. Vous connaissez déjà une grande partie de la réponse attendue — par exemple, un fichier de code existant que vous voulez modifier légèrement. Au lieu de laisser le modèle tout régénérer, vous lui passez le contenu prévu via le paramètre prediction :
response = client.chat.complete(
model="mistral-large-latest",
messages=[...],
prediction={
"type": "content",
"content": contenu_attendu
}
)
Le modèle utilise alors ce contenu comme base. Il consacre ses ressources de calcul aux tokens qui diffèrent de la prédiction, ce qui accélère significativement la génération.
Comment ça fonctionne techniquement
Le mécanisme repose sur une validation accélérée plutôt que sur une génération raccourcie. Le modèle reçoit votre prédiction comme matériau de travail, puis avance dans sa génération en la comparant au contenu prédit. Chaque fois que le token qu’il s’apprête à produire coïncide avec celui de la prédiction, la validation est quasi instantanée — le calcul complet de génération n’a pas lieu. Dès que sa sortie s’écarte de la prédiction, il reprend la génération normale, token par token, jusqu’à retrouver éventuellement le fil du contenu prédit.
La conséquence pratique est double. D’une part, la qualité de la réponse est strictement préservée : le modèle ne « copie » pas votre prédiction, il la valide ou s’en écarte selon son propre jugement. D’autre part, le gain de temps est proportionnel au taux de recouvrement — une prédiction juste à 90 % accélère beaucoup, une prédiction juste à 40 % n’apporte presque rien.
Modèles compatibles
En avril 2026, deux modèles supportent les Predicted Outputs : mistral-large-latest pour les tâches complexes d’édition et de raisonnement, et codestral-latest, optimisé pour l’édition de code. C’est ce second cas qui concentre l’essentiel des usages réels, car l’édition de code est le terrain idéal de la prédiction.
Quand utiliser les Predicted Outputs
Le critère tient en une question : connaissez-vous déjà l’essentiel de la sortie ? Quand vous demandez à Codestral de renommer une variable dans un fichier de 400 lignes, la réponse attendue est ce même fichier, à quelques occurrences près — passez le fichier d’origine en prédiction et la génération devient presque instantanée. Le raisonnement vaut pour la correction d’une phrase dans un document long, le remplissage d’un template dont la structure est fixe, ou la modification d’une clé dans un fichier JSON volumineux : dans tous ces cas, plus de 90 % de la sortie est connue d’avance, et c’est précisément ce que la prédiction exploite.
À l’inverse, la fonctionnalité perd tout intérêt quand la sortie est imprévisible — une réponse créative, un brainstorming, une synthèse libre. Si le contenu réel s’écarte de la prédiction sur plus de la moitié des tokens, le gain s’évapore, et le modèle passe son temps à constater les divergences. Notez enfin une incompatibilité technique : les Predicted Outputs ne fonctionnent pas avec le paramètre n (générations multiples).
Impact sur le pricing
Bonne nouvelle : les Predicted Outputs n’ont aucun impact sur le pricing. Vous ne payez pas plus cher pour fournir une prédiction. Vous payez uniquement les tokens effectivement générés, comme d’habitude.
Points clés à retenir
- Les Predicted Outputs réduisent la latence en exploitant du contenu prévisible
- Le paramètre
predictionfournit au modèle la sortie attendue comme base - Deux modèles compatibles :
mistral-large-latestetcodestral-latest - Idéal pour l’édition de code, la modification de texte et les templates
- Aucun surcoût tarifaire — la qualité est préservée