Réutiliser le raisonnement dans les requêtes suivantes
Le cache de pensée
L’une des fonctionnalités les plus puissantes du système de raisonnement chiffré de xAI est la possibilité de réinjecter le raisonnement d’une requête précédente dans une nouvelle requête. Ce mécanisme, comparable à un “cache de pensée”, permet au modèle de reprendre son raisonnement là où il s’était arrêté.
Principe de fonctionnement
Le flux complet se décompose en trois étapes :
- Requête initiale : vous envoyez une question avec
include=["reasoning.encrypted_content"] - Stockage : vous conservez le contenu chiffré retourné dans la réponse
- Requête suivante : vous réinjectez ce contenu chiffré dans la nouvelle requête
Le modèle reconnaît le raisonnement chiffré et l’utilise comme contexte pour sa nouvelle réflexion. Il ne repart pas de zéro : il dispose de la “mémoire” de sa réflexion précédente.
Implémentation pas à pas
Étape 1 : requête initiale avec récupération du raisonnement
from openai import OpenAI
client = OpenAI(
api_key="votre-cle-api",
base_url="https://api.x.ai/v1"
)
# Première requête
response_1 = client.responses.create(
model="grok-4.20-reasoning",
input="Expliquez le théorème de Bayes et donnez un exemple médical.",
include=["reasoning.encrypted_content"]
)
# Extraire le raisonnement chiffré
encrypted_reasoning = None
for item in response_1.output:
if item.type == "reasoning":
encrypted_reasoning = item.encrypted_content
Étape 2 : requête suivante avec réinjection
# Deuxième requête qui bénéficie du raisonnement précédent
response_2 = client.responses.create(
model="grok-4.20-reasoning",
input=[
# Réinjecter le raisonnement chiffré de la requête précédente
{
"type": "reasoning",
"encrypted_content": encrypted_reasoning
},
# Nouveau message
{
"type": "message",
"role": "user",
"content": "Maintenant, appliquez ce théorème à un test COVID avec sensibilité 95% et spécificité 99%."
}
],
include=["reasoning.encrypted_content"]
)
Avantages du cache de pensée
Continuité du raisonnement
Le modèle n’a pas besoin de reconstruire tout le contexte de réflexion. S’il a déjà raisonné sur le théorème de Bayes, il peut directement l’appliquer au nouveau problème sans recommencer la démonstration.
Économie de tokens
En réutilisant le raisonnement chiffré, vous évitez au modèle de re-générer des tokens de raisonnement pour la partie déjà traitée. Sur des conversations longues, l’économie peut être significative.
Cohérence
Le modèle maintient une cohérence entre ses réponses successives. Il ne risque pas de se contredire puisqu’il dispose de la trace de sa propre réflexion.
Contraintes et limites
- Même modèle : le raisonnement chiffré d’un modèle ne peut pas être réutilisé par un autre modèle. Un raisonnement produit par grok-4 ne fonctionnera pas avec grok-4.20-reasoning.
- Taille : le contenu chiffré peut être volumineux. Surveillez la taille de vos requêtes.
- Expiration : le contenu chiffré peut avoir une durée de validité limitée. Ne stockez pas indéfiniment sans vérifier.
- Pas de modification : vous ne pouvez pas altérer le contenu chiffré. Toute modification le rend invalide.
Cas d’usage en production
Conversations multi-tours complexes
Pour un chatbot qui résout des problèmes mathématiques en plusieurs échanges, le cache de pensée permet de maintenir le fil du raisonnement sans avoir à tout re-envoyer en contexte.
Pipeline de validation
Un pipeline qui analyse du code en plusieurs passes peut réutiliser le raisonnement de la première passe (identification des problèmes) pour la seconde passe (proposition de corrections).
Tuteur interactif
Un système de tutorat peut stocker le raisonnement du modèle sur l’explication d’un concept, puis le réutiliser quand l’étudiant pose des questions de suivi.
Points clés à retenir
- Le raisonnement chiffré peut être réinjecté dans les requêtes suivantes via le champ
input - Ce mécanisme maintient la continuité du raisonnement sans re-générer les tokens
- Le raisonnement chiffré est lié au modèle qui l’a produit
- Ne modifiez jamais le contenu chiffré : il deviendrait invalide
- Utile pour les conversations multi-tours, les pipelines et les systèmes interactifs