Reasoning effort : low, medium et high
Contrôler la profondeur de réflexion
Le paramètre reasoning_effort vous permet de calibrer la quantité de réflexion que le modèle investit dans sa réponse. C’est un levier direct sur le compromis entre qualité de raisonnement, vitesse de réponse et consommation de tokens.
Le comportement de ce paramètre diffère selon l’API utilisée :
- Chat Completions (grok-3-mini) : paramètre
reasoning_effortdans le corps de la requête, valeurslowethigh - API Responses (grok-4.20-reasoning) : paramètre
reasoning.effortdans l’objetreasoning, valeurslow,mediumethigh
Chat Completions : grok-3-mini
Sur grok-3-mini via Chat Completions, reasoning_effort est un paramètre de premier niveau :
{
"model": "grok-3-mini",
"reasoning_effort": "low",
"messages": [
{
"role": "user",
"content": "Quel est le plus grand nombre premier inférieur à 100 ?"
}
]
}
Deux valeurs sont disponibles :
low: réflexion minimale. Le modèle identifie rapidement la réponse sans développer un raisonnement détaillé. Lereasoning_contentsera court.high: réflexion approfondie. Le modèle développe chaque étape de son raisonnement. Lereasoning_contentsera substantiel.
API Responses : grok-4.20-reasoning
Sur l’API Responses, le contrôle du raisonnement passe par un objet reasoning dédié :
{
"model": "grok-4.20-reasoning",
"input": "Résolvez le système d'équations : 3x + 2y = 12, x - y = 1",
"reasoning": {
"effort": "medium"
}
}
Trois niveaux sont disponibles :
Low
Le modèle consacre un effort minimal au raisonnement. Adapté aux tâches où la réponse est relativement directe mais où vous souhaitez tout de même bénéficier des capacités du modèle de raisonnement.
Medium
Un niveau intermédiaire qui offre un bon équilibre. Le modèle développe un raisonnement structuré sans aller dans les détails les plus fins. C’est souvent le meilleur choix par défaut.
High
Le modèle investit le maximum d’effort dans sa réflexion. Recommandé pour les problèmes complexes qui nécessitent une chaîne de raisonnement longue et rigoureuse.
Impact sur les tokens
Le niveau d’effort a un impact direct sur la consommation de tokens de raisonnement :
low: peu de tokens de raisonnement, réponse rapide, coût faiblemedium: consommation modérée, bon compromishigh: nombreux tokens de raisonnement, réponse plus lente, coût élevé
Ces tokens de raisonnement sont facturés comme des tokens de sortie (voir leçon 8). Avec max_completion_tokens, vous pouvez plafonner la consommation totale (sortie + raisonnement), mais un plafond trop bas avec un effort high peut tronquer la réponse.
Choisir le bon niveau
| Tâche | Effort recommandé |
|---|---|
| Classification de texte | low |
| Résumé avec analyse | medium |
| Extraction d’entités structurées | low |
| Résolution d’équations | high |
| Analyse de bug dans du code | high |
| Reformulation de texte | low |
| Comparaison d’options avec pour/contre | medium |
| Preuve mathématique | high |
Exemple pratique : même question, trois efforts
for effort in ["low", "medium", "high"]:
response = client.responses.create(
model="grok-4.20-reasoning",
input="Expliquez pourquoi 0.1 + 0.2 != 0.3 en informatique.",
reasoning={"effort": effort}
)
print(f"Effort {effort}: {response.usage.completion_tokens} tokens")
Vous observerez typiquement un ratio de 1:3:8 entre les trois niveaux pour ce type de question technique.
Points clés à retenir
- Grok-3-mini (Chat Completions) :
reasoning_effortaveclowouhigh - Grok-4.20-reasoning (Responses) :
reasoning.effortaveclow,mediumouhigh - Le niveau d’effort impacte directement le nombre de tokens de raisonnement et donc le coût
mediumest le meilleur choix par défaut pour la plupart des tâches- Adaptez l’effort à la complexité réelle de la tâche pour optimiser vos coûts