Aller au contenu principal

Reasoning effort : low, medium et high

Contrôler la profondeur de réflexion

Le paramètre reasoning_effort vous permet de calibrer la quantité de réflexion que le modèle investit dans sa réponse. C’est un levier direct sur le compromis entre qualité de raisonnement, vitesse de réponse et consommation de tokens.

Le comportement de ce paramètre diffère selon l’API utilisée :

  • Chat Completions (grok-3-mini) : paramètre reasoning_effort dans le corps de la requête, valeurs low et high
  • API Responses (grok-4.20-reasoning) : paramètre reasoning.effort dans l’objet reasoning, valeurs low, medium et high

Chat Completions : grok-3-mini

Sur grok-3-mini via Chat Completions, reasoning_effort est un paramètre de premier niveau :

{
  "model": "grok-3-mini",
  "reasoning_effort": "low",
  "messages": [
    {
      "role": "user",
      "content": "Quel est le plus grand nombre premier inférieur à 100 ?"
    }
  ]
}

Deux valeurs sont disponibles :

  • low : réflexion minimale. Le modèle identifie rapidement la réponse sans développer un raisonnement détaillé. Le reasoning_content sera court.
  • high : réflexion approfondie. Le modèle développe chaque étape de son raisonnement. Le reasoning_content sera substantiel.

API Responses : grok-4.20-reasoning

Sur l’API Responses, le contrôle du raisonnement passe par un objet reasoning dédié :

{
  "model": "grok-4.20-reasoning",
  "input": "Résolvez le système d'équations : 3x + 2y = 12, x - y = 1",
  "reasoning": {
    "effort": "medium"
  }
}

Trois niveaux sont disponibles :

Low

Le modèle consacre un effort minimal au raisonnement. Adapté aux tâches où la réponse est relativement directe mais où vous souhaitez tout de même bénéficier des capacités du modèle de raisonnement.

Medium

Un niveau intermédiaire qui offre un bon équilibre. Le modèle développe un raisonnement structuré sans aller dans les détails les plus fins. C’est souvent le meilleur choix par défaut.

High

Le modèle investit le maximum d’effort dans sa réflexion. Recommandé pour les problèmes complexes qui nécessitent une chaîne de raisonnement longue et rigoureuse.

Impact sur les tokens

Le niveau d’effort a un impact direct sur la consommation de tokens de raisonnement :

  • low : peu de tokens de raisonnement, réponse rapide, coût faible
  • medium : consommation modérée, bon compromis
  • high : nombreux tokens de raisonnement, réponse plus lente, coût élevé

Ces tokens de raisonnement sont facturés comme des tokens de sortie (voir leçon 8). Avec max_completion_tokens, vous pouvez plafonner la consommation totale (sortie + raisonnement), mais un plafond trop bas avec un effort high peut tronquer la réponse.

Choisir le bon niveau

TâcheEffort recommandé
Classification de textelow
Résumé avec analysemedium
Extraction d’entités structuréeslow
Résolution d’équationshigh
Analyse de bug dans du codehigh
Reformulation de textelow
Comparaison d’options avec pour/contremedium
Preuve mathématiquehigh

Exemple pratique : même question, trois efforts

for effort in ["low", "medium", "high"]:
    response = client.responses.create(
        model="grok-4.20-reasoning",
        input="Expliquez pourquoi 0.1 + 0.2 != 0.3 en informatique.",
        reasoning={"effort": effort}
    )
    print(f"Effort {effort}: {response.usage.completion_tokens} tokens")

Vous observerez typiquement un ratio de 1:3:8 entre les trois niveaux pour ce type de question technique.

Points clés à retenir

  • Grok-3-mini (Chat Completions) : reasoning_effort avec low ou high
  • Grok-4.20-reasoning (Responses) : reasoning.effort avec low, medium ou high
  • Le niveau d’effort impacte directement le nombre de tokens de raisonnement et donc le coût
  • medium est le meilleur choix par défaut pour la plupart des tâches
  • Adaptez l’effort à la complexité réelle de la tâche pour optimiser vos coûts