Contrôler l'effort de raisonnement : de none à ultra
Mis à jour le 29 juillet 2026
Doser la réflexion pour chaque tâche
Depuis la famille GPT-5.6, en disponibilité générale le 9 juillet 2026, le raisonnement n’est plus une affaire de modèle séparé : c’est un réglage par requête, disponible sur Sol, Terra et Luna. La génération précédente vous faisait choisir entre un modèle rapide — GPT-5.3, GPT-5.4 — et un modèle de raisonnement — o3, o4-mini. Désormais vous choisissez un modèle, puis vous dosez sa réflexion. Cette leçon vous montre comment optimiser ce réglage situation par situation.
Ce que le réglage contrôle réellement
Le niveau de raisonnement pilote la quantité de « pensée » que le modèle investit avant de répondre. Cette quantité se traduit par quatre effets solidaires : le nombre de tokens de raisonnement utilisés, le temps de réponse, la profondeur d’analyse et la consommation de quota — ou le coût, via l’API. Vous ne pouvez pas en augmenter un sans augmenter les autres : le réglage est un arbitrage, pas un curseur de qualité.
Les six niveaux
Le réglage accepte six valeurs : none, low, medium, high, xhigh, max.
| Niveau | Usages typiques | Temps de réponse |
|---|---|---|
none | Questions factuelles simples, reformulations, traductions courtes ; conversations où la latence prime ; tâches de volume où chaque token compte | Quasi immédiat |
low | Questions techniques simples qui bénéficient d’un peu de raisonnement, classifications ou catégorisations, vérifications rapides | Quelques secondes |
medium | Analyses de données standard, problèmes à 2-3 étapes, résolution de problèmes techniques courants | De quelques secondes à une minute environ |
high | Problèmes mathématiques avancés, analyses stratégiques à nombreuses variables, débogage de cas obscurs | Plusieurs minutes possibles |
xhigh et max | Raisonnement sur des systèmes complexes, preuves, optimisations sous contraintes multiples ; travaux où vous préférez attendre longtemps plutôt que vérifier vous-même | Long — lancez la requête et faites autre chose |
Le niveau medium mérite un mot : c’est le point de départ recommandé pour la plupart des tâches sérieuses, celui vers lequel revenir quand vous ne savez pas trancher. Les deux niveaux supérieurs, xhigh et max, poussent la vérification interne encore plus loin ; réservez-les aux cas où l’erreur coûte cher.
Le réglage ultra : plusieurs agents en parallèle
Annoncé le 9 juillet 2026, ultra est un réglage supplémentaire au-dessus de l’échelle standard. Au lieu d’une chaîne de pensée unique, le modèle coordonne 4 agents en parallèle par défaut — jusqu’à 16 sur certaines évaluations — pour attaquer le même problème sous plusieurs angles. Il est destiné aux tâches les plus lourdes et sa consommation de tokens est nettement supérieure à celle de max. À utiliser exceptionnellement, jamais par défaut.
Ajuster l’effort en pratique
ChatGPT propose un réglage du niveau de réflexion associé au choix du modèle. Sa présentation exacte évolue avec l’interface, mais le principe reste celui de l’API : vous pouvez le modifier à chaque message. La bonne pratique consiste à commencer avec medium et à n’augmenter que si le résultat est insatisfaisant.
Avec la Responses API, le niveau de raisonnement se passe en paramètre de chaque requête, sur n’importe quel modèle GPT-5.6 :
reasoning effort : "none" | "low" | "medium" | "high" | "xhigh" | "max"
Ce paramètre prend toute sa valeur dans les applications qui traitent des volumes : vous ajustez l’effort par type de tâche pour optimiser les coûts, sans changer de modèle. Consultez la page officielle des modèles pour la syntaxe exacte et les valeurs disponibles par modèle.
L’impact sur les coûts
Plus le niveau est élevé, plus le modèle consomme de tokens de raisonnement avant de produire sa réponse, et cette consommation croît vite dans les niveaux supérieurs — ultra étant de loin le plus gourmand. Sur un plan Plus ou Pro, cela se traduit par le nombre de requêtes exigeantes que vous pouvez envoyer par période ; via l’API, directement par la facture.
Trois stratégies d’optimisation
La première est la technique de l’escalade, qui consiste à ne jamais commencer haut. Posez d’abord la question en low, ou none pour les tâches triviales. Si la réponse est incomplète ou incorrecte, réessayez en medium. Passez à high uniquement quand les deux premiers niveaux ont échoué, et réservez xhigh, max et ultra aux problèmes qui le justifient vraiment. Cette gradation vous coûte quelques secondes et vous épargne des quotas entiers.
La deuxième est le triage par type de tâche, à transformer en habitude mentale : reformulations et questions factuelles en none, calculs simples et classifications en low, analyses, comparaisons et diagnostics en medium, optimisation, preuves et systèmes complexes en high et au-delà.
La troisième consiste à associer le bon modèle au bon niveau, puisque les deux dimensions se combinent. Sol en high, xhigh ou max remplace ce que faisaient o3 et o3-pro dans la génération précédente. Terra en medium couvre ce que faisait o4-mini, et avec lui la majorité des tâches quotidiennes. Luna en low ou medium traite les volumes à moindre coût.
Mise en pratique
Prenez la question suivante et posez-la trois fois, en low, medium puis high, en comparant la profondeur d’analyse à chaque niveau.
« Une entreprise a 5 projets en cours. Chaque projet a un budget, un ROI estimé et un risque. Voici les données : [Projet A : 100k€, ROI 3.2x, risque moyen], [Projet B : 250k€, ROI 1.8x, risque faible], [Projet C : 50k€, ROI 5.1x, risque élevé], [Projet D : 150k€, ROI 2.4x, risque moyen], [Projet E : 75k€, ROI 4.0x, risque élevé]. Le budget total disponible est de 400k€. Quels projets financer pour maximiser le ROI ajusté du risque ? »
L’exercice vous montre où se situe, pour ce type de question, le point à partir duquel monter l’effort n’apporte plus grand-chose. Les débutants se trompent presque toujours de manière symétrique : les uns utilisent l’effort maximal en permanence et épuisent leurs quotas sans gain proportionnel, les autres restent au minimum et récoltent des raisonnements superficiels sur des problèmes qui exigeaient mieux. Deux erreurs plus discrètes complètent le tableau — ne pas adapter le réglage en cours de conversation, alors qu’il est modifiable à chaque message, et dégainer ultra par curiosité, dont la consommation nettement supérieure ne se justifie que sur les tâches qui saturent réellement max. N’oubliez pas non plus le temps : un effort élevé peut dépasser ce que vous êtes prêt à attendre.
Points clés à retenir
- Le raisonnement est un réglage par requête sur chaque modèle GPT-5.6 : none, low, medium, high, xhigh, max — plus de modèles de raisonnement séparés
ultracoordonne plusieurs agents en parallèle pour les tâches les plus lourdes, avec une consommation nettement supérieure- Commencez par
mediumet ajustez selon les résultats (technique de l’escalade) - Le niveau se combine avec le modèle : Sol pour les hauts niveaux, Terra pour le quotidien, Luna pour le volume
- L’effort a un impact direct sur le temps de réponse et la consommation de quota ou le coût API