Aller au contenu principal

Grok 4.5 : le modèle phare

Mis à jour le 30 juillet 2026

Le sommet de la gamme Grok

Annoncé le 16 juillet 2026 et déployé sur iOS, Android, le web et X une semaine plus tard, Grok 4.5 est le modèle le plus capable de xAI. Il succède à la génération 4.20 en tête de gamme et apporte un changement d’approche majeur : là où 4.20 proposait deux modèles distincts — l’un qui raisonne, l’autre non —, Grok 4.5 propose un raisonnement configurable dans un modèle unique.

Que vous construisiez un agent complexe, analysiez des documents volumineux ou résolviez des problèmes mathématiques, c’est le modèle vers lequel se tourner quand la qualité de la réponse prime sur le coût.

500k
Tokens de contexte
$2.00
Par M tokens (entrée)
$6.00
Par M tokens (sortie)
90%
Réduction cache

Le raisonnement configurable

C’est la nouveauté structurante de Grok 4.5 : vous ne choisissez plus entre deux modèles, vous réglez un curseur. Le paramètre d’effort de raisonnement détermine combien le modèle réfléchit avant de répondre — de la réponse directe à l’analyse approfondie — pour une même requête et un même identifiant de modèle.

Le bénéfice est autant architectural qu’économique : une seule intégration couvre les tâches simples et les tâches difficiles, et l’arbitrage coût/qualité se fait requête par requête plutôt que par un routage entre deux modèles. Sur une tâche de classification, l’effort minimal répond vite et pour trois fois rien ; sur une démonstration mathématique, l’effort maximal mobilise toute la profondeur du modèle.

La génération précédente conserve, elle, ses deux variantes séparées — grok-4.20-0309-reasoning et grok-4.20-0309-non-reasoning — toujours disponibles au catalogue. La leçon consacrée au reasoning revient en détail sur ce choix d’architecture et sur la manière de migrer d’un modèle à l’autre.

Le raisonnement chiffré en pratique

Le raisonnement de Grok est dit « chiffré » : contrairement à d’autres fournisseurs qui affichent la chaîne de pensée en clair, xAI garde les réflexions internes confidentielles. Vous pouvez toutefois récupérer une version chiffrée via le paramètre include :

response = client.responses.create(
    model="grok-4.5",
    input="Démontrez que la racine carrée de 2 est irrationnelle",
    include=["reasoning.encrypted_content"]
)

Ce contenu chiffré peut être réinjecté dans les requêtes suivantes pour que le modèle reprenne le fil de son raisonnement — une sorte de « cache de pensée » qui permet des conversations cohérentes sur des sujets complexes, sans jamais exposer les étapes intermédiaires.

Les tokens de raisonnement

Les tokens consommés par le processus de raisonnement sont comptabilisés séparément dans la réponse API :

{
  "usage": {
    "completion_tokens_details": {
      "reasoning_tokens": 1250
    }
  }
}

Ces tokens sont facturés au même tarif que les tokens de sortie — $6.00 par million pour Grok 4.5 sous le palier de 200 000 tokens de contexte. Sur une requête complexe, le raisonnement peut représenter une part significative du coût total : c’est précisément ce que le réglage d’effort permet de piloter.

Le paramètre max_completion_tokens limite la somme des tokens visibles et des tokens de raisonnement. Si cette limite est trop basse, le modèle risque de tronquer sa réponse après avoir épuisé son budget en réflexion — un symptôme classique quand on active un effort élevé sans relever le plafond.

Recommandation : pour les requêtes complexes, prévoyez un timeout d’au moins 3 600 secondes. Le raisonnement peut prendre du temps sur les problèmes difficiles.

La tarification à palier

Grok 4.5 suit la règle commune à la gamme : le tarif de base s’applique tant que la requête reste sous 200 000 tokens de contexte, et double au-delà. Concrètement, $2.00 en entrée et $6.00 en sortie par million deviennent $4.00 et $12.00 dès que le contexte franchit ce seuil.

Le cache atténue fortement cette facture : les tokens d’entrée déjà vus dans une requête précédente sont facturés à environ 90 % de réduction. Sur un assistant qui renvoie le même prompt système et le même contexte de référence à chaque tour, l’écart est considérable — d’où l’importance de garder un préfixe de prompt stable.

Grok 4.20 Multi-agent

xAI propose également grok-4.20-multi-agent-0309, une variante optimisée pour l’orchestration de plusieurs agents. Elle partage la tarification et la fenêtre de contexte de la génération 4.20, mais elle est spécialement calibrée pour coordonner des sous-agents, gérer des flux de travail parallèles et synthétiser les résultats de multiples sources — un usage que Grok 4.5 ne couvre pas nativement.

Entrée multimodale

Grok 4.5 accepte du texte et des images en entrée. Les images doivent être au format JPG ou PNG, avec une taille maximale de 20 MiB. Chaque image consomme entre 256 et 1 792 tokens selon ses dimensions et le niveau de détail demandé.

La sortie reste exclusivement textuelle — le modèle ne génère pas d’images. Pour la génération visuelle, vous utiliserez les modèles Grok Imagine dédiés, présentés plus loin dans ce cours.

Tarifs relevés le 5 août 2026 — les prix évoluent régulièrement : avant tout calcul de budget, vérifiez la grille en vigueur sur la page officielle des modèles et tarifs xAI.

Points clés à retenir

  • Grok 4.5 est le modèle phare depuis juillet 2026 : 500 000 tokens de contexte, $2.00 / $6.00 par million sous le palier
  • Sa nouveauté majeure est le raisonnement configurable : un seul modèle, un curseur d’effort — au lieu des deux variantes de la génération 4.20
  • Le raisonnement est chiffré : récupérable via include et réinjectable, jamais lisible en clair
  • Les tokens de raisonnement sont facturés au tarif de sortie et comptent dans max_completion_tokens
  • Tarification à palier : au-delà de 200k tokens de contexte, les prix doublent ($4.00 / $12.00)
  • grok-4.20-multi-agent-0309 reste la variante dédiée à l’orchestration de sous-agents