Aller au contenu principal

Contexte 2 millions de tokens

Ce que signifie une fenêtre de 2 millions de tokens

Tous les modèles texte de la gamme Grok partagent une caractéristique remarquable : une fenêtre de contexte de 2 millions de tokens. Pour mettre ce chiffre en perspective, 2 millions de tokens représentent environ 1,5 million de mots, soit l’équivalent de 15 à 20 romans complets, ou encore l’intégralité d’une base de code de taille moyenne.

Cette capacité transforme fondamentalement la manière dont vous pouvez utiliser un modèle de langage. Au lieu de découper vos données en fragments et de les traiter séparément, vous pouvez fournir l’ensemble du contexte en une seule requête.

Cas d’usage concrets

Analyse de bases de code

Avec 2 millions de tokens, vous pouvez charger une base de code entière dans le contexte du modèle. Un projet Python de 50 000 lignes tient confortablement dans cette fenêtre. Le modèle peut alors répondre à des questions sur l’architecture globale, identifier des dépendances croisées ou proposer des refactoring cohérents avec l’ensemble du code.

Traitement de documents longs

Rapports annuels, documents juridiques, manuels techniques — ces documents font souvent des centaines de pages. Plutôt que de les résumer par morceaux et de perdre le contexte global, vous pouvez les injecter intégralement et poser des questions précises sur n’importe quelle section.

Conversations longues

Dans les applications conversationnelles, la fenêtre de contexte détermine la longueur de l’historique que le modèle peut « se rappeler ». Avec 2 millions de tokens, vous pouvez maintenir des conversations très longues sans perte de contexte — utile pour les sessions de travail prolongées ou le support technique complexe.

Synthèse multi-sources

Charger simultanément plusieurs documents — articles, rapports, emails — pour en faire une synthèse croisée. Le modèle peut identifier les recoupements, les contradictions et les informations complémentaires entre les sources.

Limites et considérations

Latence

Plus le contexte est long, plus le temps de traitement augmente. Une requête avec 2 millions de tokens en entrée sera significativement plus lente qu’une requête avec 2 000 tokens. Prévoyez des timeouts adaptés — xAI recommande 3 600 secondes minimum pour les requêtes complexes.

Coût

Le coût est directement proportionnel au nombre de tokens traités. Injecter 2 millions de tokens dans Grok 4.20 sans cache coûte $4.00 rien qu’en tokens d’entrée. Avec le cache (à $0.20/M), le même contexte ne coûte que $0.40 — d’où l’importance cruciale du cache pour les contextes longs.

Qualité de l’attention

Même si le modèle accepte 2 millions de tokens, la qualité de l’attention n’est pas uniforme. Les informations placées au début et à la fin du contexte sont généralement mieux « retenues » que celles au milieu. Pour les requêtes critiques, placez les informations les plus importantes en début de contexte ou directement avant la question.

Pas de stockage permanent

La fenêtre de contexte est éphémère : elle n’existe que pendant la requête. Si vous avez besoin de stocker des informations entre les requêtes, utilisez les Collections de xAI ou votre propre base de données. La fenêtre de contexte ne remplace pas un système de mémoire persistante.

Stratégies d’utilisation efficace

Structurez votre contexte

Avec un contexte très long, la structure devient cruciale. Utilisez des délimiteurs clairs (balises XML, titres Markdown) pour organiser les différentes sections. Le modèle s’y retrouve mieux quand le contexte est bien balisé.

Combinez contexte long et cache

La combinaison la plus puissante : un contexte long stable (documentation de référence, code source) qui bénéficie du cache, avec des ajouts courts et dynamiques (question de l’utilisateur) à la fin. Vous obtenez la puissance du contexte long au prix du cache.

Ne remplissez pas le contexte inutilement

Ce n’est pas parce que vous pouvez injecter 2 millions de tokens que vous devez le faire systématiquement. Chaque token a un coût et augmente la latence. Sélectionnez le contexte pertinent pour la tâche à accomplir plutôt que de tout envoyer par défaut.

Points clés à retenir

  • 2 millions de tokens représentent environ 1,5 million de mots
  • Idéal pour l’analyse de code, les documents longs et les conversations étendues
  • La latence augmente avec la taille du contexte — prévoyez des timeouts adaptés
  • Le cache est essentiel pour rendre les contextes longs économiques
  • La qualité d’attention varie : placez les informations critiques en début ou fin de contexte
  • Ne remplissez pas inutilement le contexte — sélectionnez ce qui est pertinent