Flux complet d'une requete multi-agent
De la requete a la reponse
Pour bien exploiter le multi-agent, vous devez comprendre ce qui se passe entre le moment ou vous envoyez votre requete et celui ou vous recevez la reponse. Ce flux est sensiblement different d’un appel classique a un LLM.
Etape 1 : reception et analyse de la requete
Quand votre requete arrive au modele grok-4.20-multi-agent, le leader l’analyse pour determiner :
- La nature de la tache : recherche factuelle, analyse comparative, synthese, etc.
- Le nombre de facettes a explorer
- Les outils potentiellement necessaires (recherche web, code, etc.)
- La strategie de delegation aux sub-agents
Cette analyse initiale est transparente pour vous — elle fait partie du raisonnement chiffre du leader.
Etape 2 : lancement des sub-agents
Le leader delegue des sous-taches aux sub-agents. Chaque sub-agent recoit une directive specifique et commence a travailler en parallele. Par exemple, pour une requete sur les strategies cloud europeennes :
- Agent A : recherche les annonces recentes des fournisseurs
- Agent B : analyse les aspects reglementaires (RGPD, AI Act)
- Agent C : compare les grilles tarifaires
- Agent D : examine la documentation technique
Avec 16 agents, la decomposition est plus fine et couvre davantage d’angles.
Etape 3 : recherche et discussion
Les sub-agents ne travaillent pas en vase clos. Ils peuvent :
- Utiliser les outils integres (web_search, x_search, code_execution, etc.)
- Echanger entre eux pour eviter les doublons et affiner les recherches
- Signaler au leader des decouvertes inattendues qui meritent une exploration supplementaire
Cette phase est la plus longue et la plus couteuse en tokens, car chaque agent genere des tokens d’entree, de sortie et de raisonnement.
Etape 4 : synthese par le leader
Une fois que les sub-agents ont termine (ou que le budget de raisonnement est atteint), le leader :
- Collecte tous les resultats
- Elimine les redondances
- Structure l’information selon le format demande
- Cite les sources quand c’est pertinent
- Produit la reponse finale
Ce que vous recevez
La reponse que vous recevez contient :
- Le texte de la reponse du leader (sa synthese)
- Les appels d’outils effectues par tous les agents (leader + sub-agents)
- Eventuellement, le contenu chiffre si vous avez active
use_encrypted_content=True
Vous ne recevez jamais :
- Le raisonnement interne des sub-agents en clair
- Les echanges entre sub-agents
- Le detail de la strategie de delegation du leader
Le streaming
En mode streaming, vous voyez la reponse du leader se construire progressivement. Avec le parametre verbose_streaming, vous obtenez aussi les appels d’outils en temps reel, ce qui vous donne un apercu de l’activite des agents.
C’est particulierement utile pour les requetes longues : vous pouvez voir les recherches web se declencher les unes apres les autres pendant que les agents travaillent.
Implications sur la latence
Le multi-agent est inherement plus lent qu’un appel classique :
- Les sub-agents travaillent en parallele, mais la coordination prend du temps
- Le leader doit attendre les resultats avant de synthetiser
- Plus il y a d’agents (16 vs 4), plus la latence augmente
Pour des cas d’usage interactifs (chatbot en temps reel), privilegiez 4 agents. Les 16 agents conviennent mieux aux taches asynchrones ou l’utilisateur peut attendre.
Points cles a retenir
- Le flux suit 4 etapes : analyse → delegation → recherche → synthese
- Les sub-agents travaillent en parallele et echangent entre eux
- Vous ne recevez que la reponse du leader et les appels d’outils
- Le streaming avec
verbose_streamingpermet de suivre l’activite en temps reel - La latence est plus elevee qu’un appel classique, surtout avec 16 agents