GPT Image : créer des images depuis un prompt
Mis à jour le 29 juillet 2026
GPT Image : créer des images depuis un prompt
GPT Image est le générateur d’images intégré à ChatGPT. Contrairement aux générations précédentes d’outils, il est nativement connecté à la conversation : vous décrivez ce que vous voulez en langage naturel et ChatGPT produit une image fidèle à votre demande, avec une compréhension remarquable du texte, des compositions et des détails.
Votre première génération
Il n’y a ni bouton à chercher ni mode à activer : la génération se déclenche depuis la conversation, à partir d’une description. Tapez par exemple « Génère une image d’un café parisien au coucher du soleil, style photographie, avec des clients attablés en terrasse et la Tour Eiffel visible en arrière-plan. » ChatGPT analyse le prompt, transmet la requête à GPT Image et affiche le résultat dans le fil, où vous enchaînez sur des modifications ou des variantes sans changer d’outil.
Ce que contient un bon prompt
Cinq informations séparent une image approximative d’une image conforme à ce que vous aviez en tête. Le sujet principal répond au « quoi ? » — un chat, un paysage, un logo. Le contexte ou l’environnement répond au « où ? » — sur un bureau, dans une forêt, sur fond blanc. Le style visuel dit « comment ? » : photo réaliste, illustration aquarelle, flat design. L’ambiance fixe l’atmosphère, chaude, dramatique, minimaliste ou joyeuse. Les détails techniques cadrent enfin la prise de vue : gros plan, vue aérienne, portrait.
Assemblées, ces cinq décisions donnent un prompt de cette facture : « Un renard roux assis sur un rocher moussu dans une forêt de conifères, au lever du soleil. Style photographie animalière, lumière dorée douce, faible profondeur de champ, cadrage portrait. » Comparez-le à « fais-moi une belle image de renard » et l’écart devient évident : le prompt vague ne contient aucune décision, donc le modèle les prend toutes à votre place, sans raison de les prendre comme vous.
Du texte lisible dans les images
La restitution du texte constitue le progrès le plus visible sur les générateurs précédents, dont les mots relevaient souvent d’un pseudo-alphabet décoratif. Demandez « Crée une bannière pour un blog avec le texte “Bienvenue sur mon site” en typographie élégante sur un fond dégradé bleu et violet » : le texte apparaît propre, correctement orthographié et intégré à la composition plutôt que posé dessus.
Cette fiabilité ouvre les usages où le texte fait partie intégrante du design — visuels marketing, slides de présentation, prototypes rapides. Un mock-up d’affiche ou de couverture devient réalisable en quelques minutes.
Itérer plutôt que tout dire d’un coup
Après une première génération, l’affinage se fait dans la même conversation. « Rends l’arrière-plan plus sombre », « ajoute un chapeau au personnage », « change le style en illustration vectorielle », « garde la même composition mais passe en noir et blanc » : ChatGPT conserve le contexte de l’échange et adapte la génération suivante à votre retour, comme un illustrateur que vous dirigeriez par allers-retours courts.
C’est aussi le remède à l’erreur la plus courante, qui consiste à empiler deux cents mots dans un prompt unique. Faites l’exercice en trois temps : demandez d’abord « Génère l’image d’un espace de coworking moderne et lumineux », enrichissez avec « Ajoute des plantes vertes, de grandes baies vitrées et des personnes travaillant sur des ordinateurs portables », puis basculez avec « Change le style en illustration flat design avec des couleurs pastel ». Vous verrez à chaque étape ce que votre ajustement a réellement produit — information que le prompt monolithique vous aurait cachée. Pensez également à préciser le format attendu, carré, paysage ou portrait, rarement neutre pour l’usage final.
Forces et angles morts
Le modèle est particulièrement à l’aise sur quatre terrains : le rendu de texte lisible et correct, la compréhension d’instructions complexes, la cohérence avec le contexte de la conversation et l’étendue des styles accessibles.
Ses limites méritent d’être connues avant de s’engager sur un livrable client. Les mains et les doigts présentent encore des anomalies sur certaines générations. La cohérence d’un personnage récurrent n’est pas garantie d’une image à l’autre, ce qui complique toute série narrative. Les demandes très techniques — schéma d’ingénierie, plan coté — donnent des résultats approximatifs à ne pas confondre avec des documents exploitables, et certaines demandes sont refusées par les filtres de sécurité. Gardez enfin à l’esprit que GPT Image produit des images générées, non des photographies du réel : un visuel de produit ainsi obtenu illustre une idée, il ne documente pas un objet existant.
Points clés à retenir
- GPT Image est intégré directement dans ChatGPT — décrivez ce que vous voulez en langage naturel
- Un bon prompt contient : sujet, contexte, style, ambiance et détails techniques
- Le rendu de texte dans les images est fiable et lisible
- Procédez par itérations successives pour affiner le résultat
- Connaissez les limites : mains, cohérence de personnages, schémas techniques