Blog

12 août 2026

Écrire un prompt qui marche : la méthode qui change vos images

Décrire la photo plutôt que l'idée, structurer sujet, action, décor, lumière et style, itérer au lieu d'empiler des mots : la méthode complète pour écrire des prompts d'image efficaces sur Imaginode, et la liste honnête de ce qu'un prompt ne réglera jamais.

Frank Houbre

Frank HoubreFondateur d'Imaginode

décrivez la photo, pas l'idée

Un modèle exécute des descriptions, pas des intentions : décrivez la scène comme une photo existante, avec des objets, des matières et une lumière, jamais un concept abstrait.

Voici la phrase qui résume tout cet article : un modèle d'image ne comprend pas vos intentions, il exécute vos descriptions. « Une image qui inspire confiance pour ma marque » n'est pas un prompt, c'est un brief pour un humain. Le modèle ne connaît ni votre marque, ni votre définition de la confiance. Il lui faut du concret : des objets, des matières, une lumière.

Faites l'exercice mental suivant. Imaginez que la photo parfaite existe déjà et que vous la décrivez au téléphone à quelqu'un qui doit la retrouver parmi mille autres. Vous ne diriez pas « une image chaleureuse ». Vous diriez « une femme d'une soixantaine d'années rit dans une cuisine lumineuse, mains couvertes de farine, tablier bleu ». C'est exactement la conversion à opérer.

Cette bascule mentale, de l'idée vers la photo, produit à elle seule plus de progrès que n'importe quelle liste de mots magiques glanée sur les réseaux. Les « prompts secrets » vendus à droite à gauche ne sont que des descriptions bien construites. La bonne nouvelle, c'est que la construction s'apprend en une heure de pratique.

la structure en cinq blocs qui tient toujours

Un prompt solide répond à cinq questions dans l'ordre : sujet, action, décor, lumière, style ; chaque bloc absent est rempli par le modèle avec du générique.

Un prompt d'image solide répond à cinq questions, dans cet ordre : qui ou quoi, en train de faire quoi, où, sous quelle lumière, dans quel style de rendu. Sujet, action, décor, lumière, style. Ce n'est pas une formule sacrée, c'est une check-list : chaque bloc absent sera rempli par le modèle avec ses réflexes statistiques, autrement dit avec du générique.

Exemple complet : « un boulanger sexagénaire, sort une fournée de baguettes du four, fournil à l'ancienne aux murs de pierre, lumière chaude de petit matin venant d'une fenêtre latérale, photographie documentaire, 35 mm ». Chaque segment répond à une question, aucun ne se contredit. Ce prompt produira des variations, mais toutes dans la bonne direction.

Comparez avec « boulanger authentique tradition pain artisanal qualité ». Aucune scène, aucun angle, aucune lumière : le modèle recevra ces mots comme une ambiance vague et livrera l'illustration la plus moyenne possible du concept boulangerie. Les deux prompts coûtent le même prix. La structure est gratuite, autant la prendre.

le sujet : un casting, pas une catégorie

Trois détails visibles suffisent, âge approximatif, un trait physique, un vêtement précis : plus le sujet est incarné, moins l'image sent la banque d'images.

« Une femme » est une catégorie. « Une femme d'affaires d'une quarantaine d'années, cheveux gris courts, tailleur bordeaux » est un casting. La différence tient en une poignée de détails visibles : âge approximatif, un ou deux traits physiques, un vêtement précis. Trois choix suffisent, il ne s'agit pas de rédiger une fiche d'état civil.

Choisissez les détails qui portent du sens pour votre image. Si vous préparez un visuel pour un article sur l'artisanat, les mains comptent plus que la coiffure : « mains marquées par le travail, ongles courts » orientera le modèle bien plus utilement que la couleur des yeux, que personne ne verra sur un plan large de toute façon.

Même logique pour les objets et les lieux. « Une voiture » donne une berline générique sans marque identifiable. « Un break familial des années 90, peinture verte défraîchie, plaques boueuses » raconte déjà une histoire. Le modèle adore ce genre de matière : plus le sujet est incarné, moins l'image sent le stock.

l'action, ou pourquoi vos images semblent figées

Un verbe concret débloque la pose et génère naturellement la composition ; restez sur une action lisible à un seul sujet, les interactions complexes dépassent les modèles actuels.

Beaucoup de prompts décrivent un sujet mais oublient de lui donner quelque chose à faire. Résultat prévisible : un personnage debout, face caméra, sourire de photo d'identité. Si vos images ont toutes cet air de catalogue, c'est presque toujours le bloc action qui manque. Un verbe concret suffit à débloquer la pose.

« Verse un café en regardant par la fenêtre », « répare une chaîne de vélo, sourcils froncés », « court sous la pluie en tenant sa veste au-dessus de sa tête ». L'action donne au modèle une raison de placer les bras, d'orienter le regard, de créer une tension dans le corps. Elle génère naturellement de la composition, sans que vous ayez à la décrire.

Attention cependant aux actions complexes impliquant plusieurs personnes en interaction précise. « Deux escrimeurs dont l'un pare une attaque en quarte » dépasse ce que les modèles actuels gèrent proprement : vous obtiendrez des membres improbables et des épées fusionnées. Restez sur des actions lisibles à un seul sujet principal, du moins tant que vous itérez à 1 crédit.

le décor plante une ambiance, pas un inventaire

Deux ou trois éléments bien choisis suffisent à situer la scène : un inventaire de quinze objets produit des compositions surchargées, et les indications de profondeur structurent mieux que les adjectifs.

Le décor situe la scène et installe l'atmosphère. Deux ou trois éléments bien choisis font le travail : « cuisine de restaurant en plein service, inox, vapeur » suffit à convoquer tout l'univers. Inutile de lister les vingt ustensiles attendus, le modèle connaît les cuisines de restaurant mieux que vous ne pourrez jamais les décrire.

L'erreur inverse du décor vide, c'est le décor exhaustif. Un prompt qui énumère quinze objets force le modèle à tout caser, et il le fera mal : objets flottants, échelles absurdes, composition surchargée. Si un accessoire compte vraiment, donnez-lui une place dans la phrase, sinon laissez-le au modèle. Vous décrivez une photo, pas une scène de théâtre avec sa régie.

Pensez aussi à la profondeur. « En arrière-plan flou, des étagères de livres » place l'élément à sa juste distance et suggère au passage une faible profondeur de champ. Ces indications spatiales, premier plan, arrière-plan, à travers une vitre, structurent la composition bien plus que des adjectifs d'ambiance.

la lumière, le paramètre le plus sous-estimé

Préciser la lumière améliore l'image plus souvent que tout autre ajout : un même café bascule de mélancolique à solaire selon qu'on écrit matin pluvieux ou lumière dorée aux ombres longues.

Demandez à un photographe ce qui fait une image : il répondra la lumière avant le sujet. Les modèles d'image fonctionnent pareil. Le même café en terrasse devient mélancolique sous « lumière grise de matin pluvieux » et solaire sous « lumière dorée de fin d'après-midi, ombres longues ». Un seul segment de phrase, et c'est toute l'émotion de l'image qui bascule.

Quelques directions qui marchent bien : la lumière dorée d'avant le coucher du soleil, le contre-jour qui découpe une silhouette, la lumière douce d'une fenêtre au nord pour les portraits, le néon coloré pour les ambiances urbaines nocturnes. Précisez aussi d'où vient la lumière quand ça compte : latérale, elle sculpte les visages, frontale, elle les aplatit.

Si vous ne deviez ajouter qu'un seul bloc à vos prompts actuels, ce serait celui-là. Dans nos essais, préciser la lumière améliore visiblement l'image plus souvent que n'importe quel autre ajout, notamment parce qu'elle unifie la scène entière. Un décor moyen sous une belle lumière fait toujours une meilleure image que l'inverse.

le style ferme la marche et cadre le rendu

Dites au modèle quel type d'image produire, photographie réaliste, aquarelle ou rendu 3D, et ajoutez une focale ou une ouverture : le node Caméra écrit ces termes à votre place.

Dernier bloc : dire au modèle quel type d'image il produit. « Photographie réaliste », « illustration à l'aquarelle », « rendu 3D minimaliste », « affiche sérigraphiée années 60 ». Sans cette précision, le modèle choisit lui-même, et son choix par défaut varie d'un modèle à l'autre. C'est le bloc qui évite l'aquarelle surprise sur un projet photo.

Pour la photographie, quelques termes techniques paient immédiatement : une focale, 35 mm pour un rendu reportage, 85 mm pour un portrait qui détache le sujet, une ouverture comme f/1.8 pour un arrière-plan fondu. Vous n'avez pas besoin de comprendre l'optique, ces termes fonctionnent comme des raccourcis vers des rendus que les modèles connaissent par cœur.

Sur Imaginode, le node Caméra industrialise cette partie : cinq molettes illustrées, cadrage, objectif en millimètres, ouverture, angle et mouvement, qui écrivent les bons termes anglais en tête de votre prompt. Pour apprendre, tournez les molettes et regardez le texte produit. C'est un cours de vocabulaire photographique déguisé en interface.

pourquoi l'anglais donne de meilleurs résultats

Les données d'entraînement sont massivement décrites en anglais : le vocabulaire photographique anglais touche des zones plus riches de l'apprentissage, d'où des cadrages et des lumières mieux maîtrisés.

Parlons franchement de la langue. Les modèles d'image acceptent le français et s'en sortent, mais leurs données d'entraînement sont massivement décrites en anglais. Conséquence directe : le vocabulaire anglais photographique, golden hour, rim light, shallow depth of field, touche des zones bien plus riches de leur apprentissage que nos équivalents français, quand ils existent.

L'écart n'est pas cosmétique. Sur un même concept testé dans les deux langues, la version anglaise produit régulièrement un cadrage plus intentionnel et une lumière mieux maîtrisée, simplement parce que les termes précis existent et que le modèle les a vus des millions de fois. « Contre-jour » est compris, backlit silhouette est maîtrisé.

Faut-il donc apprendre l'anglais photographique avant de créer ? Non, et c'est tout l'intérêt du point suivant. Mais comprendre pourquoi l'anglais gagne vous évitera de conclure à tort que « l'IA ne marche pas » alors que seule la formulation limite vos résultats.

la baguette magique, votre traducteur technique à 1 crédit

La baguette réécrit votre français en anglais riche et structuré via Kimi pour 1 crédit, en préservant les @mentions de vos personnages de référence.

Sur chaque champ prompt des nodes Image et Vidéo d'Imaginode, une baguette magique réécrit votre texte en anglais riche et structuré, via le modèle Kimi, pour 1 crédit, environ un centime. Vous écrivez « un boulanger sort son pain du four le matin », elle développe la scène avec le vocabulaire technique attendu : lumière, matières, rendu.

Le bon flux de travail : écrivez d'abord votre idée complète en français, avec vos cinq blocs. Passez la baguette. Lisez ce qu'elle produit, générez, puis modifiez le texte anglais directement si un détail dérive. La baguette n'est pas une loterie à relancer, c'est une étape de traduction et d'enrichissement, une fois par idée nouvelle.

Détail qui compte pour la suite : la baguette préserve les @mentions de vos références. Si votre prompt contient @marie, votre personnage récurrent défini dans un node Référence, la réécriture garde la mention intacte, avec sa description injectée et ses photos jointes. Vos prompts enrichis restent donc compatibles avec tout le système de références.

itérer plutôt qu'empiler des mots

Une règle : un seul changement par génération, comparé dans l'historique des 12 dernières générations du node ; dix itérations disciplinées à 1 crédit coûtent dix centimes.

Face à une image décevante, le réflexe naturel est d'ajouter des mots. Après cinq allers-retours, le prompt fait quatre-vingts mots, se contredit deux fois, et personne ne sait plus quel segment produit quoi. Ce prompt-mille-feuille est l'impasse la plus fréquente chez les créateurs intermédiaires, bien plus que le prompt trop court.

La méthode saine tient en une règle : un changement par génération. L'image est trop sombre ? Modifiez uniquement le bloc lumière, régénérez, comparez. Le cadrage déçoit ? Uniquement le cadrage. À 1 crédit l'essai sur Flux Schnell, dix itérations disciplinées coûtent dix centimes et vous apprennent ce que chaque mot pèse. C'est une expérience scientifique à prix d'ami.

L'historique du node rend cette discipline confortable : les 12 dernières générations restent visibles, chacune comparable aux autres. Vous voyez littéralement l'effet de chaque changement de mot en mettant deux versions côte à côte. Quand une itération dégrade l'image, revenez au texte précédent et prenez une autre direction. Rien n'est perdu, tout est comparable.

les prompts négatifs n'existent pas partout

Écrivez ce que vous voulez voir, pas ce que vous voulez éviter : « rue déserte au petit matin » fonctionne là où « pas de foule » peut invoquer le concept mentionné.

Vous croiserez sur les forums des prompts remplis de « no blur, no extra fingers, no text ». Héritage d'anciens outils qui proposaient un champ « prompt négatif » séparé. Sur les modèles récents accessibles dans Imaginode, cette syntaxe n'est pas un standard : selon le modèle, la négation est diversement comprise, et mentionner un concept peut suffire à l'invoquer.

Écrivez ce que vous voulez voir, pas ce que vous voulez éviter. Plutôt que « pas de foule en arrière-plan », écrivez « rue déserte au petit matin ». Plutôt que « pas flou », précisez « mise au point nette sur le visage ». La formulation positive décrit une image possible, la négative décrit un vide que le modèle ne sait pas toujours peindre.

Restent les défauts que personne n'a demandés, mains étranges, textes illisibles sur les enseignes. Aucune incantation négative ne les élimine à coup sûr, c'est une limite actuelle des modèles, admise par tout le monde. La parade réaliste : itérer à bas coût jusqu'à une génération propre, ou cadrer votre scène pour que mains et textes ne soient pas au premier plan.

adapter la longueur du prompt au modèle

Flux Schnell à 1 crédit préfère les prompts courts, quand Flux 2 Pro à 7 crédits ou Seedream 5 Lite à 5 exploitent les descriptions détaillées : dégrossissez court, finalisez long.

Tous les modèles ne digèrent pas la même densité de texte. Flux Schnell, à 1 crédit, brille sur des prompts courts et directs : une scène claire, quelques précisions, et il livre en quelques secondes. Lui servir un pavé de cent mots n'améliore rien, il en survolera la moitié. C'est l'outil du croquis, traitez-le comme tel.

Les modèles haut de gamme comme Flux 2 Pro à 7 crédits ou Seedream 5 Lite à 5 crédits exploitent mieux les prompts détaillés : matières, lumière complexe, ambiance nuancée. C'est le moment où le texte enrichi par la baguette magique prend toute sa valeur. La même description généreuse qui noyait Flux Schnell devient carburant pour eux.

D'où une méthode en deux temps qui rejoint la règle d'or du guide débutant : dégrossir court et pas cher, finaliser long et précis. Écrivez la version courte, itérez à 1 crédit jusqu'à la bonne composition, enrichissez à la baguette, puis générez la finale sur un modèle à 5 ou 7 crédits. Votre prompt grandit avec votre image.

ce qu'un prompt ne réglera jamais

Aucun texte ne garantit un visage constant, une main à cinq doigts ou un long texte lisible : la cohérence de personnage passe par le node Référence et ses @mentions, pas par le prompt.

Il faut le dire sans détour : certains problèmes ne se résolvent pas dans le champ texte, et s'acharner dessus coûte des soirées. Le premier, c'est la cohérence de personnage. Vous pouvez décrire votre héroïne sur vingt lignes, âge, visage, grain de beauté : sans images de référence, elle changera de visage à chaque génération. Ce n'est pas un défaut de votre prompt, c'est le fonctionnement même des modèles.

La réponse se trouve ailleurs sur le canvas : le node Référence. Vous lui donnez un nom, une description et des photos, puis vous mentionnez @cenom dans n'importe quel prompt. La mention s'affiche en vert, la description s'injecte et les photos partent automatiquement avec la requête. Des modèles comme Seedream 5 Lite, champion des références à 5 crédits, s'appuient dessus pour garder un visage stable d'une image à l'autre.

Même lucidité pour le reste : un texte long parfaitement lisible dans l'image, une main à cinq doigts garantie, une marque déposée reproduite fidèlement, aucun prompt ne le promet. Reconnaître ces limites vous fait gagner un temps considérable : vous saurez quand affiner le texte, et quand changer d'outil. Pour le texte dans l'image, par exemple, la parade tient à deux ou trois mots seulement et à un modèle qui les tient, comme dans le workflow de miniature YouTube. La cohérence de personnage mérite d'ailleurs un article dédié sur ce blog.

un avant-après complet pour tout relier

Le même visuel de télétravail passe du cliché générique à une image crédible grâce aux cinq blocs, à la baguette et à quatre itérations : 12 crédits et un quart d'heure en tout.

Situation réelle : une créatrice prépare le visuel d'un article sur le télétravail. Premier prompt, « femme en télétravail heureuse productivité ». Résultat prévisible : bureau blanc générique, sourire figé vers l'ordinateur, image de banque d'images sans la licence. Le prompt décrivait un concept, le modèle a livré le cliché moyen du concept.

Deuxième version, avec la structure : « une femme d'une trentaine d'années en pull moutarde, concentrée, annote des documents devant un ordinateur portable, salon d'appartement avec plantes vertes, lumière douce de fin de matinée par une grande fenêtre à gauche, photographie réaliste, 50 mm, faible profondeur de champ ». Enrichie à la baguette pour 1 crédit, itérée quatre fois sur Flux Schnell, finalisée sur Flux 2 Pro.

Bilan de l'opération : 12 crédits, environ douze centimes, un quart d'heure montre en main. L'image finale a une lumière crédible, une pose naturelle, un vrai point de vue. Aucun talent caché, aucun mot magique : cinq blocs remplis honnêtement, une traduction outillée et des itérations disciplinées. La méthode entière tient dans cet exemple.

votre prochaine étape

Passez votre dernier prompt au crible des cinq questions, régénérez à 1 crédit et comparez : puis cap sur le node Référence pour les personnages ou le node Caméra pour le rendu.

Prenez le dernier prompt que vous avez écrit, n'importe lequel. Passez-le au crible des cinq questions : sujet incarné, action concrète, décor situé, lumière décrite, style précisé. Complétez les blocs manquants, générez la nouvelle version à 1 crédit sur Flux Schnell et comparez les deux images dans l'historique du node. L'écart devrait vous convaincre mieux que cet article.

Ensuite, deux directions selon votre projet. Si vos images mettent en scène un personnage récurrent, le node Référence et les @mentions sont votre priorité absolue, bien avant tout raffinement de vocabulaire. Si c'est le rendu cinématographique qui vous attire, explorez le node Caméra et ses cinq molettes, puis notre article sur la direction de caméra en IA.

Et si vous bloquez sur un prompt précis, posez la question à l'assistant dans la bulle en bas à droite : il voit votre canvas ouvert, votre node et votre texte, et répond pour 1 crédit. Décrire la photo plutôt que l'idée reste votre travail. Pour tout le reste, vous êtes outillé.

Envie d'essayer sur un vrai canvas ?

Tout ce qui est décrit dans cet article se fait sur Imaginode, dans votre navigateur.

Commencer