MVSTR
    ← RETOUR AU JOURNAL
    GUIDE·7 min de lecture·

    Prompt engineering pour la génération d'images par IA — guide pratique

    Comment fonctionne réellement le prompt engineering pour la génération d'images par IA : structure, ordre, précision et boucle de révision — expliqués avec de vrais exemples de photos de luxe.

    "Prompt engineering" sonne comme un intitulé de poste inventé pour facturer plus cher de l'heure. Retire le jargon et il reste une affirmation simple : les mots que tu donnes à un modèle d'image sont une spécification, et de meilleures spécifications produisent de meilleurs résultats. Cette affirmation se trouve être vraie, et ce guide couvre ce qui change vraiment quelque chose.

    Tout ici s'applique à Google Gemini, pour lequel nous concevons, mais les principes se transposent à n'importe quel modèle d'image moderne.

    Le modèle comble chaque vide que tu laisses

    Un modèle d'image doit restituer une scène complète : chaque surface, chaque source de lumière, chaque tissu. Tout ce que ton prompt ne précise pas, le modèle le décide à ta place — et il décide en se rabattant sur la moyenne statistique de ses données d'entraînement. Lumière moyenne. Composition moyenne. Vêtements moyens.

    C'est pour cela que les prompts vagues paraissent génériques. Non parce que le modèle est faible, mais parce que tu lui as délégué toutes les décisions.

    Le prompt engineering, c'est simplement décider davantage toi-même. Les vêtements exacts du sujet et leur état — veste fermée ou ouverte. L'environnement avec ses matériaux nommés — marbre, teck, acier brossé. La source de lumière et sa direction. La distance et l'angle de la caméra. Le format et la finition.

    L'ordre compte moins que l'exhaustivité

    On s'obsède sur l'ordre des tokens et les mots magiques. En pratique, un prompt complet en langage clair bat à chaque fois un prompt incomplet avec une syntaxe d'initié. Le modèle n'a pas besoin de "8k, chef-d'œuvre, tendance" — il a besoin de savoir ce QU'EST la scène.

    Un test utile : relis ton prompt et demande-toi ce qu'un photographe humain devrait encore te demander. "Homme en costume dans un hôtel" laisse le photographe demander : quel costume, quelle couleur, boutonné ou ouvert, quel hôtel, hall ou toit-terrasse, matin ou nuit, gros plan ou pied ? Chaque question sans réponse est une décision que tu viens de confier à la moyenne.

    La structure en cinq couches

    Presque tous les bons prompts de notre archive suivent le même squelette :

    1. Cadre : "photo sur le vif de moi" — établit qu'il y a un sujet, photographié naturellement plutôt que posé en studio.

    2. Action et pose : en train de sortir de, appuyé à, ajustant une manchette, en pleine foulée. Les verbes créent des photographies ; rester debout crée des photos d'identité.

    3. Garde-robe, détaillée : chaque vêtement nommé avec sa couleur, sa matière et son état. "Bomber noir légèrement ouvert sur un t-shirt blanc" — l'état de la fermeture éclair fait un vrai travail ici.

    4. Environnement, matériaux d'abord : "hall en marbre avec portes d'ascenseur en laiton" bat "hôtel chic", parce que le modèle restitue des matériaux, pas des adjectifs.

    5. Finition technique : format, grain, condition lumineuse. "Esthétique granuleuse, heure dorée, 9:16" installe toute l'ambiance en sept mots.

    Les contraintes sont aussi des prompts

    La moitié du prompt engineering consiste à empêcher des choses. Les modèles dérivent vers les clichés — des personnes en plus à l'arrière-plan, des bijoux que tu n'as pas demandés, des gestes qui paraissent étranges. Des contraintes négatives explicites écrites entre parenthèses tiennent la ligne : "(personne d'autre sur la photo)" figure dans presque tous les prompts de l'archive pour exactement cette raison.

    Si tu génères une série, les contraintes la gardent cohérente. La même coupe de cheveux décrite de la même façon. La même montre. Le même étalonnage. La cohérence d'une image à l'autre est ce qui rend un feed crédible, et elle vient entièrement de contraintes répétées.

    La boucle de révision

    Les premières générations sont des brouillons. Le savoir-faire consiste à diagnostiquer ce qui cloche en termes de prompt :

    L'image paraît plate — tu n'as pas précisé de direction de lumière. Les vêtements font bon marché — tu as nommé une catégorie ("costume") au lieu d'un vêtement ("costume croisé en laine anthracite, veste ouverte"). La scène est encombrée — tu n'as jamais dit ce qui N'EST PAS là. Le visage ne va pas — c'est ta photo de référence, pas le prompt ; utilise une photo nette, bien éclairée, de face.

    Change une couche par révision. Si tu réécris tout le prompt à chaque essai, tu n'apprends rien sur le changement qui comptait.

    Quand arrêter d'ingénier et commencer à copier

    Voici l'économie honnête : caler un seul prompt fiable demande 20 à 40 générations d'itération. C'est un après-midi par scène. Le prompt engineering est une vraie compétence — mais pour la plupart des gens c'est un moyen, et la fin, c'est la photo.

    C'est toute la prémisse de PROMPTMVSTR : l'archive rassemble des centaines de prompts déjà passés par cette boucle, chacun montré à côté de l'image exacte qu'il a produite. Copie le prompt mot pour mot, mets ton visage, terminé. Étudie-les et tu absorberas la structure plus vite que n'importe quel guide ne peut l'enseigner — celui-ci compris.

    Prêt à essayer ? Parcours la bibliothèque de prompts IA ou lance un Virtual Photoshoot. Des questions sur les tarifs ou le fonctionnement ? Consulte la FAQ.