Prompt Engineering für KI-Bildgenerierung — ein praktischer Leitfaden
Wie Prompt Engineering für KI-Bildgenerierung wirklich funktioniert: Struktur, Reihenfolge, Präzision und die Überarbeitungsschleife — erklärt an echten Luxus-Fotobeispielen.
"Prompt Engineering" klingt nach einer Berufsbezeichnung, die jemand erfunden hat, um mehr pro Stunde zu verlangen. Nimmt man das Schlagwort weg, bleibt eine einfache Behauptung: Die Wörter, die du einem Bildmodell gibst, sind eine Spezifikation, und bessere Spezifikationen liefern bessere Ergebnisse. Diese Behauptung stimmt zufällig, und dieser Leitfaden behandelt das, was tatsächlich etwas bewirkt.
Alles hier gilt für Google Gemini, für das wir entwickeln, aber die Prinzipien lassen sich auf jedes moderne Bildmodell übertragen.
Das Modell füllt jede Lücke, die du lässt
Ein Bildmodell muss eine vollständige Szene rendern: jede Oberfläche, jede Lichtquelle, jeden Stoff. Was dein Prompt nicht festlegt, entscheidet das Modell für dich — und es entscheidet, indem es auf den statistischen Durchschnitt seiner Trainingsdaten zurückfällt. Durchschnittliches Licht. Durchschnittliche Komposition. Durchschnittliche Kleidung.
Deshalb wirken vage Prompts generisch. Nicht weil das Modell schwach wäre, sondern weil du jede Entscheidung an es delegiert hast.
Prompt Engineering heißt schlicht, mehr Dinge selbst zu entscheiden. Die genaue Kleidung des Motivs und ihren Zustand — Jacke geschlossen oder offen. Die Umgebung mit benannten Materialien — Marmor, Teak, gebürsteter Stahl. Die Lichtquelle und ihre Richtung. Abstand und Winkel der Kamera. Format und Finish.
Die Reihenfolge zählt weniger als die Vollständigkeit
Alle Welt zerbricht sich den Kopf über Token-Reihenfolge und Zauberwörter. In der Praxis schlägt ein vollständiger Prompt in einfacher Sprache jedes Mal einen unvollständigen Prompt mit Insider-Syntax. Das Modell braucht kein "8k, Meisterwerk, im Trend" — es muss wissen, was die Szene IST.
Ein nützlicher Test: Lies deinen Prompt und frage dich, was ein menschlicher Fotograf dich noch fragen müsste. "Mann im Anzug in einem Hotel" lässt den Fotografen fragen: welcher Anzug, welche Farbe, geknöpft oder offen, welches Hotel, Lobby oder Dachterrasse, morgens oder nachts, Nahaufnahme oder Ganzkörper? Jede unbeantwortete Frage ist eine Entscheidung, die du gerade an den Durchschnitt abgegeben hast.
Die Fünf-Schichten-Struktur
Nahezu jeder starke Prompt in unserem Archiv folgt demselben Grundgerüst:
1. Rahmen: "Schnappschuss von mir" — legt fest, dass es ein Motiv ist, natürlich fotografiert statt studiomäßig gestellt.
2. Handlung und Pose: aussteigend aus, angelehnt an, eine Manschette richtend, mitten im Schritt. Verben erzeugen Fotografien; Herumstehen erzeugt Passbilder.
3. Garderobe, Stück für Stück: jedes Kleidungsstück mit Farbe, Material und Zustand benannt. "Schwarze Bomberjacke leicht geöffnet über einem weißen T-Shirt" — der Zustand des Reißverschlusses leistet dort echte Arbeit.
4. Umgebung, Materialien zuerst: "Marmorlobby mit Aufzugtüren aus Messing" schlägt "schickes Hotel", weil das Modell Materialien rendert, keine Adjektive.
5. Technisches Finish: Seitenverhältnis, Körnung, Lichtsituation. "Körnige Ästhetik, goldene Stunde, 9:16" setzt die gesamte Stimmung in sieben Wörtern.
Einschränkungen sind auch Prompts
Die Hälfte des Prompt Engineerings besteht darin, Dinge zu verhindern. Modelle driften zu Klischees — zusätzliche Personen im Hintergrund, Schmuck, nach dem du nicht gefragt hast, Gesten, die unheimlich wirken. Ausdrückliche negative Vorgaben in Klammern halten die Linie: "(keine weiteren Personen im Bild)" steht aus genau diesem Grund in fast jedem Archiv-Prompt.
Wenn du eine Serie erzeugst, halten Einschränkungen sie zusammen. Derselbe Haarschnitt, gleich beschrieben. Dieselbe Uhr. Dieselbe Farbgebung. Konsistenz über mehrere Bilder hinweg ist das, was einen Feed glaubwürdig macht, und sie entsteht vollständig aus wiederholten Einschränkungen.
Die Überarbeitungsschleife
Erste Generierungen sind Entwürfe. Die Kunst besteht darin, den Fehler in Prompt-Begriffen zu diagnostizieren:
Das Bild wirkt flach — du hast keine Lichtrichtung angegeben. Die Kleidung wirkt billig — du hast eine Kategorie benannt ("Anzug") statt eines Kleidungsstücks ("anthrazitfarbener zweireihiger Wollanzug, Jackett offen"). Die Szene ist überladen — du hast nie gesagt, was NICHT da ist. Das Gesicht stimmt nicht — das liegt an deinem Referenzfoto, nicht am Prompt; nimm eine saubere, gut ausgeleuchtete Frontalaufnahme.
Ändere pro Überarbeitung eine Schicht. Wenn du bei jedem Versuch den ganzen Prompt umschreibst, lernst du nichts darüber, welche Änderung entscheidend war.
Wann du aufhören solltest zu engineeren und anfangen zu kopieren
Hier die ehrliche Rechnung: Einen einzigen verlässlichen Prompt einzustellen kostet 20 bis 40 Generierungen an Iteration. Das ist ein Nachmittag pro Szene. Prompt Engineering ist eine echte Fähigkeit — aber für die meisten Menschen ist es Mittel zum Zweck, und der Zweck ist das Foto.
Genau das ist die Prämisse von PROMPTMVSTR: Das Archiv sind Hunderte von Prompts, die diese Schleife bereits durchlaufen haben, jeder einzelne neben dem exakten Bild gezeigt, das er erzeugt hat. Kopiere den Prompt wortgleich, setze dein Gesicht ein, fertig. Studiere sie, und du nimmst die Struktur schneller auf, als irgendein Leitfaden sie lehren kann — auch dieser.