Prompt engineering para generación de imágenes con IA
Cómo funciona de verdad el prompt engineering para generar imágenes con IA: estructura, orden, especificidad y el ciclo de revisión — explicados con ejemplos reales de fotos de lujo.
"Prompt engineering" suena a un puesto de trabajo que alguien inventó para cobrar más por hora. Quita la palabra de moda y queda una afirmación simple: las palabras que le das a un modelo de imagen son una especificación, y mejores especificaciones producen mejores resultados. Esa afirmación resulta ser cierta, y esta guía cubre lo que de verdad mueve la aguja.
Todo lo de aquí se aplica a Google Gemini, para el que desarrollamos, pero los principios se trasladan a cualquier modelo de imagen moderno.
El modelo rellena cada hueco que dejas
Un modelo de imagen tiene que renderizar una escena completa: cada superficie, cada fuente de luz, cada tejido. Todo lo que tu prompt no especifica lo decide el modelo por ti — y lo decide recurriendo a la media estadística de sus datos de entrenamiento. Luz media. Composición media. Ropa media.
Por eso los prompts vagos resultan genéricos. No porque el modelo sea débil, sino porque le delegaste todas las decisiones.
El prompt engineering es simplemente decidir más cosas tú mismo. La ropa exacta del sujeto y su estado — chaqueta cerrada o abierta. El entorno con los materiales nombrados — mármol, teca, acero cepillado. La fuente de luz y su dirección. La distancia y el ángulo de la cámara. El formato y el acabado.
El orden importa menos que la exhaustividad
La gente se obsesiona con el orden de los tokens y las palabras mágicas. En la práctica, un prompt completo en lenguaje llano gana siempre a un prompt incompleto con sintaxis de iniciado. El modelo no necesita "8k, obra maestra, en tendencia" — necesita saber QUÉ ES la escena.
Una comprobación útil: lee tu prompt y pregúntate qué tendría que preguntarte todavía un fotógrafo humano. "Hombre de traje en un hotel" deja al fotógrafo preguntando: qué traje, de qué color, abotonado o abierto, qué hotel, vestíbulo o azotea, mañana o noche, primer plano o cuerpo entero? Cada pregunta sin responder es una decisión que acabas de entregarle a la media.
La estructura de cinco capas
Casi todos los prompts sólidos de nuestro archivo siguen el mismo esqueleto:
1. Encuadre: "foto espontánea mía" — establece que hay un sujeto, fotografiado con naturalidad en lugar de posado en estudio.
2. Acción y pose: saliendo de, apoyado en, ajustándose un puño, a media zancada. Los verbos crean fotografías; estar de pie crea fotos de carnet.
3. Vestuario, desglosado: cada prenda nombrada con color, material y estado. "Bomber negra ligeramente abierta sobre una camiseta blanca" — el estado de la cremallera está haciendo un trabajo real ahí.
4. Entorno, materiales primero: "vestíbulo de mármol con puertas de ascensor de latón" gana a "hotel elegante", porque el modelo renderiza materiales, no adjetivos.
5. Acabado técnico: formato, grano, condición de luz. "Estética granulada, hora dorada, 9:16" fija todo el ambiente en siete palabras.
Las restricciones también son prompts
La mitad del prompt engineering consiste en impedir cosas. Los modelos derivan hacia los clichés — personas de más al fondo, joyas que no pediste, gestos que resultan inquietantes. Las restricciones negativas explícitas escritas entre paréntesis mantienen la línea: "(nadie más en la foto)" aparece en casi todos los prompts del archivo exactamente por esto.
Si generas una serie, las restricciones la mantienen coherente. El mismo corte de pelo descrito igual. El mismo reloj. La misma gradación de color. La coherencia entre imágenes es lo que hace creíble un feed, y viene enteramente de restricciones repetidas.
El ciclo de revisión
Las primeras generaciones son borradores. La habilidad está en diagnosticar qué falla en términos de prompt:
La imagen se ve plana — no especificaste una dirección de luz. La ropa parece barata — nombraste una categoría ("traje") en lugar de una prenda ("traje cruzado de lana antracita, chaqueta abierta"). La escena está recargada — nunca dijiste qué NO hay. La cara no cuadra — eso es tu foto de referencia, no el prompt; usa una toma limpia, bien iluminada y de frente.
Cambia una capa por revisión. Si reescribes el prompt entero en cada intento, no aprendes nada sobre qué cambio importó.
Cuándo dejar de hacer engineering y empezar a copiar
Aquí está la economía honesta: afinar un solo prompt fiable cuesta de 20 a 40 generaciones de iteración. Eso es una tarde por escena. El prompt engineering es una habilidad real — pero para la mayoría es un medio para un fin, y el fin es la foto.
Esa es toda la premisa de PROMPTMVSTR: el archivo son cientos de prompts que ya han pasado por ese ciclo, cada uno mostrado junto a la imagen exacta que produjo. Copia el prompt literalmente, pon tu cara, listo. Estúdialos y absorberás la estructura más rápido de lo que cualquier guía puede enseñarla — esta incluida.