Ingeniería de prompts

Cómo convertir una imagen en un prompt de IA y lograr una recreación más fiel

underwood
underwood

Fundador de Promptsref

Fundador de Promptsref y creador de UGC con IA especializado en flujos de IA generativa, ingeniería de prompts y formación para creadores, con una audiencia de más de 40.000 personas en redes sociales.

8 min de lectura

Una guía para reconstruir imágenes mediante prompts que describen composición, luz, cámara y jerarquía visual, con una comparación de los principales modelos.

En este artículo

Reconstruir un prompt a partir de una imagen no consiste en acumular adjetivos. El trabajo real es traducir la composición, la luz, la cámara, el color y la jerarquía visual en instrucciones que un modelo pueda ejecutar.

Cualquier herramienta multimodal puede describir una imagen en pocos segundos. El problema aparece al usar esa descripción para generar otra: el resultado suele conservar el tema general, pero pierde la composición y el carácter de la referencia.

La causa está en el tipo de análisis. Una descripción convencional responde qué aparece en la imagen. Una recreación precisa exige entender por qué la imagen se ve de esa manera.

Una fotografía urbana puede incluir una persona, un coche y varios edificios. Reconocerlos correctamente no basta. La identidad de la escena quizá dependa de una figura desplazada hacia la derecha, una cámara baja, la luz plana de un día nublado y un abrigo rojo que concentra todo el color saturado. Lo que hay que conservar son esas relaciones.

“Bonita” es una valoración, no una instrucción

La investigación sobre estética visual suele distinguir entre calidad técnica —desenfoque, ruido o compresión— y atractivo estético. El proyecto NIMA de Google Research no clasificó las imágenes simplemente como buenas o malas, sino que trató de predecir la distribución de las puntuaciones humanas. El gusto visual contiene una parte inevitablemente subjetiva. Google Research: NIMA

Para reconstruir una imagen conviene leerla en cuatro niveles.

El primero es el contenido: sujeto, acción, expresión, ropa, objetos y relaciones. Detectar un abrigo rojo es solo el comienzo. La observación útil es que funciona como único punto de alta saturación sobre un fondo apagado.

El segundo es la estructura espacial: posición y escala del sujeto, primer plano, plano medio y fondo, espacio negativo, obstrucciones, ángulo de cámara y perspectiva. Un gran angular que exagera las distancias y un teleobjetivo que comprime el espacio sitúan al espectador en lugares distintos.

El tercero reúne la información óptica: dirección y dureza de la luz, exposición, sombras, profundidad de campo, temperatura de color y reflejos de los materiales. “Iluminación cinematográfica suave” aporta poco. “Luz difusa de una ventana a la izquierda, con una sombra poco profunda en el lado derecho del rostro” describe una situación física.

El último nivel es el estilo y el estado de ánimo. Fotografía, ilustración, 3D y óleo son medios; editorial de moda, documental, anuncio de estudio y foto casual de móvil son convenciones visuales. Una ligera inclinación, la textura de la piel, el movimiento o una obstrucción accidental pueden ser más importantes para la identidad de la referencia que la palabra “fotorrealista”.

Un estudio publicado en 2022 en IEEE Transactions on Image Processing también trató el contenido semántico, el estilo artístico y la composición como componentes centrales de la evaluación estética. Composition and Style Attributes Guided Image Aesthetic Assessment

La belleza rara vez depende de la cantidad de detalles. Depende de la jerarquía: qué se ve primero, qué sostiene el foco y qué puede retroceder.

Invertir un prompt no significa recuperar la frase original

Una misma imagen puede corresponder a muchos prompts. Incluso conociendo el texto de origen, un cambio de modelo, semilla o configuración puede producir un resultado distinto.

Una investigación sobre Prompt Inversion presentada en CVPR 2024 describe la tarea como una búsqueda dentro de un espacio discreto de prompts que crece de forma exponencial. El objetivo es encontrar una instrucción interpretable que represente la imagen, no adivinar la frase exacta que escribió su autor. Prompting Hard or Hardly Prompting

El proceso debe comenzar con hechos visibles: posición, acción, ropa y objetos. Conviene aplazar palabras como “premium”, “onírico” o “cinematográfico” y no inventar identidades, ubicaciones o cámaras sin pruebas.

Después se reconstruye la geometría: ubicación del sujeto, dirección del cuerpo y la mirada, relación entre planos, espacio vacío, recorte y perspectiva. A continuación se describen la fuente principal de luz, la diferencia de exposición entre sujeto y fondo, las sombras, la paleta, los reflejos y las superficies.

El estado de ánimo se añade al final y debe quedar ligado a evidencias visuales. Si una escena parece solitaria, hay que precisar si se debe al espacio vacío, a una figura de espaldas, a una paleta fría o a una iluminación escasa.

También es útil separar la información en tres grupos: rasgos que deben conservarse, detalles que pueden variar y errores que deben evitarse.

Fotografía urbana de plano medio y ángulo bajo en un día nublado. Una mujer con abrigo largo rojo ocupa el tercio derecho; su cuerpo mira hacia la calle mientras gira la cabeza hacia la cámara. Dejar un amplio espacio ambiental a la izquierda. Mantener el entorno en azul grisáceo y baja saturación, con el abrigo como único color intenso. El pavimento mojado recoge un reflejo cálido y tenue de una tienda situada detrás. Conservar la composición descentrada y la perspectiva ligeramente angular. Evitar sol duro, pose frontal y fondo abarrotado.

No hace falta enumerar todo. Primero se fijan sujeto, composición y relación cromática; después se añaden cámara, luz y restricciones.

JSON frente a lenguaje natural: importa más la información

A veces se presenta JSON como un idioma superior para los modelos de imagen. Sus detractores responden que llaves, comillas y nombres de campos solo consumen tokens. Ambas posturas exageran el peso del formato.

JSON resulta útil porque convierte el análisis en una especificación editable. Permite revisar por separado sujeto, pose, composición, lente, iluminación, paleta y restricciones. Facilita detectar ausencias, cambiar una variable, comparar versiones e integrar el resultado en software.

El lenguaje natural tiene menos sobrecarga y se parece a los ejemplos de la documentación de la mayoría de los modelos. Su riesgo es organizativo: sin un análisis previo, es fácil describir el sujeto y el estilo y olvidar la geometría, la luz o las restricciones.

Si ambos formatos contienen la misma información visual y las mismas prioridades, no existe una diferencia esencial. Un JSON detallado supera a una frase vaga porque conserva más condiciones de la imagen, no porque las llaves tengan un efecto especial.

Lo que conviene eliminar es la repetición, las suposiciones sin fundamento y las instrucciones contradictorias. No tiene sentido borrar composición, luz o material solo para acortar el prompt.

Un flujo práctico guarda el análisis como datos estructurados y genera después una versión en lenguaje natural adaptada al modelo. Image to Prompt de Promptsref ofrece ambas salidas a partir del mismo análisis visual.

El modelo decide el último tramo

En agosto de 2026, Midjourney, GPT Image 2 y la familia Nano Banana abordan las referencias de forma diferente.

ModeloPrincipal fortalezaComportamiento al recrear
MidjourneyExploración estética y variaciones creativasConserva la idea visual, pero reinterpreta libremente los detalles
GPT Image 2Entrada de alta fidelidad, edición precisa y maquetaciónAdecuado para mantener sujeto, composición, producto y estructura textual
Nano BananaVarias referencias, edición conversacional y coherenciaApropiado para acercarse a la referencia mediante iteraciones

La documentación de Midjourney presenta Image Prompts como referencias que influyen en contenido, composición y color, pero sirven de inspiración para una imagen nueva, no como un mecanismo de copia exacta. Midjourney Image Prompts

Describe tiene una limitación parecida: propone lenguaje creativo y no pretende reproducir con precisión la imagen subida. Midjourney Describe Es una buena opción para explorar qué más podría llegar a ser una imagen, no para fijar cada elemento.

GPT Image 2 admite imagen y texto para generar y editar. Según la documentación de OpenAI, procesa las entradas visuales con alta fidelidad en los flujos de referencia y edición. OpenAI: fidelidad de la imagen de entrada La referencia conserva geometría y textura; el prompt indica qué debe permanecer y qué puede cambiar.

Nano Banana destaca cuando intervienen varias referencias o una serie de cambios conversacionales. Google lo describe como una capacidad multimodal nativa para generar, editar e iterar con texto e imágenes. Nano Banana 2 prioriza el procesamiento de varias referencias y la coherencia, mientras Nano Banana Pro se orienta a instrucciones complejas y control preciso. Google: generación de imágenes con Nano Banana

Midjourney sirve mejor para explorar alternativas. GPT Image 2 y Nano Banana están mejor preparados para reducir la distancia entre una referencia y un resultado controlado.

La precisión llega con la comparación

Incluso un buen análisis rara vez produce la coincidencia más cercana en el primer intento. Conviene comparar el resultado con la referencia por etapas: primero sujeto y composición, después cámara e iluminación y, por último, materiales y detalles.

Modificar uno o dos desajustes importantes en cada ronda permite saber qué cambio ha funcionado. Reescribir todo el prompt a la vez borra esa información.

El texto puede reconstruir buena parte de la lógica visual de una imagen, pero no almacena cada píxel. Las recreaciones más fieles no nacen de una frase perfecta, sino de integrar referencia visual, análisis estructurado y generación iterativa en un mismo flujo de trabajo.

Sobre el autor

underwood

underwood

Fundador de Promptsref

Fundador de Promptsref y creador de UGC con IA especializado en flujos de IA generativa, ingeniería de prompts y formación para creadores, con una audiencia de más de 40.000 personas en redes sociales.