Ingeniería de prompts

Midjourney vs. GPT Image 2.5: GPT resuelve mejor el texto y las instrucciones complejas

underwood
underwood

Fundador de Promptsref

Fundador de Promptsref y creador de UGC con IA especializado en flujos de IA generativa, ingeniería de prompts y formación para creadores, con una audiencia de más de 40.000 personas en redes sociales.

16 min de lectura
En este artículo

Comparamos 12 imágenes generadas con el generador de imágenes con IA de Promptsref. Midjourney V8.2, GPT Image 2.5 Flare y Sunburst recibieron los mismos cuatro encargos: el retrato de una florista, una lata de té, un cartel bilingüe y una historia en cuatro viñetas. Son trabajos habituales para diseñadores, vendedores por internet y creadores de contenido. Nos fijamos en qué resultado ofrece un punto de partida más útil para cada uno.

En esta prueba, GPT Image 2.5 es la mejor opción cuando importan las palabras exactas, los objetos indicados o una secuencia completa de acciones. Midjourney destaca por la expresión, el color y el estilo de sus ilustraciones. Ambos logran materiales convincentes. No hay un ganador absoluto en realismo, ni una ventaja clara de Flare sobre Sunburst o viceversa.

Retratos: Midjourney tiene más fuerza; GPT acierta con la mirada

El primer encargo pedía una mujer mayor en la puerta de una floristería al atardecer, con dalias naranjas en los brazos y la mirada hacia una calle vacía. La luz cálida del interior debía convivir con la luz fría del exterior. La prueba exigía organizar tanto el retrato como su entorno.

Midjourney V8.2Midjourney V8.2: Buena expresión y color, pero la mujer mira a cámara en vez de hacia la calle.
Buena expresión y color, pero la mujer mira a cámara en vez de hacia la calle. Ver imagen
GPT Image 2.5 FlareGPT Image 2.5 Flare: La mirada es correcta y el encuadre muestra más de la calle.
La mirada es correcta y el encuadre muestra más de la calle. Ver imagen
GPT Image 2.5 SunburstGPT Image 2.5 Sunburst: La mirada es correcta; el formato vertical concentra la atención en la mujer y la entrada.
La mirada es correcta; el formato vertical concentra la atención en la mujer y la entrada. Ver imagen

Midjourney dirige bien la atención. El rostro arrugado, las flores naranjas y el verde oscuro del local forman una composición clara. Los marcos gastados y la pared acompañan la expresión de la mujer sin restarle protagonismo. Como retrato, es nuestro favorito.

Pero cambia el sentido de la escena. La mujer mira directamente a cámara: el momento tranquilo de observar la calle se convierte en un retrato posado ante el espectador. Los pétalos también aparecen en el alféizar, en lugar del escalón de entrada. La imagen funciona, aunque no representa el instante solicitado.

Flare y Sunburst orientan correctamente la mirada. Flare muestra más calle; Sunburst concentra el encuadre vertical en la mujer y la puerta. Ambos separan bien la calidez del interior y el frío del exterior. Sus mujeres, sin embargo, parecen algo más jóvenes y sus poses resultan más preparadas.

Elegiríamos Midjourney por la expresión y el ambiente; las imágenes de GPT si necesitamos mostrar a la florista mirando la calle. La dirección de la mirada parece un detalle, pero cambia lo que el espectador entiende que está haciendo la persona.

Producto: buenos materiales en ambos, menos errores con GPT

La lata debía tener un cuerpo naranja mate, una tapa plateada de metal cepillado y una etiqueta de papel crema con solo FIELD y JASMINE TEA. A la derecha debía haber una única hoja verde. La mesa y el fondo serían gris claro, con luz desde arriba a la izquierda.

Midjourney V8.2Midjourney V8.2: Materiales convincentes, pero con un error de texto, fondo rosa y dos hojas.
Materiales convincentes, pero con un error de texto, fondo rosa y dos hojas. Ver imagen
GPT Image 2.5 FlareGPT Image 2.5 Flare: Etiqueta y número de hojas correctos; el producto ocupa más espacio en vertical.
Etiqueta y número de hojas correctos; el producto ocupa más espacio en vertical. Ver imagen
GPT Image 2.5 SunburstGPT Image 2.5 Sunburst: Etiqueta y número de hojas correctos, con más aire en un formato cuadrado.
Etiqueta y número de hojas correctos, con más aire en un formato cuadrado. Ver imagen

Midjourney consigue reflejos metálicos, textura y volumen convincentes. La luz lateral intensa realza la lata y los tonos cálidos combinan bien. Pero el fondo se vuelve rosa, aparecen dos hojas y falta la N de JASMINE. La etiqueta incorpora texto pequeño no solicitado y la sombra marcada cae hacia la izquierda, en contra de la iluminación indicada.

Las dos versiones de GPT respetan la etiqueta, la única hoja y el fondo gris. Se distinguen el metal cepillado, el papel y la pintura mate, y la sombra bajo la lata resulta natural. Flare presenta el producto más grande en un encuadre vertical. Sunburst deja más espacio alrededor en formato cuadrado, útil si hay que añadir otros elementos a la composición.

Al ampliar, los fondos grises de ambas imágenes de GPT muestran una textura fina. La mesa de Midjourney también tiene grano. Conviene revisar esas zonas cuando el diseño necesita un fondo limpio: una textura que aporta realismo a la lata puede sobrar en el espacio que la rodea.

Para esta propuesta de producto elegiríamos GPT. Las tres imágenes parecen latas metálicas, pero GPT también respeta el nombre y la disposición. La de Midjourney sirve como referencia de iluminación y color, aunque habría que corregir la etiqueta y la escena.

Carteles y tipografía: si el texto importa, empieza por GPT

El cartel de una librería debía incluir cuatro bloques: “今晚,读一本书”, “AN EVENING OF READING”, “FRIDAY · 19:30–21:00” y “免费入场 · FREE ENTRY”, además de un libro abierto y una luna creciente. La prueba combina chino, inglés, cifras y una jerarquía visual que permita encontrar la información.

Midjourney V8.2Midjourney V8.2: Aparecen el libro y la luna, pero falta todo el texto del evento.
Aparecen el libro y la luna, pero falta todo el texto del evento. Ver imagen
GPT Image 2.5 FlareGPT Image 2.5 Flare: Los cuatro bloques están completos y bien jerarquizados.
Los cuatro bloques están completos y bien jerarquizados. Ver imagen
GPT Image 2.5 SunburstGPT Image 2.5 Sunburst: Texto completo y una ilustración del libro más sencilla.
Texto completo y una ilustración del libro más sencilla. Ver imagen

Midjourney dibuja el libro y la luna con una paleta contenida, pero omite todos los textos del evento. El resultado es una ilustración sobre la que un diseñador puede componer el cartel. La ausencia de información es un problema distinto de preferir otra tipografía.

Flare y Sunburst incluyen los cuatro bloques completos. En la revisión visual no encontramos errores evidentes de escritura ni en el horario. El título chino es el elemento más grande, seguido del subtítulo inglés; la ilustración queda en el centro y los detalles, abajo. Se entiende el tema y se encuentra la hora sin esfuerzo.

Flare añade más líneas a las páginas del libro; Sunburst simplifica el dibujo. Es una diferencia menor frente a lo que hace útiles ambas imágenes: contienen todas las palabras necesarias. En este cartel bilingüe, las dos versiones de GPT ganan con claridad.

Con Midjourney, una opción práctica es generar la ilustración y añadir la tipografía después. Su guía oficial sobre texto recomienda palabras o frases cortas e indica que funciona mejor con el alfabeto latino estándar. GPT puede resolver imagen y texto juntos, aunque conviene componer el texto final en un programa de diseño si hay que cambiar fechas, precios o nombres con frecuencia.

Historias en viñetas: GPT conserva la trama; Midjourney pierde acciones clave

El último encargo era una historia de cuatro viñetas. Una mujer de pelo oscuro corto y chubasquero amarillo pasea con un perro blanco de una oreja negra. Cuando empieza a llover, abre un paraguas rojo. Después se arrodilla para cubrir solo al perro, mientras su propia cabeza queda bajo la lluvia. Al final descansan en un banco y el perro apoya la cabeza en su regazo. El paraguas debe estar cerrado en la primera y la última viñeta.

Midjourney V8.2Midjourney V8.2: Estilo atractivo, pero el paraguas empieza abierto y el perro desaparece al final.
Estilo atractivo, pero el paraguas empieza abierto y el perro desaparece al final. Ver imagen
GPT Image 2.5 FlareGPT Image 2.5 Flare: Las cuatro acciones se entienden; la correa del hombro no se conserva con claridad.
Las cuatro acciones se entienden; la correa del hombro no se conserva con claridad. Ver imagen
GPT Image 2.5 SunburstGPT Image 2.5 Sunburst: Los cuatro momentos están presentes, aunque cambia el cierre del chubasquero.
Los cuatro momentos están presentes, aunque cambia el cierre del chubasquero. Ver imagen

Hay tres cosas que comprobar: si aparecen los objetos necesarios, si las acciones son correctas y si reconocemos a la misma mujer y al mismo perro. Mantener el estilo de dibujo no basta para contar bien una historia.

Los colores apagados, el trazo suelto y la textura de papel antiguo de Midjourney encajan en un cuento ilustrado. Pero el paraguas ya está abierto al principio. En la tercera viñeta cubre también a la mujer y, en la última, desaparecen tanto el perro como el paraguas. La oreja negra tampoco se mantiene claramente. Se pierden el gesto de mojarse para proteger al perro y el desenlace afectuoso, dos puntos centrales del relato.

Flare y Sunburst conservan los cuatro momentos: abrir el paraguas, colocarlo sobre el perro y terminar juntos en el banco. El chubasquero, el pelo corto y la oreja negra siguen siendo reconocibles, y ambos mantienen la ilustración pintada solicitada. Las imágenes de GPT cuentan esta historia; las de Midjourney cambian partes esenciales.

También hay detalles que corregir en GPT. En Flare, la correa sobre el hombro de las primeras viñetas deja de distinguirse después. En Sunburst, el chubasquero pasa de abierto a cerrado. Las mujeres parecen más jóvenes que la adulta joven solicitada. Como borradores de un guion gráfico, transmiten las acciones. Para un libro terminado habría que unificar la edad aparente y los detalles de la ropa.

Portadas y series ilustradas: aprovechar las referencias de estilo de Midjourney

Si varias portadas deben compartir paleta, iluminación y trazo, la referencia de estilo de Midjourney ofrece una forma práctica de mantener una dirección visual. Se elige una imagen de referencia y se cambia el tema de cada nueva composición.

Según la documentación oficial, Style Reference transmite rasgos de color, textura, técnica y luz, con un peso ajustable para regular su influencia. Si el acabado habitual de Midjourney se impone demasiado, el modo Raw reduce esa intervención automática.

En una serie conviene distinguir qué se quiere mantener. Compartir una apariencia de acuarela es una cuestión de estilo; conservar el mismo personaje o envase es una cuestión de identidad del sujeto. Style Reference sirve para lo primero. Por sí solo, no garantiza la misma cara o el mismo producto en todas las imágenes.

Flare o Sunburst: elige el encuadre que necesita tu trabajo

Ambos escriben bien las etiquetas y el cartel, y conservan las acciones principales de la historia. Las diferencias más útiles para elegir entre estos resultados son el tamaño del sujeto, el espacio de fondo y el detalle de la ilustración.

EncargoFlareSunburst
Retrato de la floristaMás contexto de la calleEncuadre vertical más cerrado sobre la mujer y la puerta
Lata de téProducto grande en vertical; etiqueta correctaMás espacio en formato cuadrado; etiqueta correcta
Cartel bilingüeTexto completo; más líneas en el libroTexto completo; dibujo del libro más sencillo
Historia de cuatro viñetasAcciones principales completas; cambia la correaAcciones principales completas; cambia el cierre del chubasquero

Estas imágenes no justifican elegir siempre una versión sobre la otra. Para la florista, Flare sirve si interesa mostrar la calle y Sunburst si se quiere centrar la atención en la mujer. Para la lata, la elección depende de si el diseño pide un formato vertical o cuadrado y de cuánto espacio hace falta alrededor del producto.

Qué modelo elegir para tu próxima imagen

Empezaríamos por GPT Image 2.5 para una propuesta de producto con una etiqueta precisa, un cartel con texto o un guion convertido en viñetas. En esos trabajos, los nombres, las cantidades y las acciones no deberían perderse durante la generación. GPT conserva mejor esa información en nuestras pruebas.

Midjourney merece una oportunidad para retratos expresivos y portadas ilustradas que admitan cierta interpretación. Su florista es nuestro retrato favorito y su trazo de cuento tiene encanto. Esas cualidades visuales concretas son una buena razón para elegirlo.

La elección depende de lo que necesitas entregar: una imagen cuyo ambiente te guste o una imagen que comunique un contenido ya decidido. Para lo primero, consideraríamos Midjourney. Para lo segundo, estos resultados nos llevan a GPT Image 2.5.


Cómo se hizo la comparación

Evaluamos una imagen compartida por modelo para cada uno de los cuatro encargos, generados el 21 de septiembre de 2026. Los prompts están en las páginas enlazadas de cada trabajo. El creador confirmó Midjourney V8.2; cada tarea solicitaba cuatro imágenes, pero aquí evaluamos solo la compartida. GPT utilizó 1K y relación de aspecto automática. Los tamaños y encuadres varían: las conclusiones se refieren a estas imágenes, no al rendimiento medio de múltiples intentos. Las referencias de estilo son una función documentada, no utilizada en estos cuatro encargos.

Sobre el autor

underwood

underwood

Fundador de Promptsref

Fundador de Promptsref y creador de UGC con IA especializado en flujos de IA generativa, ingeniería de prompts y formación para creadores, con una audiencia de más de 40.000 personas en redes sociales.