Midjourney vs. GPT Image 2.5: GPT überzeugt bei Text und komplexen Vorgaben
Gründer von Promptsref
Gründer von Promptsref und AI-UGC-Creator mit Fokus auf generative KI-Workflows, Prompt Engineering und Creator Education sowie einer Social-Media-Reichweite von über 40.000 Menschen.
In diesem Artikel
- Porträts: Midjourney trifft den Ausdruck, GPT die Blickrichtung
- Produktbilder: gute Materialien bei beiden, weniger Abweichungen bei GPT
- Plakate und Schrift: Wenn der Wortlaut zählt, zuerst GPT
- Bildergeschichten: GPT hält die Handlung zusammen, Midjourney lässt Wichtiges aus
- Bildserien und Cover: Midjourneys Stilreferenzen sinnvoll einsetzen
- Flare oder Sunburst: Der passende Bildaufbau entscheidet
- Welches Modell passt zur nächsten Aufgabe?
Wir haben zwölf Bilder aus dem KI-Bildgenerator von Promptsref verglichen. Midjourney V8.2, GPT Image 2.5 Flare und Sunburst erhielten dieselben vier Aufgaben: eine Floristin porträtieren, eine Teedose zeigen, ein zweisprachiges Plakat gestalten und eine Geschichte in vier Bildern erzählen. Das sind typische Aufgaben für Design, Onlinehandel und Content-Produktion. Uns interessiert, welches Ergebnis sich jeweils am besten zur Weiterarbeit eignet.
Bei genauen Texten, vorgegebenen Gegenständen und vollständigen Handlungsabläufen ist GPT Image 2.5 in diesem Vergleich die bessere Wahl. Midjourney punktet mit Ausdruck, Farben und Zeichenstil. Glaubwürdige Materialien beherrschen beide. Weder beim Realismus noch im Vergleich zwischen Flare und Sunburst gibt es einen durchgängigen Sieger.
Porträts: Midjourney trifft den Ausdruck, GPT die Blickrichtung
Die erste Aufgabe zeigt eine ältere Frau vor einem Blumenladen in der Abenddämmerung. Sie hält orangefarbene Dahlien und blickt auf eine leere Straße. Warmes Innenlicht und kühles Abendlicht sollen gleichzeitig sichtbar sein. Gefragt sind ein überzeugendes Porträt und eine stimmige Anordnung der Umgebung.



Midjourney lenkt den Blick sicher. Das faltige Gesicht, die orangefarbenen Blumen und das dunkle Grün des Ladens setzen klare Schwerpunkte. Abgenutzte Fensterrahmen und Mauerwerk passen zum Ausdruck der Frau, ohne sie zu überlagern. Als Porträt gefällt uns dieses Bild am besten.
Allerdings verändert es die Szene. Die Frau schaut direkt in die Kamera. Aus einem stillen Blick auf die Straße wird ein Porträt, das sich an den Betrachter richtet. Auch die Blütenblätter liegen auf dem Fensterbrett statt auf der Eingangsstufe. Das Bild wirkt, zeigt aber nicht den gewünschten Moment.
Flare und Sunburst halten die Blickrichtung ein. Flare zeigt mehr von der Straße, Sunburst konzentriert das Hochformat auf Frau und Eingang. Beide trennen warmes Innenlicht und kühles Außenlicht klar. Die Frauen wirken jedoch etwas jünger und ihre Posen stärker inszeniert.
Für Ausdruck und Stimmung würden wir Midjourney wählen; soll die Floristin tatsächlich auf die Straße schauen, nehmen wir GPT. Die Blickrichtung ist ein kleines Detail mit großer Wirkung: Sie entscheidet darüber, wie wir die Handlung der Person verstehen.
Produktbilder: gute Materialien bei beiden, weniger Abweichungen bei GPT
Die Teedose soll einen mattorangefarbenen Körper, einen gebürsteten silbernen Deckel und ein cremefarbenes Papieretikett mit ausschließlich FIELD und JASMINE TEA haben. Rechts liegt genau ein grünes Blatt. Tisch und Hintergrund sind hellgrau, das Licht fällt von links oben ein.



Midjourney erzeugt glaubwürdige Metallreflexe, Oberflächen und Helligkeitsverläufe. Das kräftige Seitenlicht betont die Dose, die warmen Farben passen zusammen. Doch der Hintergrund wird rosa, aus einem Blatt werden zwei, und in JASMINE fehlt das N. Auf dem Etikett steht zusätzlicher kleiner Text. Der deutliche Schatten fällt nach links und widerspricht damit der vorgegebenen Lichtrichtung.
Beide GPT-Versionen setzen Etikett, einzelnes Blatt und grauen Hintergrund korrekt um. Gebürstetes Metall, Papier und matter Lack sind unterscheidbar, auch der Schatten unter der Dose wirkt natürlich. Flare zeigt das Produkt größer im Hochformat. Sunburst lässt im quadratischen Bild mehr Platz, was für zusätzliche Gestaltungselemente praktisch sein kann.
In der vergrößerten Ansicht zeigen beide grauen GPT-Hintergründe eine feine Struktur. Auch Midjourneys Tisch hat eine sichtbare Körnung. Für Gestaltungen mit sauberem Hintergrund lohnt sich ein genauer Blick: Was auf der Dose realistisch wirkt, kann in der umgebenden Freifläche stören.
Für dieses Produktkonzept würden wir GPT nehmen. Alle drei Bilder zeigen eine glaubwürdige Metalldose, doch GPT hält zusätzlich Produktname und Anordnung ein. Midjourneys Bild eignet sich als Licht- und Farbreferenz; Etikett und Aufbau müssten korrigiert werden.
Plakate und Schrift: Wenn der Wortlaut zählt, zuerst GPT
Das Buchhandlungsplakat soll vier Textblöcke enthalten: „今晚,读一本书“, „AN EVENING OF READING“, „FRIDAY · 19:30–21:00“ und „免费入场 · FREE ENTRY“. Dazu kommen ein aufgeschlagenes Buch und eine Mondsichel. Die Aufgabe verbindet chinesische Schrift, Englisch, Zahlen und eine gut lesbare Informationshierarchie.



Midjourney zeichnet Buch und Mond in zurückhaltenden Farben, lässt aber sämtliche Veranstaltungstexte weg. Das Ergebnis ist eine Illustration, auf der ein Designer noch das Plakat setzen könnte. Fehlende Informationen sind ein anderes Problem als eine Schrift, die einem nicht gefällt.
Flare und Sunburst liefern alle vier Textblöcke vollständig. Bei der Sichtprüfung fanden wir keine offensichtlichen Schreibfehler oder falschen Uhrzeiten. Die chinesische Überschrift ist am größten, darunter steht die englische Unterzeile. In der Mitte liegt die Illustration, unten folgen die Veranstaltungsdetails. Thema und Uhrzeit lassen sich ohne Suchen erfassen.
Flare zeichnet mehr Linien in die Buchseiten, Sunburst hält die Darstellung einfacher. Für die Nutzbarkeit zählt vor allem, dass alle notwendigen Wörter vorhanden sind. Beim zweisprachigen Veranstaltungsplakat liegen beide GPT-Versionen klar vorn.
Mit Midjourney bietet es sich an, zunächst die Illustration zu erzeugen und die Schrift anschließend separat zu setzen. Die offizielle Anleitung zur Textgenerierung empfiehlt kurze Wörter oder Formulierungen und nennt das lateinische Standardalphabet als Stärke. GPT kann Bild und Text gemeinsam liefern. Müssen Daten, Preise oder Namen häufig geändert werden, ist der abschließende Schriftsatz in einem Designprogramm dennoch leichter zu pflegen.
Bildergeschichten: GPT hält die Handlung zusammen, Midjourney lässt Wichtiges aus
Die letzte Aufgabe erzählt eine Geschichte in vier Bildern. Eine Frau mit dunklem Bob und gelbem Regenmantel geht mit einem weißen Hund spazieren, der ein schwarzes Ohr hat. Als es regnet, öffnet sie einen roten Schirm. Dann kniet sie nieder und hält ihn nur über den Hund, während ihr eigener Kopf nass wird. Später sitzen beide auf einer Bank, der Hund legt den Kopf auf ihren Schoß. Im ersten und letzten Bild soll der Schirm geschlossen sein.



Wir prüfen drei Dinge: Sind die notwendigen Gegenstände vorhanden? Stimmen die Handlungen? Bleiben Frau und Hund als dieselben Figuren erkennbar? Ein einheitlicher Zeichenstil allein ergibt noch keine schlüssige Geschichte.
Midjourneys gedämpfte Farben, lockere Linien und die Anmutung alten Papiers passen gut zu einem Bilderbuch. Doch der Schirm ist schon zu Beginn offen. Im dritten Bild schützt er auch die Frau, im letzten fehlen Hund und Schirm ganz. Das schwarze Ohr bleibt ebenfalls nicht klar erhalten. Damit verschwinden der Verzicht auf den eigenen Regenschutz und das liebevolle Ende: zwei zentrale Momente der Geschichte.
Flare und Sunburst bewahren die vier Stationen: den Schirm öffnen, ihn über den Hund halten und schließlich gemeinsam auf der Bank sitzen. Regenmantel, Bob und schwarzes Ohr bleiben erkennbar. Auch der gewünschte gemalte Illustrationsstil bleibt erhalten. GPT erzählt diese Geschichte; Midjourney verändert wesentliche Teile davon.
Auch bei GPT gibt es kleinere Brüche. Flares Schulterriemen aus den ersten Bildern ist später nicht mehr klar zu sehen. Sunbursts Regenmantel wechselt von offen zu geschlossen. Beide Frauen wirken jünger als die vorgegebene junge Erwachsene. Als Storyboard-Entwürfe vermitteln die Bilder den Ablauf. Für ein fertiges Bilderbuch müssten Alterseindruck und Kleidungsdetails vereinheitlicht werden.
Bildserien und Cover: Midjourneys Stilreferenzen sinnvoll einsetzen
Sollen mehrere Cover dieselbe Farbpalette, Lichtstimmung und Zeichenweise teilen, bietet Midjourneys Stilreferenz einen praktischen Ansatz für eine gemeinsame Bildsprache. Man wählt ein Referenzbild und variiert das Motiv für die weiteren Bilder.
Laut offizieller Dokumentation überträgt Style Reference Merkmale von Farbe, Textur, Medium und Licht. Über die Gewichtung lässt sich der Einfluss steuern. Ist Midjourneys typische Gestaltung zu dominant, reduziert der Raw-Modus den automatischen Stileinfluss.
Bei Serien kommt es darauf an, was gleich bleiben soll. Ein ähnlicher Aquarell-Look betrifft den Stil; dieselbe Person oder Verpackung betrifft die Identität des Motivs. Style Reference ist für Ersteres gedacht. Die Funktion allein garantiert nicht dasselbe Gesicht oder Produkt in jedem Bild.
Flare oder Sunburst: Der passende Bildaufbau entscheidet
Beide Versionen schreiben Etiketten und Plakattexte richtig und bewahren die wichtigsten Ereignisse der Geschichte. Für die Auswahl zwischen diesen Ergebnissen sind Motivgröße, Hintergrundfläche und Detailgrad der Illustration aufschlussreicher.
| Aufgabe | Flare | Sunburst |
|---|---|---|
| Floristin | Mehr von der Straße sichtbar | Engeres Hochformat mit Frau und Eingang |
| Teedose | Großes Produkt im Hochformat; korrektes Etikett | Mehr Freiraum im Quadrat; korrektes Etikett |
| Zweisprachiges Plakat | Vollständiger Text; mehr Linien im Buch | Vollständiger Text; schlichtere Buchzeichnung |
| Vier Bilder | Haupthandlung vollständig; Schulterriemen verändert sich | Haupthandlung vollständig; Mantel wechselt von offen zu geschlossen |
Diese Bilder geben keinen Anlass, grundsätzlich eine Version vorzuziehen. Bei der Floristin eignet sich Flare, wenn die Straße wichtig ist, und Sunburst, wenn die Frau im Mittelpunkt stehen soll. Bei der Dose entscheidet das Layout: Hochformat oder Quadrat, mit wenig oder viel Platz um das Produkt.
Welches Modell passt zur nächsten Aufgabe?
Für ein Produktkonzept mit korrektem Etikett, ein Veranstaltungsplakat mit Text oder ein Storyboard würden wir mit GPT Image 2.5 beginnen. Bei diesen Aufgaben müssen Namen, Mengen und Handlungen erhalten bleiben. In unserem Vergleich bewahrt GPT mehr dieser Informationen.
Für ausdrucksstarke Porträts und Coverillustrationen, die eine freie Interpretation vertragen, bleibt Midjourney interessant. Die Floristin ist unser liebstes Porträt, und die Bilderbuchlinien haben Charme. Diese konkreten visuellen Qualitäten sprechen für das Modell.
Entscheidend ist, was am Ende gebraucht wird: ein Bild mit einer überzeugenden Stimmung oder eines, das bereits festgelegte Inhalte genau vermittelt. Für Ersteres würden wir Midjourney berücksichtigen. Für Letzteres führen uns diese Ergebnisse zu GPT Image 2.5.
Hinweise zum Vergleich
Wir bewerteten je ein geteiltes Bild pro Modell und Aufgabe, erstellt am 21. September 2026. Die Prompts stehen auf den verlinkten Werkseiten. Der Ersteller bestätigte Midjourney V8.2. Jeder Auftrag forderte vier Bilder an; bewertet wird hier nur das geteilte Bild. GPT war auf 1K und automatisches Seitenverhältnis eingestellt. Größen und Bildausschnitte unterscheiden sich. Die Urteile gelten für diese Bilder, nicht für die durchschnittliche Leistung bei wiederholten Versuchen. Stilreferenzen sind eine dokumentierte Funktion und wurden in den vier Aufgaben nicht getestet.
