Ein direkter Vergleich von Z-Image turbo und Nano Banana 2.5.
Beispiel 1: Für mein Projekt "Remarkable Landscapes" habe ich unterschiedliche möglichst plausibel wirkende Phantasie-Landschaften erstellt. Eine Szene aus dieser Serie, "Im Trompetentrichter-Wald" verwende ich hier um einige Unterschiede zwischen den beiden KI-Modellen sichtbar zu machen.
Meine Arbeitsweise mit generativer KI hat sich in den letzten Monaten immer wieder gewandelt und verfeinert. Eine besonders zielgerichtete Methode ist für mich derzeit, der KI konkrete Beispiele und damit "gestalterische Anker" zu zeigen, um die für mich besonders Interessanten KI-Fähigkeiten der Musterkennung zu nutzen: Hier ein 3D Model einer fiktiven trompetenförmigen Pflanze mit Mossbewuchs am Stammansatz.
Diese baumartige Struktur soll eine Muster-Vorlage für einen hohen Wald in einer hügeligen, fremdartigen Landschaft mit einem kleinen Fluß im Bildzentrum werden ...
... bei meinen Landschaftsbildern sind mir überzeugende Details, wie Bewuchs, Oberflächenstrukturen und Bodenbeschaffenheit besonders wichtig. Bei offensichtlich "außerirdischen" Landschaften erfinde ich mit Hilfe der KI daher auch eine komplette Flora (und Fauna) um eine möglichst detailreiche Umwelt zu erschaffen:
Das fertige Bild "Im Trompetentrichter-Wald", umgesetzt mit Nano Banana 2.5, Bildbearbeitungen mit Affinity 3.2
Ein schönes Beispiel, wie unglaublich genau das semantische Bild- und Sprachverständnis von Googles Gemini aktuell schon ist. Ich habe die KI gebeten mir eine Vergrößerung von dem Tausendfüßler zu generieren - man könnte theoretisch bis ins Mikroskopische hinein zoomen!
Ein Vergleich mit einem Ergebnis von "z-image" mit der Software ComfyUI erstellt. Diese KI läuft lokal ohne Internet-Anbindung mit einer ca. 30GB großen Trainingsdatei. Meine Anforderungen für die Szene und die Details werden zwar fast alle berücksichtigt, können aber nur sehr grob umgesetzt werden. Eine weiter Hürde ist die Bildanalyse von meinen Vorlagen. Es gibt zwar Vision-Language-Modelle für ComfyUI, diese können aktuell mit Google-Gemini aber bei Weitem nicht mithalten ...
Das liegt natürlich auch an den sehr beschränkten Ressourcen der Trainingsdaten - Google ist da fast unbegrenzt. Aber natürlich auch an dem wesentlich simpleren Open-Source Text-zu-Bild-Modell. Dazu kommt die sprachliche Einschränkung Englisch oder Chinesisch. Bei komplexen Anweisungen ist zumindest für mich noch eine Übersetzung zusätzlich notwendig.
Gut erkennbar: die eher simple Darstellung der Pflanzen und der Mangel an Details im Hintergrundbereich. Erstellt mit "z-image turbo" in ComfyUI.
Beispiel 2: Für mein Projekt "Cityscapes" erstelle ich immer wieder große Stadtansichten oder urbane Szenen mit vielen Details und komplexen Lichtstimmungen:
Diese Szene für "CityScapes" zeigt eine überfüllte Autobahn die sich durch eine Wüstenstadt, erbaut aus einem porösen hellen Steinmaterial, bahnt. Eine große fremdartige Sonne am frühen Abend beleuchtet die wimmelnde Szene ...
Auch hier werden meine Vorgaben in einer hohen Detaildichte umgesetzt. Erstellt mit Nano Banana 2.5, Bildbearbeitungen mit Affinity 3.2
Eine Markt-Szene aus der linken Bildseite im Detail ...
Das Baumaterial der Stadt, die Form der Gebäude, die komplexe Lichtstimmung mit der staubigen Atmosphäre - meine detailierten Beschreibungen und Angaben erstellt mit Nano Banana 2.5, Bildbearbeitungen mit Affinity 3.2
Die gleiche Aufgabe von "z-image turbo" umgesetzt. Das lokale Modell kann in groben Zügen meine Ideen umsetzen. Das wimmelne Leben oder die volle Rushhour auf der Autobahn scheitern jedoch schon an der mangelnden Anzahl an Objekten und Detailfülle ...
Sehr interessant ist auch die Interpretation des Baumaterials der Stadt: hier werden daraus Eierschalen, wahrscheinlich weil in meiner Beschreibung u.a. die Begriffe eierschalenfarbig und Kalk vorkommen ;). Erstellt mit "z-image turbo" in ComfyUI.