Die 17,3-Gigabyte-Frage
- Was gemessen wurde und wie
- Das Messproblem, das niemand erwähnt
- Wohin die Zeit wirklich geht
- Schärfer und lauter
- Was die Zahlen nicht sehen
- Die Falle: ein Architektur-Name
- Wo das hinführt
- Die Zahl, die den Plan ändern sollte
Gleiche Vorgaben, gleicher Zufallswert, gleiche Grafikkarte. Das eine Modell brauchte 17,3 GB an Gewichten auf einer Karte mit 12. Es hat die Aufgabe erledigt, und es hat sie anders erledigt.
Am 9. Oktober 2026 liefen zwei Bildmodelle dieselben dreißig Vorgaben durch dieselbe Grafikkarte. Das eine war Z-Image Turbo, ein schlankes Modell, das bequem in die 12 GB Videospeicher passt. Das andere war Qwen-Image-2.1, dessen drei Gewichtsdateien zusammen 17,29 GB messen, fünf Gigabyte mehr, als die Karte hat.
Das schlanke Modell brauchte im Mittel 14,3 Sekunden je Bild. Das große brauchte 37,8. Es war damit 2,65-mal langsamer.
Diese Zahl ist fast das Uninteressanteste an diesem Vergleich. Denn je Rechenschritt war das große Modell nur etwa ein Drittel langsamer. Der Rest des Abstands kommt von ganz woanders her, und woher er kommt, entscheidet, welches Modell man tatsächlich nehmen sollte.
Was gemessen wurde und wie
Dreißig Vorgaben, sechs Gruppen zu fünf: Bitcoin, Menschen, Natur, Fahrzeuge, Zukunftsszenen, Architektur. Jede Vorgabe lief unverändert durch beide Modelle. Gleicher Zufallswert (777), gleiche Auflösung (1024×1024), gleicher Abtaster, gleiche Führung von 1,0. Stilwörter wie „fotorealistisch“ wurden bewusst weggelassen, denn die würden messen, wie jedes Modell auf Stilwörter reagiert, und nicht die Modelle selbst.
Qwen lief mit 25 Schritten, dem Wert aus seiner eigenen offiziellen Vorlage. Z-Image lief mit 8, dem Wert aus seiner eigenen. Ein Modell auf die Schrittzahl des anderen zu zwingen wäre ein anderes Experiment und ein unehrlicheres: das sind die Einstellungen, mit denen die Modelle ausgeliefert werden.
Die Hardware: ein Intel i7-6700K mit 62 GB Arbeitsspeicher und eine NVIDIA RTX 3060 mit 12 GB Videospeicher, Treiber 595.71.05. ComfyUI auf Hauptzweig-Stand 08ff3c11b3a8, Dateiversion 0.39.0.
Vor jedem einzelnen Lauf wurde der Speicher freigegeben, damit beide Modelle vom selben Zustand starteten. 60 Läufe, 60 Erfolge, keine Fehlläufe.
Das Messproblem, das niemand erwähnt
ComfyUI liefert in seiner Ausführungshistorie keine Zeitstempel. Jedes Feld, das ich prüfte, kam als None zurück. Der naheliegende Weg, nämlich Stoppuhr starten und auf das Bild warten, hätte zwei völlig verschiedene Dinge in eine Zahl geworfen: die Zeit, um 17 GB Gewichte von der Platte in den Speicher zu schieben, und die Zeit, um tatsächlich ein Bild zu rechnen.
Das sind nicht dieselben Kosten, und sie skalieren unterschiedlich. Für einen Vergleich wie diesen ist die Aufteilung selbst der Befund. Die Messung liest deshalb die WebSocket-Schnittstelle von ComfyUI mit und trennt drei Phasen: Laden (Start bis zum ersten Rechenschritt), Rechnen (erster bis letzter Rechenschritt) und den Rest, also Dekodieren und Schreiben der Datei.
Die drei Posten ergeben in jedem Lauf die Gesamtzeit. Für Qwen: 7,5 + 27,3 + 2,8 = 37,6 gegen einen gemessenen Mittelwert von 37,8. Die zwei Zehntel Differenz entstehen dadurch, dass die Phasen einzeln gemittelt werden. Für Z-Image: 5,6 + 6,7 + 1,8 = 14,1 gegen 14,3.
Ein Vorbehalt gehört in den Text und nicht in eine Fußnote: die Uhr hängt an dem Rechner, der den Auftrag abschickt, nicht an der Grafikkarte. Netzwerk- und Wartezeit stecken also in diesen Zahlen. Über ein lokales Netz gegen einen warmen Server ist dieser Abstand klein, aber er ist nicht null.
Wohin die Zeit wirklich geht

Qwen-Image-2.1 Z-Image Turbo
Schritte 25 8
Mittel gesamt 37,8 s 14,3 s
Laden 7,5 s 5,6 s
Rechnen 27,3 s 6,7 s
Dekodieren+Speichern 2,8 s 1,8 s
Sekunden je Schritt 1,09 s 0,84 s

Lesen Sie zuerst die letzte Zeile. Je Rechenschritt ist Qwen 30 Prozent langsamer als Z-Image. Nicht 165 Prozent langsamer. Dreißig Prozent.
Mit der Schrittzahl multipliziert weitet sich der Abstand: 25 × 1,09 = 27,3 Sekunden Rechnen gegen 8 × 0,84 = 6,7. Der Faktor vier steckt vollständig in der Schrittzahl.
Dann fällt die Gesamtzeit auf 2,65 zurück. Rund 7,5 Sekunden von Qwens Lauf und 5,6 Sekunden von Z-Images Lauf gehen für Arbeit drauf, die überhaupt nicht mit den Schritten skaliert: Gewichte von der Platte bewegen. Z-Images Gesamtzeit ist zur Hälfte feste Kosten. Qwens nur zu einem Fünftel. Das größere Modell hat mehr absolute Fixkosten und einen kleineren Anteil daran.
In den Qwen-Zahlen steckt ein zweites Muster, das nur sichtbar wird, weil die Phasen getrennt wurden. Seine Rechenzeit ist über alle 30 Läufe fast perfekt konstant: 27,00, 27,05, 27,11 Sekunden in den ersten drei, eine Streuung von 0,11 Sekunden. Seine Ladezeit ist es nicht: sie schwankt zwischen 7,46 und 8,29 Sekunden. Die Schwankung der Gesamtzeit kommt aus dem Speichersystem, nicht aus der Berechnung.
Genau das erwartet man von einem Modell, das nicht hineinpasst. Z-Images Gewichte bleiben liegen. Qwens werden eingelagert, teilweise verdrängt und wieder geholt. Wie lange das dauert, hängt davon ab, was der Kern sonst noch mit demselben Seitenpuffer macht.
Schärfer und lauter
Geschwindigkeit ist die leichte Hälfte. Die schwerere Frage ist, ob die zusätzlichen 23,5 Sekunden irgendetwas einbringen.
Um sie zu beantworten, habe ich jedes der 60 Bilder gleich vermessen: Laplace-Varianz für die Schärfe, mittlerer absoluter Laplace-Wert für hochfrequentes Rauschen und den Anteil fast schwarzer und fast weißer Bildpunkte für ausgefressene Stellen.
Die Schärfe hat eine Falle. Über das ganze Bild gemessen erfasst die Laplace-Varianz auch, wie groß das Motiv ist, sodass eine Nahaufnahme einer Münze punktet also immer besser als eine Landschaft. Die Schärfe wurde deshalb zusätzlich auf einem identischen 512-Pixel-Ausschnitt aus der Bildmitte gemessen, und das ist die Zahl, die unten steht.
Qwen-Image-2.1 Z-Image Turbo
Schärfe (Mitte) 1243 1101
Rauschen 17,0 10,6
Kontrast 48,0 51,9
fast schwarz 2,66 % 0,95 %
fast weiß 0,07 % 0,03 %
Qwen liefert in 20 von 30 Motiven das schärfere Bild. Z-Image gewinnt die anderen zehn. Das ist ein echter Vorteil, aber kein Durchmarsch, und das Muster dahinter ist nützlicher als die Zählung.
Qwens Siege sammeln sich bei Motiven mit gebautem Detail: die Bitcoin-Münze (6961 gegen 2448, fast das Dreifache), der Oldtimer, das Fahrrad, der Regionalzug. Z-Images Siege sammeln sich bei texturierten, organischen oder hochfrequenten Motiven: die Brandung auf schwarzem Fels (5170 gegen 1896), das Stahldach der Bahnhofshalle, das Bibliotheksinnere.
Beim Rauschen läuft es andersherum, und zwar deutlich. Z-Image ist in 28 von 30 Motiven das ruhigere Bild. Qwens Rauschwert liegt im Mittel 60 Prozent höher, und sein schlimmster Fall ist schlechter: bis zu 28 Prozent fast schwarze Bildpunkte in einem einzelnen Bild, gegen Z-Images schlimmsten Fall von 7,7 Prozent. In dunklen Szenen neigt Qwen eher zu zugelaufenen Schatten, die in der Nachbearbeitung gerettet werden müssen.
Die ehrliche Zusammenfassung ist deshalb nicht, dass das größere Modell besser ist. Sie lautet, dass das größere Modell Strukturen besser auflöst und Töne schlechter wiedergibt — und was davon zählt, hängt davon ab, wofür das Bild gedacht ist.

Was die Zahlen nicht sehen
Eine Messreihe sagt einem, was sie zu messen gebaut wurde. Es lohnt sich, klar zu sagen, was meine nicht misst.
Als ich mir alle 30 Paare mit eigenen Augen ansah, lieferte Qwen zwei Bilder, bei denen der Kopf des Motivs vollständig aus dem Bild geschnitten war: der Handwerker mit dem Hammer und der humanoide Roboter. Beide Vorgaben hatten eine ganze Figur verlangt. Z-Image rahmte beide richtig.
Jedes Paar steht unten. Obere Reihe Z-Image Turbo, untere Reihe Qwen-Image-2.1. Gleiche Vorgabe, gleicher Zufallswert je Spalte.
Bitcoin. Münze, Miner, Chart, Hardware-Wallet, Node.

Menschen. Alter Mann, junge Frau, Handwerker, Kind, Gruppe.

Natur. Nebelwald, Gipfel, Brandung, Dünen, Rotfuchs.

Fahrzeuge. Oldtimer, Motorrad, LKW, Regionalzug, Fahrrad.

Zukunft. Zukunftsstadt, Roboter, Cockpit, Portal, Cyberpunk-Gasse.

Architektur. Kirche, Glashaus, Brücke, Bibliothek, Bahnhofshalle.

Keine Laplace-Varianz fängt das ein. Ein kopfloser Handwerker kann vollkommen scharf sein. Jede Auswertung, die nur Schärfe und Rauschen meldet, hätte diese beiden Bilder als Qwen-Siege gezählt — und es sind keine Siege, sondern Fehlschläge.
Dazu kommt ein Schriftproblem in beiden Modellen, und es ist nicht gleich groß. Beide setzen unleserliche Zeichen auf den Rand der Bitcoin-Münze. Beide rendern die Neonschilder in der Cyberpunk-Gasse als plausibel aussehenden Unsinn. Keinem von beiden ist Rechtschreibung zuzutrauen, und die übliche Abhilfe, nämlich Schrift aus der Vorgabe herauszuhalten, kostet einen Motive, die legitim Schrift enthalten.
Dann der tiefste Vorbehalt: dieser Vergleich hält Abtaster, Zufallswert und Auflösung fest. Das ist der richtige Weg, um die Modelle zu isolieren, und der falsche, um „welches liefert in der Praxis die besseren Bilder“ zu beantworten. In der Praxis würde man jedes Modell einstellen, und eine Einstellung von 25 Schritten, die Qwen passt, mag bei 12 GB nicht die sein, die ihm am besten passt.
Die Falle: ein Architektur-Name
Qwen-Image-2.1 überhaupt zum Laufen zu bringen hat länger gedauert als der Vergleich selbst, und der Grund gehört festgehalten, weil er den Nächsten genauso trifft.
Der sparsame Weg, ein großes Modell auf eine kleine Karte zu bringen, ist GGUF, ein quantisiertes Format, das die Gewichte erheblich verkleinert. Eine GGUF-Fassung von Qwen-Image-2.1 lag bereits auf dem Rechner, 4,3 GB statt 7,26.
Sie lud nicht. Der Fehler lautete Unknown architecture: 'qwen_image21'.
Ein Blick in den Kopf der Datei erklärt es. Die GGUF erklärt general.architecture = 'qwen_image21'. Der GGUF-Lader in ComfyUI führt eine Liste der Architektur-Namen, die er kennt, und diese Liste enthält qwen_image — ohne die „21“. Der Lader ist nicht kaputt; er ist schlicht älter als die 2.1-Architektur. Die neueste Fassung dieses Laders, am selben Tag geprüft, listet sie noch immer nicht.
Die Lösung war, bei diesem Modell GGUF aufzugeben und die safetensors-Fassung zu nehmen, die mit der offiziellen Vorlage kommt: 17,29 GB statt 4,3. Genau das erzwang das Auslagern und erzeugte das Zeitmuster, um das es in diesem Artikel geht. Eine billigere Datei wäre schneller gewesen. Sie war auch unbrauchbar.
Ein Detail, das man wissen sollte, wenn man diesen Weg geht: die Tensor-Namen in einer safetensors-Datei stehen nicht in Dateireihenfolge. Schicht 19 liegt bei Byte 4,58 Milliarden; Schicht 2 liegt bei 4,77 Milliarden. Wer aus dem Namen, der beim Laden scheitert, auf den Fortschritt schließen will, liest Rauschen. Ich habe genau das kurz getan, bevor ich die Versätze nachgerechnet und mich korrigiert habe.
Wo das hinführt
Die praktische Antwort teilt sich sauber, und sie teilt sich an etwas anderem als der Qualität.
Z-Image Turbo kostet 14,3 Sekunden und liefert ein ruhigeres, konventioneller schöneres Bild. Es passt in die Karte. Es rödelt nicht im Speicher. Sein schlimmster Fall ist besser als Qwens schlimmster Fall. Zum Ausprobieren, etwa sechs Bildausschnitte eines Produktfotos vor dem Mittagessen durchzuprobieren, ist es nicht knapp.
Qwen-Image-2.1 kostet 37,8 Sekunden und löst gebautes Detail auf, das Z-Image verwischt. Bei der Bitcoin-Münze erzeugte es fast dreimal so viel Kantenkontrast. Bei schriftnahen, mechanischen und architektonischen Motiven ist das sichtbar. Es vergisst außerdem gelegentlich den Kopf mitzuliefern.
Das Gegenargument, so stark wie möglich formuliert, ist real und ich will es ordentlich vortragen. Läuft dieser Vergleich auf einer Karte, in die beide Modelle passen, also 24 GB oder mehr, verschwindet die ganze Auslagerungsstrafe. Qwens Ladezeit fiele auf die von Z-Image zu, seine Gesamtzeit käme ihren 27,3 Sekunden reinem Rechnen näher, und das Verhältnis von 2,65 würde sich auf den Faktor vier der Schrittzahl zusammenziehen, mit deutlich kleineren Fixkosten darunter. Der hier gemessene Abstand ist zum Teil eine Eigenschaft einer 12-GB-Karte, nicht des Modells.
Und es gibt eine zweite ehrliche Position: für die meisten Menschen die meiste Zeit muss die Ausgabe keines der beiden Modelle in dieser Auflösung begutachtet werden. Wer ein Stimmungsbild für einen Beitrag erzeugt, für den sind 14,3 Sekunden Z-Image nicht schlechter als 37,8 Sekunden Qwen. Es ist nur schneller, und in der Größe, in der das Bild betrachtet wird, ist der Unterschied unsichtbar.
Die Zahl, die den Plan ändern sollte
Hier ist die Rechnung, auf die es ankommt. Es ist eine Rechnung und keine Vorhersage.
Qwen gibt 7,5 seiner 37,8 Sekunden aus, ein Bild von fünf, um Gewichte zu bewegen, die es nicht liegen lassen kann. Diese Kosten sinken nicht, wenn man die Schrittzahl senkt, und sie sinken nicht, wenn man das Bild verkleinert. Sie sinken nur, wenn die Gewichte hineinpassen.
Die 2,65 sollte man deshalb nicht als Aussage darüber lesen, dass Qwen langsam ist. Sondern als Aussage über eine Unstimmigkeit: 17,29 GB Modell auf 12 GB Speicher, die bei jedem einzelnen Bild einen Zoll für eine Schranke zahlen, die eine größere Karte vollständig aufheben würde.
Bis dahin lautet die ehrliche Beschreibung dieses Paares nicht schneller gegen besser. Ein Modell passt hinein, das andere nicht. Das andere ist die Wartezeit genau dann wert, wenn das Motiv Kanten hat, die ein kleineres Modell nicht halten kann.
Write a comment