21. September 2026·4 Min. Lesezeit·AIgentic.media

Alibaba schrumpft sein Bild-KI-Modell auf 7 Milliarden Parameter. Es wurde besser.

alibabaopen-weightbildgenerierungki-modelle
Alibaba schrumpft sein Bild-KI-Modell auf 7 Milliarden Parameter. Es wurde besser.

Qwen-Image-2.1 Architekturdiagramm

Das Schrumpfen, das kein Rückschritt war

Alle paar Monate produziert die KI-Branche eine Geschichte, die leise eine Annahme in Frage stellt, die alle zu hinterfragen aufgehört hatten. Hier ist der Eintrag für diesen Monat: Alibaba Qwen hat ein Bildgenerierungsmodell mit 7,1 Milliarden Parametern veröffentlicht, das die meisten seiner größeren, proprietären Konkurrenten in wichtigen Benchmarks übertrifft.

Die Vorgängerversion, Qwen-Image v1, hatte 20 Milliarden Parameter. Version 2.1 verlor 65 Prozent dieser Parameter durch eine grundlegend neu gestaltete Architektur — und wurde besser. Im GenAI Showdown, einem unabhängigen Benchmark, erreichte Qwen-Image-2.1 7 von 15 Punkten und verdoppelte damit fast die Punktzahl von v1 (4 von 15). Damit liegt es knapp hinter Ideogram 4 (8 von 15) und vor Krea 2 (6 von 15). GPT-Image-2 führt die Kategorie mit 12 von 15 Punkten an.

Die Zahlen erzählen eine Geschichte, die die Branche nicht hören will: Der Weg zu besserer Bildgenerierung führt möglicherweise nicht über größere Modelle und mehr Rechenleistung. Er führt über intelligentere Architektur.

Was sich im Modell geändert hat

Die Neugestaltung ist dramatisch. Version 1 verwendete einen 20-Milliarden-Parameter-MMDiT (Mixture-of-Experts Multi-Modal Diffusion Transformer). Version 2.1 ersetzt ihn durch einen 7,1-Milliarden-Parameter-Single-Stream-DiT mit 32 Layern, gepaart mit einem Qwen3-VL-8-Milliarden-Parameter-Text-Encoder und einem 64-Kanal-RGBA-VAE. Der gesamte Fußabdruck beträgt etwa 31 Gigabyte in BF16.

Der wichtigste Effizienzgewinn kommt von der KV-Cache-Wiederverwendung. Die meisten Bildgenerierungsmodelle kodieren Text-Prompts und Referenzbilder bei jedem Entrauschungsschritt neu. Qwen-Image-2.1 kodiert sie einmal bei Schritt eins und zwischenspeichert das Ergebnis für alle folgenden Schritte. Das macht die Bearbeitung mit mehreren Referenzbildern wesentlich schneller. Auf einer RTX 4090 dauert die Generierung eines 1-Megapixel-Bildes etwa fünf Sekunden.

Funktionen, die zählen

Qwen-Image-2.1 verfügt über Fähigkeiten, die Konkurrenzmodelle entweder nicht oder nur schlecht beherrschen:

Native RGBA-Transparenz. Das Modell erzeugt und bearbeitet Bilder mit transparentem Hintergrund nativ. Nutzer können isolierte Objekte erstellen, Text auf transparenten Ebenen bearbeiten oder Motive aus Fotos extrahieren — ohne Nachbearbeitung.

Zehn Referenzbilder. Das Modell akzeptiert bis zu zehn Referenzbilder gleichzeitig und ermöglicht Gruppenporträts aus Einzelfotos, virtuelle Anproben und Raumdesign-Collagen. Das KV-Cache-System sorgt dafür, dass jedes zusätzliche Referenzbild nur minimale Latenz verursacht.

Drei lokale Bearbeitungsmethoden. Nutzer können Bearbeitungen über Kreise (zeigen und korrigieren), Pinselstriche oder Masken führen — je nach Aufgabe.

Textdarstellung, Panoramen, Infografiken, Storyboards. Das Modell generiert lesbaren Text in Bildern, breite Panoramen, strukturierte Infografiken und sequenzielle Storyboards aus einem einzigen Prompt.

Hardware und Ökosystem

Der Fußabdruck von 31 Gigabyte in BF16 übersteigt den VRAM der meisten Consumer-GPUs, aber der praktische Einsatz ist auf mehreren Wegen möglich:

  • FP8-Quantisierung reduziert den Fußabdruck auf etwa 15,4 Gigabyte, was in eine einzelne RTX 4090 passt.
  • DiffSynth-Offloading senkt die VRAM-Anforderungen auf bis zu 4 Gigabyte, sodass das Modell auf Mittelklasse-Hardware lauffähig ist.
  • Inferenz-Unterstützung ab Tag null von vLLM-Omni, SGLang, LightX2V, ComfyUI und Diffusers bedeutet, dass Nutzer das Modell ohne Wartezeit auf Drittanbieter-Integration ausführen können.

Der Lizenz-Haken

Es gibt einen Kompromiss. Qwen-Image v1 wurde unter der Apache-2.0-Lizenz veröffentlicht, einer großzügigen Open-Source-Lizenz. Version 2.1 verwendet eine Qwen Research License, die die kommerzielle Nutzung vollständig untersagt. Unternehmen, die das Modell einsetzen möchten, müssen bei Qwen eine separate kommerzielle Lizenz beantragen.

Diese Änderung spiegelt einen breiteren Trend im Open-Weight-Ökosystem wider. Da Modelle leistungsfähiger werden, verschärfen ihre Entwickler die Lizenzbedingungen — insbesondere chinesische KI-Labore, die sich in einem unsicheren regulatorischen und exportkontrollierten Umfeld bewegen. Die Änderung war ein großes Diskussionsthema auf Hacker News, wo sie 578 Punkte und 162 Kommentare erhielt.

Was das für die Branche bedeutet

Qwen-Image-2.1 entthront GPT-Image-2 nicht. Aber das ist der falsche Vergleich. Der richtige Vergleich ist zwischen einem 7-Milliarden-Parameter-Open-Weight-Modell und der 20-Milliarden-Parameter-Version, die davor kam — einem Modell, das zwei Drittel seiner Masse verlor und stärker daraus hervorging.

Diese Entwicklung ist bedeutsam. Sie deutet darauf hin, dass die Grenze der Bildgenerierung nicht ausschließlich eine Grenze von Rechenleistung und Parametern ist. Architektonische Innovation — Single-Stream-DiT, KV-Cache-Wiederverwendung, effizientes VAE-Design — kann die Messlatte genauso verschieben wie Skalierung. Für eine Branche, die zwei Jahre damit verbracht hat, über Skalierungsgesetze zu diskutieren, ist das eine leise subversive Erkenntnis.

Das Open-Weight-Ökosystem holt bei der proprietären Bildgenerierung schneller auf als erwartet. Qwen-Image-2.1 ist der stärkste Beleg dafür, dass die Lücke zwischen kleinen, offenen Modellen und großen, geschlossenen schrumpft — und dass kleinere, intelligentere Architekturen diejenigen sein könnten, die sie schließen.

Quellen

Mehr erfahren?

Lassen Sie uns besprechen, wie KI Ihr Business transformieren kann.

Kontakt aufnehmen