FLUX 3 Video spricht und liest von den Lippen ab

FLUX 3 erscheint mit einer eingebauten Stimme.
Black Forest Labs, das deutsch KI-Unternehmen aus Freiburg, gegründet von den Entwicklern von Stable Diffusion, hat am Mittwoch FLUX 3 veröffentlicht. Das Update ist nicht nur ein Tool zur Videogenerierung - es ist ein einheitliches multimodales Modell, das Bilder, Full-HD-Videoclips mit nativem Audio, lippensynchronen Dialog in mehr als 14 Sprachen und sogar Roboteraktionen vorhersagen kann. Die Videokomponente, FLUX 3 Video, steht dabei zunächst im Mittelpunkt.
Die Sprachlücke in der KI-Videogenerierung
Die meisten KI-Videomodelle produzieren derzeit stumme Clips. Sora, Runway Gen-3, Metas Make-a-Video und Pika erzeugen ausschließlich Bilder. Die Vertonung erfordert einen zweiten Durchlauf mit einem separaten Audiomodell, und die Synchronisation von Lippenbewegungen mit einem gesprochenen Text gilt in der Computergrafik als eines der hartnäckigsten ungelösten Probleme.
FLUX 3 Video fasst diesen Workflow in einem Schritt zusammen. Es liefert Full-HD-Video (1080p) mit bis zu 20 Sekunden Länge und natürlichem Audio. Der Dialog ist lippensynchron und in über 14 Sprachen verfügbar. Das Modell kann auch Typografie direkt in die Szene rendern - Text auf einem Schild, ein Untertitel über einem Clip oder ein Logo in einer Produktdemo - ohne Nachbearbeitung.
Die internen Elo-Rankings von Black Forest Labs stufen FLUX 3 Video vor Seedance 2.0 und Googles Gemini Omni Flash ein, gemessen an der Gesamtqualität.

Mehr als nur Video
Wenn die Audio-Video-Synchronisation die einzige Neuerung wäre, wäre FLUX 3 bereits eine bedeutende Veröffentlichung. Aber Black Forest Labs ist weiter gegangen. Die FLUX-3-Plattform ist nach Angaben des Unternehmens ein einheitliches multimodales Flow-Modell - eine Architektur, die Bildgenerierung, Videogenerierung, Audiogenerierung und Physical-AI-Aufgaben gleichzeitig bewältigt.
Die Physical-AI-Komponente, bestätigt in Berichten von Bloomberg und Decrypt, führt Bewegungsvorhersagen für Roboter durch. Ein mit der FLUX-3-Architektur trainierter KI kann eine visuelle Szene erfassen und die Abfolge von Aktionen ausgeben, die ein Roboterarm in dieser Umgebung ausführen soll. Dies passt zu einem breiteren Branchentrend hin zu Weltmodellen, die Physik und Bewegung verstehen, nicht nur Pixel und Text.
Black Forest Labs hat auch angedeutet, dass es eine Open-Weight-Version von FLUX 3 Video veröffentlichen wird, dem Muster seiner früheren Modelle FLUX.1 und FLUX.2 folgend, die zur Popularisierung der offenen Bildgenerierung beigetragen haben. Ein Open-Weight-Videomodell auf diesem Qualitätsniveau wäre eine Premiere.
Wofür FLUX 3 Video heute nützlich ist
Die praktischen Anwendungsfälle sind zunächst die naheliegendsten: Kurzzeitwerbung, Social-Media-Inhalte, Produktdemonstrationen, mehrsprachige Marketingmaterialien, bei denen ein einzelner generierter Clip eine vollständige Produktion ersetzt. Die Typografie-Funktion bedeutet, dass eine Marke ein Video mit ihrem Logo und Bildschirmtext in einem einzigen Durchlauf generieren kann.
Die Lippensynchronisation in 14 Sprachen ist die Funktion, die Content-Workflows am stärksten verändern dürfte. Ein Unternehmen, das bisher separate Drehs für Englisch, Spanisch, Mandarin und Arabisch benötigte, kann jetzt alle vier Varianten aus einem Prompt generieren. Ob die Qualität der Lippenbewegungen bei genauer Prüfung standhält - der eigentliche Test für den professionellen Einsatz - ist noch nicht unabhängig bestätigt, aber selbst eine funktionale Qualität auf diesem Niveau ist ein Sprung gegenüber dem aktuellen Stand.
Die realistische Einschätzung
FLUX 3 Video ist für eine einzelne Veröffentlichung in der Tat beeindruckend. Das native Audio, die Lippensynchronisation in 14 Sprachen, die Typografie und die einheitliche multimodale Architektur stellen insgesamt einen größeren Fortschritt dar als jede einzelne Videogenerierungs-Veröffentlichung in diesem Jahr.
Die Einschränkungen sind drei. Erstens stammen alle Benchmark-Angaben aus internen Elo-Rankings von Black Forest Labs - sie wurden nicht unabhängig reproduziert. Zweitens war das frühere Modell FLUX.2 stark, konnte aber Sora oder Runway im tatsächlichen Einsatz nie verdrängen, was darauf hindeutet, dass die Lücke zwischen Demo-Qualität und praktischer Zuverlässigkeit noch nicht geschlossen ist. Drittens ist die Videogenerierung in Full HD mit Audio rechenintensiv, und das Unternehmen hat noch keine Preise oder Latenzzeiten für die allgemeine Verfügbarkeit veröffentlicht.
Trotzdem ist die Richtung klar: Die Grenze zwischen generiertem und produziertem Video verschwindet schnell. FLUX 3 Video hat nicht einfach Audio hinzugefügt - es hat Audio zum zentralen Designelement gemacht. Das ist eine andere Philosophie als Ton als nachträgliche Schicht hinzuzufügen, und es könnte die Philosophie sein, die zählt.
Quellen
- Black Forest Labs macht FLUX 3 Video allgemein verfügbar - The Decoder
- Black Forest Labs bringt FLUX 3 mit Bild- und 20-Sekunden-Video mit Audio - VentureBeat
- Black Forest Labs veröffentlicht FLUX 3 - MarkTechPost
- Black Forest Labs enthüllt FLUX 3 AI: Von Videos zu Roboterhänden - Decrypt
- Black Forest Labs stellt erstes Robotics-Modell vor - Bloomberg