FLUX 3 Video: 20-Sekunden-Clips mit nativem Audio
Kurze Antwort: FLUX 3 Video rendert Bild und Ton zusammen, also muss der Prompt beides inszenieren. Schreibe eine FORMAT-Zeile, gib den Keyframes ihre Zeitstempel, beschreibe den STARTING STATE, lege eine TIMELINE mit einer sichtbaren Handlung pro Beat an, fixiere CAMERA und CONTINUITY und schreibe das AUDIO als Partitur — wer spricht, in welcher Sprache, in welcher Sekunde, plus Effekte und Raumton. Rendere zuerst einen Draft für 0,06 $ pro Sekunde, dann verbessere ihn.
Was FLUX 3 Video ist
FLUX 3 ist das multimodale Modell von Black Forest Labs — ein Backbone für Bilder, Video und Audio —, angekündigt am 23. Juli 2026 im Early Access. Sein Videomodus erreichte die BFL-API und ausgewählte Partner am 4. August 2026. Die Schlagzeile ist nicht die Länge, sondern der Ton: Sprache in über einem Dutzend Sprachen mit Lip-Sync, Effekte und Atmosphäre entstehen mit den Frames, nicht nachträglich.
| Spezifikation | FLUX 3 Video |
|---|---|
| Länge | 5–20 s (Video-Fortsetzung 5–15 s), 24 fps |
| Auflösung | HD 1920 × 1088 bei 16:9; FHD über den eingebauten Upsampler |
| Seitenverhältnisse | 21:9, 2:1, 16:9, 4:3, 1:1, 3:4, 9:16 |
| Audio | standardmäßig an: mehrsprachige Sprache mit Lip-Sync, Effekte, Atmosphäre; abschaltbar |
| Eingaben | Text; 1–10 Bilder als Startframe, Start-Ende-Paar oder Keyframes mit Zeitstempeln; bis zu 4 s vorhandenes Video und Audio für die Fortsetzung |
| Preis (BFL, Sept. 2026) | 0,17 $/s HD, 0,29 $/s FHD; Draft 0,06 $/s; Fortsetzung 0,43 $/s HD, 0,54 $/s FHD |
| Verfügbarkeit | BFL-API und Dashboard seit 4.8.2026; Partnerplattformen; keine offenen Gewichte |
Die Briefing-Struktur
Dasselbe Regie-Briefing-Muster von 2026, das für Seedance 2.5 und Kling 3.0 funktioniert, funktioniert auch hier, mit zwei FLUX-spezifischen Blöcken: KEYFRAMES mit Zeitstempeln statt Referenzrollen und eine AUDIO-Zeile, die auf die Sekunde durchkomponiert ist.
- FORMAT — Länge, Seitenverhältnis, hd oder fhd, ein Take oder Shots, Audio an oder aus.
- KEYFRAMES — welches Bild in welcher Sekunde sitzt und was zwischen ihnen identisch bleiben muss.
- STARTING STATE — Subjekt, Kamera und Licht bei 0 s.
- TIMELINE — Sekundenbereiche, eine sichtbare Handlung pro Beat, wo die letzte Bewegung zur Ruhe kommt.
- CAMERA — eine Bewegung, Brennweite, was verboten ist.
- CONTINUITY — Invarianten: Produkt, Gesicht, Kleidung, Licht.
- AUDIO — Effekte mit Zeitstempeln, Raumton, Dialog in Anführungszeichen mit Sprecher, Sprache und Sekunde, Musik oder ausdrücklich keine.
- CONSTRAINTS — was nicht passieren darf.
Ein komplettes Beispiel (12 s, 9:16, Produkt mit gesprochener Zeile)
FORMAT: 12 s, 9:16, fhd, one continuous take, audio on. KEYFRAMES: [0, image1] the glass bottle on the marble counter, cap on, morning light from the left; [8, image2] the same bottle with the cap off and one drop on the rim. Keep the label, the cap and the marble identical between the two. STARTING STATE: the bottle stands centred, still; a hand is out of frame to the right. TIMELINE: 0-4 s - the light slides slowly across the marble; a hand enters from the right and lifts the cap. 4-8 s - close on the rim: one drop forms and falls in real time; the hand sets the cap down out of frame. 8-12 s - the camera eases back to a hero angle and holds; the bottle settles centred for the last second. CAMERA: locked-off macro at 100 mm for the first eight seconds, then a slow pull-back; no whip, no zoom. CONTINUITY: same bottle, label and lighting throughout; the hand has short nails and no rings. AUDIO: a soft cap click at 3.5 s, a single drop at 6 s, quiet room tone throughout; at 9 s a calm female voice (English, British) says "Made in one drop."; no music. CONSTRAINTS: no on-screen text, no second product, no logo changes, no slow motion, no watermark.
Die Audio-Zeile schreiben
- Dialog in geraden Anführungszeichen, mit Sprecher, Sprache und Sekunde: at 9 s a calm female voice (English, British) says "Made in one drop."
- Eine kurze Zeile pro Clip unter 15 s. Sprache braucht etwa drei Sekunden pro Satz plus Stille drumherum; ein 12-Sekunden-Clip trägt eine Zeile, ein 20-Sekunden-Clip zwei oder drei.
- Effekte mit Zeitstempeln, damit sie auf der Handlung landen: „cap click at 3.5 s, drop at 6 s“.
- Den Raumton benennen („quiet room tone“, „rain on the window“) — Stille ohne ihn wird mit einem zufälligen Bett gefüllt.
- „no music“ schreiben, wenn du es so meinst; sonst vertont das Modell den Clip womöglich.
- Der Sprecher muss im Bild sein, wenn die Zeile läuft und du Lip-Sync willst; ein Voice-over ist in Ordnung, wenn niemand im Bild ist.
Keyframes mit Zeitstempeln
Bild-zu-Video nimmt ein bis zehn Bilder. Ein einzelnes Bild ist der Startframe; zwei sind ein Start-Ende-Paar; mehr werden zu Keyframes mit Zeitstempeln, geschrieben als [0, image1], [8, image2]. Das Modell interpoliert die Bewegung dazwischen, also müssen die Bilder in allem übereinstimmen, was sich nicht ändern soll — Produkt, Etikett, Lichtrichtung, Bildausschnitt — und sich nur im Zustand unterscheiden, den du animieren willst. Zwei Produktfotos von derselben Stativposition sind ideal; zwei Fotos aus verschiedenen Winkeln ergeben einen Morph.
Zuerst Draft, dann Enhance
Jede FLUX-3-Video-Anfrage akzeptiert draft: true: eine schnelle 720p-Vorschau für 0,06 $ pro Sekunde statt 0,17 $. Prüfe das Timing der Zeile, das Zur-Ruhe-Kommen am Ende und die Kamerabewegung; korrigiere das Briefing bei Bedarf; sende dann den zurückgegebenen draft_cache mit mode: "draft_enhance" erneut, um den freigegebenen Draft in voller Qualität zu rendern. Ein 12-Sekunden-Clip kostet 0,72 $ als Draft und etwa 2 $ zum Fertigstellen in HD — weit günstiger als drei blinde Vollrenders.
Wo es die anderen schlägt, und wo nicht
- Wähle FLUX 3 Video für 10–20-Sekunden-Produkt-, Marken- und Erklärclips mit gesprochenen Zeilen in vielen Sprachen, Keyframe-Kontrolle und der Draft-Enhance-Schleife.
- Wähle Veo 3.1 für 8-Sekunden-Fotoreal-Hero-Shots mit nativem Audio; das realistischste Licht 2026.
- Wähle Seedance 2.5 für 30-Sekunden-One-Take-Geschichten, gesteuert von bis zu 50 Referenzen mit expliziten Rollen — siehe den Seedance-2.5-Prompt-Guide.
- Wähle Kling 3.0 für geschnittene Szenen mit benannten Sprechern und Shot-Dauern.
Umstieg von Sora? Die Prompt-Struktur oben lässt sich eins zu eins übertragen; der Sora-Migrationsguide hat die Tabelle Funktion für Funktion.
Häufige Fehler
- Dialog als Beschreibung („sie spricht über das Produkt“) — keine Zeile wird gesprochen.
- Zwei Zeilen in einem 8-Sekunden-Clip — die zweite ist gehetzt oder abgeschnitten.
- Keyframes aus verschiedenen Winkeln — das Modell morpht statt zu animieren.
- Bild- und Videoeingabe in einer Anfrage — nicht unterstützt; eins wählen.
- Den Draft überspringen — Vollrenders für 0,17–0,29 $ pro Sekunde summieren sich schnell.
- Spec-Tokens („4K 60fps“) und negative Prompts — stattdessen FORMAT und CONSTRAINTS nutzen.
Häufige Fragen
Was ist FLUX 3 Video?
Der Videomodus von FLUX 3, dem multimodalen Modell von Black Forest Labs, angekündigt am 23. Juli 2026. FLUX 3 Video ist seit dem 4. August 2026 über die BFL-API und ausgewählte Partner verfügbar. Es rendert 5 bis 20 Sekunden mit 24 fps in HD (1920 × 1088 bei 16:9), Full HD über den eingebauten Upsampler, und erzeugt Audio zusammen mit den Frames: mehrsprachige Sprache mit Lip-Sync, Soundeffekte und Atmosphäre.
Erzeugt es wirklich Dialog und Lip-Sync?
Ja. Audio ist standardmäßig an (generate_audio: true), und das Modell rendert Sprache in englischen Dialekten, Chinesisch, Spanisch, Französisch, Deutsch, Japanisch, Portugiesisch, Russisch, Italienisch, Indonesisch, Türkisch, Hindi, Punjabi und mehr, mit Lip-Sync, plus Effekte und Atmosphäre, die mit den Frames entstehen. Schreibe die Zeile in Anführungszeichen und sage, wer spricht, in welcher Sprache und in welcher Sekunde.
Welche Eingaben nimmt es?
Nur Text; Text plus 1 bis 10 Bilder als einzelner Startframe, Start-Ende-Paar oder Keyframes mit Zeitstempeln wie [0, image], [2.5, image]; oder ein vorhandener Clip als start_video zur Fortsetzung, die bis zu vier Sekunden seines Videos und Audios weiterführt. Bild- und Videoeingaben lassen sich in einer Anfrage nicht kombinieren.
Was kostet es?
BFL-Listenpreise im September 2026: Text-zu-Video und Bild-zu-Video 0,17 $ pro Sekunde in HD und 0,29 $ pro Sekunde in FHD, Draft-Modus 0,06 $ pro Sekunde; Video-Fortsetzung 0,43 $ pro Sekunde HD, 0,54 $ FHD, Draft 0,12 $. Ein 12-Sekunden-HD-Clip kostet etwa 2 $, sein Draft 0,72 $. Partnerplattformen setzen eigene Tarife.
Was ist der Draft-Modus?
Eine schnelle, günstigere 720p-Vorschau desselben Prompts. Setze draft: true, prüfe Timing, Dialog und Kamera, und sende dann den zurückgegebenen draft_cache mit mode "draft_enhance" erneut, um den freigegebenen Draft in voller Qualität zu rendern — der verbesserte Render folgt der Bewegung des Drafts, statt neu zu würfeln.
FLUX 3 Video, Veo 3.1 oder Seedance 2.5?
FLUX 3 Video für 10–20-Sekunden-Clips mit gesprochenen Zeilen in vielen Sprachen, Lip-Sync und dem Draft-dann-Enhance-Workflow; Veo 3.1 für 8-Sekunden-Realismus mit nativem Audio und bis zu drei Ingredient-Bildern; Seedance 2.5 für 30-Sekunden-One-Take-Geschichten mit bis zu 50 Referenzen und expliziten Rollen. Kling 3.0 bleibt die Wahl für geschnittene Szenen mit benannten Sprechern.
Das Briefing geschrieben bekommen — Keyframes, Timeline, Kamera, Kontinuität, eine durchkomponierte Audio-Zeile und Constraints? GoldenPrompts baut Briefings für FLUX 3 Video, Veo, Seedance und Kling mit wenigen Klicks. Ausprobieren — 24 Stunden alles kostenlos, ohne Karte.