FLUX 3 Video: clips de 20 segundos con audio nativo
Respuesta corta: FLUX 3 Video renderiza imagen y sonido a la vez, así que el prompt tiene que dirigir ambos. Escribe una línea FORMAT, da a los keyframes sus marcas de tiempo, describe el STARTING STATE, traza una TIMELINE con una acción visible por beat, fija CAMERA y CONTINUITY, y escribe el AUDIO como una partitura: quién habla, en qué idioma, en qué segundo, más los efectos y el tono de sala. Renderiza primero un borrador a 0,06 $ por segundo y luego mejóralo.
Qué es FLUX 3 Video
FLUX 3 es el modelo multimodal de Black Forest Labs — una sola columna vertebral para imágenes, vídeo y audio — anunciado el 23 de julio de 2026 en acceso anticipado. Su modo de vídeo llegó a la API de BFL y a socios seleccionados el 4 de agosto de 2026. El titular no es la duración sino el sonido: la voz en más de una docena de idiomas con sincronía labial, los efectos y el ambiente se crean con los fotogramas, no se añaden después.
| Especificación | FLUX 3 Video |
|---|---|
| Duración | 5–20 s (continuación de vídeo 5–15 s), 24 fps |
| Resolución | HD 1920 × 1088 en 16:9; FHD mediante el upsampler integrado |
| Relaciones de aspecto | 21:9, 2:1, 16:9, 4:3, 1:1, 3:4, 9:16 |
| Audio | activado por defecto: voz multilingüe con sincronía labial, efectos, ambiente; se puede desactivar |
| Entradas | texto; 1–10 imágenes como fotograma inicial, par inicio + fin o keyframes con marcas de tiempo; hasta 4 s de vídeo y audio existentes para continuación |
| Precio (BFL, sept. 2026) | 0,17 $/s HD, 0,29 $/s FHD; borrador 0,06 $/s; continuación 0,43 $/s HD, 0,54 $/s FHD |
| Disponibilidad | API y panel de BFL desde el 4/8/2026; plataformas asociadas; sin pesos abiertos |
La estructura del brief
El mismo patrón de brief de director de 2026 que funciona para Seedance 2.5 y Kling 3.0 funciona aquí, con dos bloques específicos de FLUX: KEYFRAMES con marcas de tiempo en lugar de roles de referencia y una línea AUDIO pautada al segundo.
- FORMAT — duración, relación de aspecto, hd o fhd, una toma o planos, audio activado o no.
- KEYFRAMES — qué imagen va en qué segundo y qué debe permanecer idéntico entre ellas.
- STARTING STATE — sujeto, cámara y luz en el segundo 0.
- TIMELINE — rangos de segundos, una acción visible por beat, dónde se asienta el último movimiento.
- CAMERA — un movimiento, objetivo, qué está prohibido.
- CONTINUITY — invariantes: producto, cara, ropa, luz.
- AUDIO — efectos con marcas de tiempo, tono de sala, diálogo entre comillas con hablante, idioma y segundo, música o explícitamente ninguna.
- CONSTRAINTS — qué no debe ocurrir.
Un ejemplo completo (12 s, 9:16, producto con una línea hablada)
FORMAT: 12 s, 9:16, fhd, one continuous take, audio on. KEYFRAMES: [0, image1] the glass bottle on the marble counter, cap on, morning light from the left; [8, image2] the same bottle with the cap off and one drop on the rim. Keep the label, the cap and the marble identical between the two. STARTING STATE: the bottle stands centred, still; a hand is out of frame to the right. TIMELINE: 0-4 s - the light slides slowly across the marble; a hand enters from the right and lifts the cap. 4-8 s - close on the rim: one drop forms and falls in real time; the hand sets the cap down out of frame. 8-12 s - the camera eases back to a hero angle and holds; the bottle settles centred for the last second. CAMERA: locked-off macro at 100 mm for the first eight seconds, then a slow pull-back; no whip, no zoom. CONTINUITY: same bottle, label and lighting throughout; the hand has short nails and no rings. AUDIO: a soft cap click at 3.5 s, a single drop at 6 s, quiet room tone throughout; at 9 s a calm female voice (English, British) says "Made in one drop."; no music. CONSTRAINTS: no on-screen text, no second product, no logo changes, no slow motion, no watermark.
Cómo escribir la línea de audio
- Diálogo entre comillas rectas, con hablante, idioma y segundo: at 9 s a calm female voice (English, British) says "Made in one drop."
- Una línea corta por clip de menos de 15 s. La voz necesita unos tres segundos por frase más silencio alrededor; un clip de 12 segundos lleva una línea, uno de 20 segundos dos o tres.
- Efectos con marcas de tiempo para que caigan sobre la acción: «cap click at 3.5 s, drop at 6 s».
- Nombra el tono de sala («quiet room tone», «rain on the window»): el silencio sin él se rellena con una cama aleatoria.
- Escribe «no music» cuando lo quieras así; si no, el modelo puede musicalizar el clip.
- El hablante debe estar en pantalla cuando suena la línea si quieres sincronía labial; una voz en off está bien cuando no hay nadie en pantalla.
Keyframes con marcas de tiempo
Imagen-a-vídeo acepta de una a diez imágenes. Una sola imagen es el fotograma inicial; dos son un par inicio y fin; más se convierten en keyframes con marcas de tiempo, escritos como [0, image1], [8, image2]. El modelo interpola el movimiento entre ellos, así que las imágenes deben coincidir en todo lo que no quieres cambiar — producto, etiqueta, dirección de la luz, encuadre — y diferir solo en el estado que quieres animar. Dos fotos de producto tomadas desde la misma posición de trípode son ideales; dos fotos desde ángulos distintos producen un morph.
Primero borrador, luego mejora
Cada petición de FLUX 3 Video acepta draft: true: una vista previa rápida a 720p por 0,06 $ por segundo en lugar de 0,17 $. Comprueba el tiempo de la línea, el asentamiento final y el movimiento de cámara; corrige el brief si hace falta; luego reenvía el draft_cache devuelto con mode: "draft_enhance" para renderizar el borrador aprobado a calidad completa. Un clip de 12 segundos cuesta 0,72 $ en borrador y unos 2 $ para terminarlo en HD, mucho más barato que tres renders completos a ciegas.
Dónde supera a los demás y dónde no
- Elige FLUX 3 Video para clips de producto, marca y explicativos de 10–20 segundos con líneas habladas en muchos idiomas, control de keyframes y el bucle borrador → mejora.
- Elige Veo 3.1 para planos hero fotorrealistas de 8 segundos con audio nativo; la luz más realista de 2026.
- Elige Seedance 2.5 para historias de toma única de 30 segundos dirigidas por hasta 50 referencias con roles explícitos — ver la guía de prompts de Seedance 2.5.
- Elige Kling 3.0 para escenas con cortes, hablantes con nombre y duraciones por plano.
¿Migras desde Sora? La estructura de prompt de arriba se traslada uno a uno; la guía de migración por el cierre de Sora tiene la tabla función por función.
Errores habituales
- Diálogo escrito como descripción («habla del producto»): no se pronuncia ninguna línea.
- Dos líneas en un clip de 8 segundos: la segunda sale apresurada o cortada.
- Keyframes desde ángulos distintos: el modelo hace morph en lugar de animar.
- Combinar entradas de imagen y vídeo en una petición: no está soportado; elige una.
- Saltarse el borrador: los renders completos a 0,17–0,29 $ por segundo suman rápido.
- Tokens de especificación («4K 60fps») y prompts negativos: usa FORMAT y CONSTRAINTS.
Preguntas frecuentes
¿Qué es FLUX 3 Video?
El modo de vídeo de FLUX 3, el modelo multimodal de Black Forest Labs anunciado el 23 de julio de 2026. FLUX 3 Video está disponible a través de la API de BFL y socios seleccionados desde el 4 de agosto de 2026. Renderiza de 5 a 20 segundos a 24 fps en HD (1920 × 1088 en 16:9), con Full HD mediante el upsampler integrado, y genera el audio junto con los fotogramas: voz multilingüe con sincronía labial, efectos de sonido y ambiente.
¿De verdad genera diálogo y sincronía labial?
Sí. El audio está activado por defecto (generate_audio: true) y el modelo renderiza voz en dialectos del inglés, chino, español, francés, alemán, japonés, portugués, ruso, italiano, indonesio, turco, hindi, panyabí y más, con sincronía labial, además de efectos y sonido ambiente creados con los fotogramas. Escribe la línea entre comillas y di quién habla, en qué idioma y en qué segundo.
¿Qué entradas acepta?
Solo texto; texto más de 1 a 10 imágenes usadas como fotograma inicial único, par inicio y fin, o keyframes con marcas de tiempo como [0, image], [2.5, image]; o un clip existente como start_video para continuación, que arrastra hasta cuatro segundos de su vídeo y audio. Las entradas de imagen y vídeo no se pueden combinar en una misma petición.
¿Cuánto cuesta?
Precios de lista de BFL en septiembre de 2026: texto-a-vídeo e imagen-a-vídeo 0,17 $ por segundo en HD y 0,29 $ por segundo en FHD, modo borrador 0,06 $ por segundo; continuación de vídeo 0,43 $ por segundo HD, 0,54 $ FHD, borrador 0,12 $. Un clip HD de 12 segundos cuesta unos 2 $, su borrador 0,72 $. Las plataformas asociadas fijan sus propias tarifas.
¿Qué es el modo borrador?
Una vista previa rápida y más barata a 720p del mismo prompt. Pon draft: true, comprueba el tiempo, el diálogo y la cámara, y reenvía el draft_cache devuelto con mode "draft_enhance" para renderizar el borrador aprobado a calidad completa: el render mejorado sigue el movimiento del borrador en lugar de tirar los dados de nuevo.
¿FLUX 3 Video, Veo 3.1 o Seedance 2.5?
FLUX 3 Video para clips de 10–20 segundos que necesitan líneas habladas en muchos idiomas con sincronía labial y un flujo borrador → mejora; Veo 3.1 para realismo de 8 segundos con audio nativo y hasta tres imágenes ingrediente; Seedance 2.5 para historias de toma única de 30 segundos con hasta 50 referencias y roles explícitos. Kling 3.0 sigue siendo la opción para escenas con cortes y hablantes con nombre.
¿Quieres el brief escrito por ti — keyframes, timeline, cámara, continuidad, una línea de audio pautada y restricciones? GoldenPrompts construye briefs para FLUX 3 Video, Veo, Seedance y Kling en unos pocos clics. Pruébalo — 24 horas de todo gratis, sin tarjeta.