Publicado 2026-09-16 · Actualizado 2026-09-16

Gemini Omni 1.1 Flash: escenas de 40 segundos, primer/último fotograma y 4K

Respuesta corta: Omni 1.1 Flash es la actualización de control de Google. Escribe el plano como una descripción sencilla y temporizada, marca tus imágenes con las etiquetas que lee el modelo (<FIRST_FRAME>, <LAST_FRAME>, <IMAGE_REF_1>), pon eventos y líneas en códigos de tiempo como [0-3s], haz un borrador a 360p, extiende en pasos de 10 segundos hasta 40 y escala la toma aprobada a 1080p o 4K. No hay prompts negativos ni instrucciones de sistema: todo lo que quieres o prohíbes va en el propio prompt.

Qué hay de nuevo en Omni 1.1 Flash

  • Extensión de escena a 40 segundos. El modelo ahora lee los últimos 10 segundos del vídeo existente como contexto (los anteriores solo miraban el último fotograma) y añade incrementos de 10 segundos, así que el movimiento y la historia atraviesan el corte.
  • Control de primer y último fotograma. Dos imágenes, dos etiquetas, y el modelo genera el vídeo continuo entre ellas: la forma más limpia de clavar un movimiento de cámara o una transición donde la planeaste.
  • Referencias de vídeo. Hasta tres clips de un máximo de tres segundos guían el movimiento o el look; su audio se ignora.
  • Borradores 360p y escalado a 4K. Los borradores renderizan hasta un 60 % más rápido y a un tercio del coste de 720p; los finales son 720p por defecto, 1080p o 4K escalados.
EspecificaciónGemini Omni 1.1 Flash
ID del modelogemini-omni-1.1-flash (Gemini API, Google AI Studio, Gemini Enterprise Agent Platform; Flow para AI Plus/Pro/Ultra; app Gemini)
Duración3–10 s por llamada; extensión de escena en pasos de 10 s hasta 40 s en total, leyendo los últimos 10 s como contexto
Resoluciónborrador 360p; 720p por defecto; 1080p y 4K escalados
Relación de aspecto / fps16:9 (por defecto) o 9:16; 24 fps
Referenciasimágenes con <IMAGE_REF_N>; hasta tres clips de vídeo de máx. 3 s con <VIDEO_REF_N> (su audio se ignora); <FIRST_FRAME> / <LAST_FRAME> para transiciones
Audiose genera por defecto; diálogo y sonidos con códigos de tiempo tipo [0-3s]; sin subida de audio
No soportadoinstrucciones de sistema, temperature, top_p, secuencias de parada, prompts negativos: escribe las exclusiones como restricciones normales
Procedenciamarca de agua SynthID en cada salida

La estructura del prompt

Omni quiere instrucciones naturales y literales, no listas de palabras clave. El mismo brief de director de 2026 que funciona para Seedance 2.5 y Veo 3.1 funciona aquí, con dos hábitos propios de Omni: etiquetas para los medios y códigos de tiempo para el tiempo.

  1. Primero las etiquetas. <FIRST_FRAME> y <LAST_FRAME> para una transición planificada; <IMAGE_REF_N> con un rol («controla solo la identidad»); <VIDEO_REF_N> para un movimiento o look que quieras copiar.
  2. Una frase de intención — qué es el plano, cuánto dura, en qué espacio y luz — seguida de «keep everything else the same» al editar o extender.
  3. Códigos de tiempo para cada beat: [0-3s], [3-6s], una acción visible por beat y dónde se asienta el movimiento.
  4. Cámara como un movimiento explícito y un objetivo.
  5. Audio descrito explícitamente: tono de sala, efectos y diálogo entre comillas con el segundo y el idioma.
  6. Restricciones en palabras llanas («no on-screen text, no extra people»): los prompts negativos no se admiten, así que las exclusiones viven en el prompt.

Un ejemplo completo (8 s, primer/último fotograma, diálogo)

<FIRST_FRAME> the model stands at the far end of a sunlit loft, back to camera, 16:9.
<LAST_FRAME> the same model in the same loft, now facing the camera at arm's length, soft smile.
<IMAGE_REF_1> controls her identity, face and body only - not her pose, clothing, background or lighting.

Generate an 8-second continuous shot between the first and last frame in the same loft and the same morning light. Keep everything else the same: the cream linen suit, the hair, the window light from the left.
[0-3s] she turns and walks toward the camera at an easy pace, heels on the wooden floor.
[3-6s] she slows, adjusts the lapel with her right hand, eyes on the lens.
[6-8s] she stops at arm's length and settles into the soft smile of the last frame.
Camera: slow push-in at eye level, 35 mm, no zoom, no cuts.
Audio: her heels on wood, quiet room tone, a distant tram outside; at 6 s she says "Ready when you are." in English, calm; no music.
Constraints: no on-screen text, no extra people, no watermark, no morphing.

Borrador, extender, escalar

  1. Borrador a 360p. Comprueba el tiempo, el asentamiento final y la colocación del diálogo mientras es barato y rápido.
  2. Extiende en pasos de 10 segundos. Cada extensión lee los últimos 10 segundos, así que escribe el siguiente beat como continuación («she keeps walking, the camera keeps pushing in») y repite literalmente el rol de identidad y la línea de continuidad. Para en 40 segundos por escena.
  3. Escala la toma aprobada a 1080p o 4K. El escalado afina; no arregla un mal corte, así que aprueba el movimiento en resolución de borrador.

Editar metraje existente sigue la misma regla: una instrucción sencilla («replace the red jacket with a cream linen suit, keep everything else the same») gana a un párrafo de adjetivos.

Omni 1.1 Flash frente a los demás

  • Elige Omni 1.1 Flash para extender una escena más allá de 8 segundos dentro del stack de Google, controlar el primer y último fotograma o editar metraje con una frase.
  • Elige Veo 3.1 para clips hero fotorrealistas de 8 segundos con la luz más realista y hasta tres imágenes ingrediente.
  • Elige Seedance 2.5 para historias de toma única de 30 segundos con hasta 50 referencias y roles explícitos — ver la guía de prompts de Seedance 2.5.
  • Elige FLUX 3 Video para voz multilingüe con sincronía labial en clips de 5–20 segundos — ver la guía de FLUX 3 Video.

El roster completo y los precios están en generadores de vídeo IA 2026.

Errores habituales

  • Prompts negativos o instrucciones de sistema: no soportados; escribe las restricciones en el prompt.
  • Subir un archivo de audio como referencia: no soportado; describe el sonido.
  • Añadir diálogo nuevo al extender un clip en el que ya habla alguien: no es posible; planifica las líneas por escena.
  • Referencias de vídeo de más de 3 segundos o más de tres clips: se recortan o se rechazan.
  • Extender sin repetir el rol de identidad y la línea de continuidad: el personaje se desvía en el corte.
  • Aprobar en 4K: primero borrador a 360p; el escalado no repara el movimiento.

Preguntas frecuentes

¿Qué es Gemini Omni 1.1 Flash?

El modelo de generación de vídeo de Google (ID de modelo gemini-omni-1.1-flash), anunciado el 27 de agosto de 2026 como una actualización lista para producción de Gemini Omni Flash. Genera y edita vídeo con audio y añade cuatro controles: extensión de escena a 40 segundos con 10 segundos de contexto previo, control de primer y último fotograma, hasta tres referencias de vídeo de 3 segundos y borradores 360p que se escalan a 1080p o 4K.

¿Cuánto puede durar un clip?

Cada llamada genera o continúa de 3 a 10 segundos. La extensión de escena añade incrementos de 10 segundos y lee los últimos 10 segundos del vídeo existente como contexto (los modelos anteriores solo miraban el último fotograma), hasta un total de 40 segundos por escena. Las piezas más largas son varias escenas montadas.

¿Cómo funciona el control de primer y último fotograma?

Adjunta dos imágenes y márcalas en el prompt con las etiquetas <FIRST_FRAME> y <LAST_FRAME>. El modelo genera el vídeo continuo entre ambas: la forma más limpia de conseguir un movimiento de cámara planificado o una transición que aterrice exactamente donde quieres.

¿Genera audio y diálogo?

Sí. El modelo genera una pista de audio por defecto y puedes temporizar eventos y líneas con códigos de tiempo como [0-3s]. No se admite subir referencias de audio, el audio dentro de una referencia de vídeo se ignora y no se puede añadir diálogo nuevo al extender un vídeo subido en el que ya habla alguien.

¿Cuál es la forma más barata de iterar?

Borrador a 360p, que según Google renderiza hasta un 60 % más rápido y a un tercio del coste de los 720p estándar; corrige el tiempo y el movimiento, luego renderiza la toma aprobada a 720p y escálala a 1080p o 4K. Google publica precios por tokens; consulta su tabla para las tarifas actuales.

¿Omni 1.1 Flash, Veo 3.1 o Seedance 2.5?

Omni 1.1 Flash cuando necesites extender una escena más allá de 8 segundos dentro del ecosistema de Google, controlar el primer y último fotograma o editar metraje existente con una instrucción sencilla. Veo 3.1 para clips hero fotorrealistas de 8 segundos con la luz más realista. Seedance 2.5 para historias de toma única de 30 segundos con hasta 50 referencias y roles explícitos. FLUX 3 Video para voz multilingüe con sincronía labial en clips de 5–20 segundos.


¿Quieres las etiquetas, los códigos de tiempo, la cámara, el audio y las restricciones escritos por ti? GoldenPrompts construye briefs para Omni, Veo, Seedance y Kling en unos pocos clics. Pruébalo — 24 horas de todo gratis, sin tarjeta.