
¿Qué es Gemini Omni Flash?
Gemini Omni Flash es el primer modelo de medios multimodales de any-to-any de Google DeepMind. Se anunció en Google I/O 2026 y se lanzó para desarrolladores el 30 de junio de 2026. Le proporcionas texto, imágenes, audio y video, y te devuelve un video terminado con sonido en una sola pasada.
Es el primer modelo de la familia Omni, con una versión Pro ya en desarrollo. A diferencia de un generador de texto a video común, Omni Flash razona a través de cada entrada que le das, construye un clip que respeta la física del mundo real y mantiene ese clip estable mientras lo refinas hablando con él.
Cuatro cosas lo diferencian:
Edición conversacional: Cambia un personaje, vuelve a iluminar una escena o mueve la cámara escribiendo el cambio en lenguaje sencillo. Las pistas originales de audio y video se mantienen intactas.
Referenciación multimodal: Combina una foto, una línea de texto y un clip de referencia en un solo prompt. Tu personaje, producto y estilo se mantienen consistentes a lo largo de la toma.
Conocimiento del mundo y física: Omni Flash se basa en la comprensión de Gemini sobre la gravedad, los fluidos, la historia y la lógica narrativa, por lo que una canica rueda de la forma en que debería rodar una canica y una escena histórica conserva sus detalles.
Audio nativo y sincronización: Cada clip se genera con sonido sincronizado en la misma pasada, y puedes fijar texto o gráficos a la acción en pantalla con un simple prompt.
Una cosa más que vale la pena saber: cada clip de Omni Flash lleva la marca de agua invisible SynthID de Google, activada por defecto.
Prueba el video con IA en Atlabs →
La fórmula del "Prompt perfecto"
Omni Flash entiende el lenguaje natural, así que olvídate del spam de palabras clave de la era de 2023. Describe tu toma de la forma en que un director informa a un equipo, en componentes distintos.
La fórmula:
[Sujeto + apariencia] haciendo [acción] en [entorno]. [Movimiento de cámara + encuadre]. [Iluminación + atmósfera]. [Estilo + referencia cinematográfica]. [Audio + texto en pantalla].
Desglose de ejemplo:
Sujeto: Una astronauta solitaria con un traje naranja desgastado...
Acción: ...flotando lentamente hacia la ventana agrietada de una cabina...
Entorno: ...dentro de una estación espacial silenciosa que da vueltas...
Cámara: ...un suave dolly-in, luego una órbita sutil alrededor de su casco...
Iluminación: ...iluminada solo por una luz estroboscópica roja de emergencia y la luz de estrellas lejanas...
Estilo: ...ciencia ficción cinematográfica, filmada en 35 mm, profundidad de campo superficial...
Audio y texto: ...zumbidos bajos y una alarma que pita una sola vez. Una pantalla de cabina muestra "OXÍGENO 12%".
Debido a que Omni Flash genera sonido en la misma pasada, nombrar el audio en tu prompt no es un adorno opcional. Es parte de la toma.
Construye tu primer clip →
5 plantillas de prompt de alto rendimiento
Copia estas en el generador de videos con IA en Atlabs y ajusta los detalles para tu proyecto.
1. El animador de "Dibujo a película"
Ideal para: dar vida a un boceto, fotograma de storyboard o imagen fija.
Convierte esto en metraje realista, utilizando el dibujo únicamente como guía para el movimiento. No muestres el dibujo en el video final. Agrega sonido ambiental natural. Toma continua y suave, iluminación cinematográfica.
2. El pase de "Edición conversacional"
Ideal para: corregir o cambiar el estilo de un clip que ya generaste. (Genera o sube un clip, luego escribe el cambio)
Mantén todo igual, pero cambia la tarde soleada por una noche lluviosa de hora azul. Vuelve a iluminar la escena para que coincida, agrega un sonido suave de lluvia y mantén el rostro y la ropa del personaje idénticos.
3. La escena de "Referencia multimodal"
Ideal para: mantener fijo un personaje o producto a lo largo de una nueva toma. (Adjunta una imagen de tu sujeto y un clip de referencia para el movimiento)
Video dinámico de estilo película de ciencia ficción basado en image_0. Coincide con el movimiento de cámara y la energía de video_0. Mantén exactamente el personaje de image_0, solo cambia el entorno a una azotea iluminada con luces de neón por la noche.
4. La prueba de "Física y simulación"
Ideal para: agua, tela, colisiones, reacciones en cadena.
Una canica rodando rápido en una pista de reacción en cadena hecha de dominós, engranajes y pequeñas rampas. Toma continua y suave, profundidad de campo macro. La canica obedece a la gravedad y al impulso reales. Clics nítidos y sonido de rodamiento.
5. El "Cambio de estilo sincronizado con el ritmo"
Ideal para: videos musicales y ediciones de redes sociales. (Adjunta una imagen de personaje y audio)
Ciclo de caminata de cuerpo completo del personaje de image_0, cambiando de estilo a través de cine realista, luego anime, luego animación con plastilina. Fondos de corte rápido centrando el cielo. Los cambios de estilo ocurren en sincronía con el ritmo del audio. Cinematográfico, 16:9.
Prueba estas plantillas →
Características avanzadas
¿Cómo utilizo entradas de referencia en Gemini Omni Flash?
Omni Flash acepta texto, imágenes y video juntos en un solo prompt. Adjunta una toma de producto, una hoja de personaje o una referencia de movimiento, luego dile al modelo cómo usar cada uno: "mantén al personaje de image_0" o "coincide con el movimiento de cámara en video_0". El modelo decide cómo mezclarlos en un solo clip coherente mientras mantiene estable a tu sujeto. Las referencias de voz son el primer tipo de entrada de audio compatible, con más tipos de audio en camino.
¿Puede Gemini Omni Flash editar un video existente?
Sí, y este es su truco estrella. Después de generar o subir un clip, escribe el cambio que deseas en lenguaje sencillo. Cambia un personaje, vuelve a iluminar la escena, cambia el ángulo de la cámara o agrega un objeto. El modelo aplica la edición manteniendo el audio original y el resto del fotograma consistente, por lo que refinas paso a paso en lugar de volver a generar desde cero. El resultado real se nota en la cuarta o quinta edición, cuando la escena aún se mantiene unida. Puedes realizar este tipo de pase con Modify Video en Atlabs.
Empieza a editar mediante chat →
Errores comunes que se deben evitar
Olvidar el audio. Omni Flash califica cada clip en la misma pasada. Si no describes el sonido, dejas la mitad del resultado al azar. Nombra el ambiente, los efectos y el estado de ánimo.
Sobrecargar un solo prompt. No necesitas describir un video musical completo en una sola solicitud. Genera una toma base limpia, luego aplica capas de cambios con ediciones conversacionales. Para eso está diseñado el modelo.
Esperar clips largos. En el lanzamiento, Omni Flash limita los clips a unos 10 segundos. Planifica tus tomas como ritmos y encadénalas, en lugar de pedir una escena completa de una sola vez.
Instrucciones de edición vagas. "Hazlo mejor" no le da nada al modelo. En su lugar, di "calienta la gradación de color y ralentiza el avance de la cámara".
Comparación: Gemini Omni Flash frente a Seedance 2.0
Ambos modelos manejan video y se orientan en diferentes direcciones. Omni Flash es el editor conversacional multimodal. Seedance 2.0 es el director cinematográfico de una sola pasada.
Característica | Gemini Omni Flash | Seedance 2.0 |
|---|---|---|
Ideal para | Edición conversacional paso a paso | Generación cinematográfica de una sola pasada |
Entradas | Texto, imagen, video (referencia de voz para audio) | Hasta 9 imágenes, 3 de audio, 3 referencias de video |
Estilo de edición | Ediciones en lenguaje natural en el mismo clip | Prompt o referencia de imagen, luego generar |
Duración del clip | Hasta 10 segundos en el lanzamiento | De 4 a 15 segundos |
Resolución | Límite de 720p en el lanzamiento | 4K nativo |
Audio nativo | Sí, cada clip | Sí, con sincronización al ritmo de la música |
Física | Fuerte en agua, tela, colisiones | Fuerte en movimiento, tela, emoción del personaje |
Versión corta: recurre a Omni Flash cuando quieras dar forma a una toma hablando con ella y combinar referencias mixtas. Recurre a Seedance 2.0 cuando quieras la máxima resolución y realismo cinematográfico en una sola generación. Ambos viven dentro de la línea de modelos de Atlabs, por lo que puedes cambiar entre ellos sin salir de la plataforma.
Compara modelos en Atlabs →
Recursos recomendados
Publicación oficial de lanzamiento: blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni/
Documentación para desarrolladores: ai.google.dev/gemini-api/docs/omni
Ficha del modelo: deepmind.google/models/model-cards/gemini-omni-flash/
Preguntas frecuentes
P: ¿Qué produce realmente Gemini Omni Flash? R: Video. Acepta texto, imágenes, audio y video como entrada, pero el resultado es siempre un clip de video con sonido sincronizado. Las salidas de imagen y audio están en la hoja de ruta de Omni, pero no forman parte de este lanzamiento.
P: ¿Qué duración puede tener un clip de Omni Flash? R: Los clips están limitados a unos 10 segundos en el lanzamiento. Se esperan duraciones más largas en lanzamientos posteriores. Por ahora, planifica secuencias más largas como una cadena de tomas más cortas.
P: ¿Puede mantener el mismo personaje a través de las ediciones? R: En su mayoría, sí. Rostros, ropa y voces están diseñados para mantenerse consistentes a medida que editas paso a paso. La consistencia puede variar durante grandes cambios de escena o movimientos rápidos de cámara, así que asegura a tu sujeto con una imagen de referencia donde sea importante.
P: ¿Tienen marca de agua los videos de Omni Flash? R: Sí. Cada clip lleva la marca de agua invisible SynthID de Google por defecto. Sobrevive al cambio de tamaño y a la codificación, por lo que el video generado por IA sigue siendo verificable.










