Gemini Omni 1.1 Flash lleva la IA de video a un nuevo nivel

Gemini Omni 1.1 Flash permite extender escenas, crear transiciones y generar videos hasta 4K con mayor control para proyectos profesionales.

Gemini Omni 1.1 Flash lleva la IA de video a un nuevo nivel
Gemini Omni 1.1 Flash lleva la IA de video a un nuevo nivel

Gemini Omni acaba de recibir una actualización que amplía las posibilidades para crear y editar videos mediante inteligencia artificial. Google presentó Gemini Omni 1.1 Flash, una nueva versión que incorpora herramientas para tener mayor control sobre las escenas, prolongar videos existentes, trabajar con imágenes de referencia y generar resultados en resoluciones de hasta 4K. La compañía describe esta actualización como una evolución orientada a la producción de video y disponible para desarrolladores mediante Google AI Studio y la API de Gemini.

La idea es sencilla: en lugar de limitarse a generar un clip desde cero, el usuario puede indicarle a la IA qué quiere conservar, cómo debe continuar una escena o entre qué imágenes debe realizar una transición. De esta manera, Gemini Omni busca facilitar un proceso que se parece más a trabajar con una herramienta de edición que a simplemente escribir una instrucción y esperar un resultado.

Gemini Omni permite extender escenas y mantener el contexto

Una de las novedades principales de Gemini Omni 1.1 Flash es la posibilidad de tomar un video existente y continuar la escena. Para hacerlo, el modelo puede analizar hasta 10 segundos del contexto anterior, en lugar de considerar únicamente el último segundo. Google señala que esto permite mantener una mayor consistencia visual y narrativa al prolongar el material.

La extensión funciona en incrementos de hasta 10 segundos y puede alcanzar una extensión acumulada de 40 segundos. Esto significa que el usuario puede partir de una escena que ya tiene y pedir que continúe, describiendo mediante texto qué debería suceder después. La herramienta también permite utilizar un primer y un último fotograma como referencias para generar el movimiento que conecta ambos momentos, una función pensada para controlar mejor las transiciones y los desplazamientos de cámara. 

Así se implementa la herramienta de IA de Google

Para utilizar Gemini Omni, el funcionamiento parte de una entrada que puede combinar texto, imágenes o video. En el caso de la generación de video desde texto, el usuario describe la escena que quiere crear y puede especificar elementos como el movimiento de la cámara, la iluminación, el ambiente y la acción. La API de Gemini permite realizar estas solicitudes y recibir el video generado como resultado. 

También es posible proporcionar imágenes para convertirlas en video o utilizar dos imágenes como primer y último fotograma. En ese segundo caso, la IA genera la transición entre ambas referencias. Google además permite trabajar con videos de referencia de hasta tres segundos para ayudar a trasladar movimiento, contexto visual o características de los personajes a una nueva escena. 

Otra parte importante de la implementación es la edición mediante lenguaje natural. Con la API de Interactions, los desarrolladores pueden trabajar de forma conversacional y solicitar modificaciones sobre un video, describiendo qué quieren cambiar mientras intentan conservar los elementos que desean mantener. Así, la herramienta puede integrarse en aplicaciones y flujos de trabajo dedicados a generación y edición de contenido audiovisual. 

Videos de prueba rápidos y resultados hasta 4K

Gemini Omni 1.1 Flash también incorpora una forma de probar ideas antes de producir el resultado de mayor calidad. Google permite generar borradores en 360p para revisar rápidamente una escena, composición o concepto y después avanzar hacia una versión con mayor resolución. Esta posibilidad está pensada para facilitar cambios durante la etapa de prueba y reducir el tiempo necesario para experimentar con diferentes propuestas. 

Una vez que el usuario tiene una versión que le convence, Gemini Omni 1.1 Flash puede generar videos en 1080p o 4K. Google también destaca la posibilidad de utilizar la herramienta para mejorar la resolución de determinados materiales y preparar clips con una calidad más alta para distintos flujos de producción. 

La nueva versión de Gemini Omni está disponible para desarrolladores a través de Google AI Studio y la API de Gemini, mientras que las funciones de video también se integran en Google Flow. La disponibilidad de determinadas funciones para usuarios depende del producto, el plan y la ubicación. Con estas herramientas, Google amplía su apuesta por una inteligencia artificial capaz de crear y editar video a partir de instrucciones, referencias visuales y conversaciones.

Artículo anteriorHarald V muere a los 89 años y Noruega despide a su rey
Owen Michell es nuestro editor especializado en noticias digitales, con un profundo conocimiento en identificar tendencias y desarrollar contenido de consulta. Su experiencia en el panorama digital le permite brindar información relevante y atractiva para nuestra audiencia. Su pericia en el ámbito de las noticias digitales contribuye a la autoridad y actualidad de nuestro sitio.
Salir de la versión móvil