Dirección en lenguaje natural
Describe la escena, la acción, la cámara, el estilo, la iluminación y la transformación solicitada en un solo mensaje.
Gemini Omni vídeo multimodal
Cree un vídeo a partir de indicaciones y referencias visuales, o transforme un clip existente con dirección en lenguaje natural. Elige el formato y sigue online el resultado asincrónico.
Producción
Tu vídeo aparecerá aquí.
Escriba un mensaje, agregue medios de referencia opcionales y envíe una tarea Gemini Omni.
El modelo, explicado.
Gemini Omni es un generador de video de IA multimodal que puede interpretar un mensaje escrito junto con imágenes de referencia y un video fuente opcional.
Utilice el mismo espacio de trabajo para crear un nuevo clip a partir de texto e imágenes o transformar el metraje existente mientras describe los elementos que deben cambiar y permanecer consistentes.
La página envía la solicitud a FramePack como una tarea asincrónica, sigue su progreso y almacena de forma privada el vídeo completo para su vista previa y descarga autenticada.
Dirección de vídeo multimodal
Combine la dirección en lenguaje natural con el contexto visual y luego elija la configuración de salida que se ajuste a su canal de entrega.
Describe la escena, la acción, la cámara, el estilo, la iluminación y la transformación solicitada en un solo mensaje.
Agregue imágenes como guía visual y, opcionalmente, un video fuente para transformación o edición.
Elija encuadre horizontal o vertical, salida de 720p, 1080p o 4K y una duración admitida cuando no haya vídeo fuente presente.
Supervise la tarea de generación y acceda al vídeo terminado a través de enlaces de descarga y vista previa privada.
Tres pasos enfocados
Déle al modelo una instrucción clara, agregue solo el contexto visual que necesita y revise el resultado completo.
Defina el tema, la acción, el tratamiento visual y el comportamiento de la cámara, incluido lo que debe permanecer constante durante una edición.
Cargue imágenes de referencia o un video fuente opcional, luego elija la relación de aspecto, la resolución y la duración cuando estén disponibles.
Envíe la tarea multimodal, siga su estado y obtenga una vista previa o descargue la salida almacenada de forma privada.
Utilice referencias visuales de forma selectiva y haga explícita cada transformación solicitada.
Preguntas, respondidas
Puede crear un video a partir de imágenes de referencia e indicaciones, o transformar un video cargado con instrucciones en lenguaje natural.
La página admite hasta siete unidades de medios. Cada imagen utiliza una unidad y un vídeo fuente opcional utiliza dos, lo que deja espacio para hasta cinco imágenes junto a ese vídeo.
Sin un vídeo fuente, puedes elegir 4, 6, 8 o 10 segundos. Cuando se incluye un vídeo fuente, Gemini Omni determina la duración de la salida automáticamente.
FramePack almacena el resultado completo de forma privada y expone enlaces de vista previa y descarga autenticados una vez que la tarea de generación se realiza correctamente.
Combine un mensaje con referencias visuales enfocadas y cree su próximo clip con Gemini Omni.
Crear con Gemini Omni