Direção da linguagem natural
Descreva a cena, a ação, a câmera, o estilo, a iluminação e a transformação solicitada em um único prompt.
Gemini Omni vídeo multimodal
Crie um vídeo a partir de um prompt e referências visuais ou transforme um clipe existente com direção em linguagem natural. Escolha o formato e acompanhe o resultado assíncrono online.
Saída
Seu vídeo aparecerá aqui
Escreva um prompt, adicione mídia de referência opcional e envie uma tarefa Gemini Omni.
O modelo, explicado
Gemini Omni é um gerador de vídeo de IA multimodal que pode interpretar um prompt escrito junto com imagens de referência e um vídeo de origem opcional.
Use a mesma área de trabalho para criar um novo clipe a partir de texto e imagens ou transformar filmagens existentes enquanto descreve os elementos que devem mudar e permanecer consistentes.
A página envia a solicitação para FramePack como uma tarefa assíncrona, acompanha seu progresso e armazena de forma privada o vídeo concluído para visualização e download autenticados.
Direção de vídeo multimodal
Combine a direção da linguagem natural com o contexto visual e, em seguida, escolha as configurações de saída adequadas ao seu canal de entrega.
Descreva a cena, a ação, a câmera, o estilo, a iluminação e a transformação solicitada em um único prompt.
Adicione imagens para orientação visual e, opcionalmente, um vídeo de origem para transformação ou edição.
Escolha enquadramento horizontal ou vertical, saída de 720p, 1080p ou 4K e uma duração suportada quando não houver vídeo de origem presente.
Monitore a tarefa de geração e acesse o vídeo finalizado por meio de links privados de visualização e download.
Três etapas focadas
Dê ao modelo instruções claras, adicione apenas o contexto visual necessário e revise o resultado concluído.
Defina o assunto, a ação, o tratamento visual e o comportamento da câmera, incluindo o que deve permanecer consistente durante uma edição.
Carregue imagens de referência ou um vídeo de origem opcional e escolha a proporção, a resolução e a duração, quando disponíveis.
Envie a tarefa multimodal, acompanhe seu status e visualize ou baixe a saída armazenada de forma privada.
Use referências visuais seletivamente e torne explícita cada transformação solicitada.
Perguntas, respondidas
Ele pode criar um vídeo a partir de um prompt e imagens de referência ou transformar um vídeo enviado com direção em linguagem natural.
A página suporta até sete unidades de mídia. Cada imagem usa uma unidade e uma fonte de vídeo opcional usa duas, deixando espaço para até cinco imagens ao lado desse vídeo.
Sem vídeo de origem, você pode escolher 4, 6, 8 ou 10 segundos. Quando um vídeo de origem é incluído, Gemini Omni determina automaticamente a duração da saída.
FramePack armazena o resultado concluído de forma privada e expõe links autenticados de visualização e download após a tarefa de geração ser bem-sucedida.
Combine um prompt com referências visuais focadas e crie seu próximo clipe com Gemini Omni.
Crie com Gemini Omni