Google disponibiliza Gemini Omni Flash para geração de vídeo a US$ 0,10 por segundo para desenvolvedores

A Google lançou oficialmente seu modelo Gemini Omni Flash para desenvolvedores e clientes empresariais através da Gemini API e do Google AI Studio, conforme noticiado pelo VentureBeat. O lançamento em 30 de junho de 2026 marca a transição do modelo de uma prévia para consumidores — mostrada pela primeira vez no Google I/O em maio — para uma ferramenta pronta para produção voltada a empresas que constroem fluxos de trabalho de vídeo em escala.
O modelo gera vídeo em 720p a US$ 0,10 por segundo, igualando o nível Veo 3.1 Fast, mas subcotando drasticamente o Veo 3.1 padrão, que custa US$ 0,40 por segundo. Essa redução de 75% coloca um clipe de dez segundos em aproximadamente US$ 1 — uma mudança significativa para desenvolvedores e equipes de marketing que antes achavam a geração de vídeo com IA proibitivamente cara em escala.
Edição conversacional muda o fluxo de trabalho de produção
A capacidade principal não é a geração em si — é a edição iterativa e conversacional. Construído sobre a nova API de interações do Google, uma interface com estado projetada para tarefas de múltiplas rodadas, o Omni Flash permite que os usuários descrevam mudanças em linguagem natural e o modelo as aplique a um clipe existente sem regenerá-lo do zero. Um profissional de marketing pode reiluminar uma foto de produto, reenquadrar uma cena ou trocar detalhes de vestuário através de uma sequência de instruções em linguagem natural, preservando o que já funcionava.
Isso colapsa o que antes era um pipeline de cinco ferramentas — LLMs separados para roteirização, geradores de imagem, modelos de vídeo, ferramentas de sincronização labial e geradores de voz — em um único modelo que aceita texto, imagens e vídeo como entradas e retorna um clipe finalizado com áudio sincronizado.
Recursos empresariais: ativos de marca, inserção de texto e barreiras contra deepfakes
Para equipes empresariais, o Omni Flash suporta entradas de referência multimodais: alimente-o com uma foto de produto ou logotipo de marca junto com um prompt de texto e o modelo incorpora o ativo real na cena gerada em vez de inventar um placeholder genérico. O modelo também lida com texto e sinalização dentro da cena — útil para vídeos de treinamento localizados ou anúncios que precisam de logotipos colocados contextualmente.
A Google construiu limites explícitos contra o uso indevido. O modelo se recusa a sincronizar os lábios de uma foto estática de uma pessoa com uma faixa de áudio — uma medida direta contra deepfakes. No entanto, ele traduzirá a fala existente em vídeo para outros idiomas, útil para organizações com equipes multilíngues. Cada saída carrega a marca d'água SynthID da Google, e a empresa está estendendo as Credenciais de Conteúdo C2PA em suas ferramentas generativas de vídeo.
As restrições atuais merecem destaque: os clipes têm limite de 10 segundos e o modelo só gera em 720p — sem opção de 1080p ou 4K. Equipes que precisam de conteúdo mais longo precisam unir clipes, e trabalhos de marca premium que exigem saída de alta resolução precisarão recorrer aos níveis Veo 3.1.
Contexto competitivo: Sora extinto, Runway observando
O lançamento da API ocorre num momento em que a OpenAI descontinuou o Sora, seu próprio produto de texto para vídeo, e a Runway continua sendo a principal alternativa independente no mercado empresarial de vídeo com IA. O preço da Google e o ângulo da edição conversacional representam um movimento direto para o segmento empresarial que esses concorrentes visavam.
Para desenvolvedores independentes e equipes pequenas especialmente, a taxa de US$ 0,10/segundo no nível da API significa que a geração de vídeo agora é economicamente viável para fluxos de trabalho de prototipagem e ferramentas internas que não justificariam os custos de assinatura da Runway ou a complexidade de unir múltiplas ferramentas pontuais.
O Gemini Omni Flash já está disponível via Gemini API e Google AI Studio. Os desenvolvedores podem acessar o card do modelo e as especificações técnicas através da documentação publicada do Google DeepMind.
Originally reported by VentureBeat. Read the original article for additional details.
View original source