AIO APEX

Google lanza Gemini Omni Flash para generación de video a $0.10 por segundo para desarrolladores

VentureBeat
Compartir:
Google lanza Gemini Omni Flash para generación de video a $0.10 por segundo para desarrolladores

Google ha lanzado oficialmente su modelo Gemini Omni Flash para desarrolladores y clientes empresariales a través de Gemini API y Google AI Studio, según informó VentureBeat. El lanzamiento el 30 de junio de 2026 marca la transición del modelo desde una vista previa para consumidores — mostrada por primera vez en Google I/O en mayo — hasta convertirse en una herramienta lista para producción para empresas que construyen flujos de trabajo de video a escala.

El modelo genera video en 720p a $0.10 por segundo, igualando el nivel Veo 3.1 Fast pero superando drásticamente al Veo 3.1 estándar, que cuesta $0.40 por segundo. Esa reducción de precio del 75% sitúa un clip de diez segundos en aproximadamente $1 — un cambio significativo para desarrolladores y equipos de marketing que antes encontraban la generación de video con IA prohibitivamente costosa a escala.

La edición conversacional cambia el flujo de trabajo de producción

La capacidad principal no es la generación en sí misma — es la edición iterativa y conversacional. Construido sobre la nueva API de interacciones de Google, una interfaz con estado diseñada para tareas de múltiples turnos, Omni Flash permite a los usuarios describir cambios en lenguaje natural y que el modelo los aplique a un clip existente sin regenerar desde cero. Un comercializador puede reiluminar una toma de producto, reencuadrar una escena o cambiar detalles de vestuario a través de una secuencia de instrucciones en lenguaje natural, preservando lo que ya funcionaba.

Esto colapsa lo que antes era un pipeline de cinco herramientas — LLM separados para guiones, generadores de imágenes, modelos de video, herramientas de sincronización de labios y generadores de voz — en un solo modelo que acepta texto, imágenes y video como entradas y devuelve un clip terminado con audio sincronizado.

Funciones empresariales: activos de marca, inserción de texto y barreras contra deepfakes

Para equipos empresariales, Omni Flash admite entradas de referencia multimodales: aliméntalo con una foto de producto o logotipo de marca junto con un prompt de texto y el modelo incorpora el activo real en la escena generada en lugar de inventar un marcador genérico. El modelo también maneja texto y señalización dentro de la escena — útil para videos de entrenamiento localizados o anuncios que necesitan logotipos colocados contextualmente.

Google ha establecido límites explícitos contra el mal uso. El modelo se niega a sincronizar los labios de una foto fija de una persona con una pista de audio — una medida directa contra los deepfakes. Sin embargo, traducirá el discurso existente en video a otros idiomas, útil para organizaciones con equipos multilingües. Cada salida lleva la marca de agua SynthID de Google, y la empresa está ampliando las Credenciales de Contenido C2PA a través de sus herramientas generativas de video.

Las limitaciones actuales son notables: los clips tienen un máximo de 10 segundos y el modelo solo genera a 720p — sin opción de 1080p o 4K. Los equipos que necesiten contenido más largo deben unir clips, y los trabajos de marca premium que requieran salida de alta resolución deberán recurrir a los niveles Veo 3.1.

Contexto competitivo: Sora desaparecido, Runway observando

El lanzamiento de la API llega en un momento en que OpenAI ha discontinuado Sora, su propio producto de texto a video, y Runway sigue siendo el principal alternativo independiente en el mercado empresarial de video con IA. El precio de Google y el ángulo de edición conversacional representan un movimiento directo hacia el segmento empresarial al que apuntaban esos competidores.

Para desarrolladores independientes y equipos pequeños especialmente, la tarifa de $0.10/segundo a nivel de API significa que la generación de video ahora es económicamente viable para flujos de trabajo de prototipos y herramientas internas que no justificarían los costos de suscripción de Runway o la complejidad de unir múltiples herramientas puntuales.

Gemini Omni Flash ya está disponible a través de Gemini API y Google AI Studio. Los desarrolladores pueden acceder a la tarjeta del modelo y las especificaciones técnicas a través de la documentación publicada de Google DeepMind.

Originally reported by VentureBeat. Read the original article for additional details.

View original source
Compartir: