Google rend le modèle Gemini Omni Flash disponible pour les développeurs à 0,10 $ par seconde pour la génération vidéo

Google a officiellement publié son modèle Gemini Omni Flash pour les développeurs et les clients professionnels via l'API Gemini et Google AI Studio, comme le rapporte VentureBeat. Le déploiement le 30 juin 2026 marque la transition du modèle d'un aperçu grand public — présenté pour la première fois à Google I/O en mai — vers un outil prêt pour la production destiné aux entreprises qui construisent des workflows vidéo à grande échelle.
Le modèle génère une vidéo 720p à 0,10 $ par seconde, égalant le niveau Veo 3.1 Fast mais sous-cotant considérablement le Veo 3.1 standard, qui coûte 0,40 $ par seconde. Cette réduction de prix de 75 % place un clip de dix secondes à environ 1 $ — un changement significatif pour les développeurs et les équipes marketing qui considéraient auparavant la génération vidéo par IA comme trop coûteuse à grande échelle.
L'édition conversationnelle change le workflow de production
La capacité phare n'est pas la génération elle-même — c'est l'édition itérative et conversationnelle. Construit sur la nouvelle API d'interactions de Google, une interface avec état conçue pour des tâches multitours, Omni Flash permet aux utilisateurs de décrire des changements en langage naturel et de les faire appliquer par le modèle à un clip existant sans avoir à le régénérer depuis zéro. Un responsable marketing peut rééclairer une prise de produit, recadrer une scène ou modifier des détails de vêtements via une séquence d'instructions en langage naturel, en préservant ce qui fonctionnait déjà.
Cela effondre ce qui était auparavant un pipeline de cinq outils — des LLM séparés pour l'écriture de scripts, des générateurs d'images, des modèles vidéo, des outils de synchronisation labiale et des générateurs vocaux — en un seul modèle qui accepte le texte, les images et la vidéo comme entrées et renvoie un clip finalisé avec un audio synchronisé.
Fonctionnalités d'entreprise : actifs de marque, insertion de texte et barrières anti-deepfake
Pour les équipes d'entreprise, Omni Flash prend en charge les entrées de référence multimodales : fournissez-lui une photo de produit ou un logo de marque accompagné d'un prompt textuel, et le modèle intègre l'actif réel dans la scène générée plutôt que d'inventer un espace réservé générique. Le modèle gère également le texte et la signalétique dans la scène — utile pour les vidéos de formation localisées ou les publicités nécessitant un placement contextuel de logos.
Google a mis en place des limites explicites contre les abus. Le modèle refuse de synchroniser les lèvres d'une photo fixe d'une personne avec une piste audio — une mesure directe contre les deepfakes. Il traduira cependant la parole vidéo existante dans d'autres langues, utile pour les organisations avec des équipes multilingues. Chaque sortie porte le filigrane SynthID de Google, et l'entreprise étend les Credentials de contenu C2PA à travers ses outils vidéo génératifs.
Les contraintes actuelles méritent d'être notées : les clips sont limités à 10 secondes et le modèle ne produit qu'en 720p — pas d'option 1080p ou 4K. Les équipes ayant besoin de contenu plus long doivent assembler des clips, et les travaux de marque premium nécessitant une sortie haute résolution devront se tourner vers les niveaux Veo 3.1.
Contexte concurrentiel : Sora disparu, Runway observe
Le lancement de l'API intervient alors qu'OpenAI a abandonné Sora, son propre produit texte-vers-vidéo, et Runway reste l'alternative indépendante leader sur le marché de la vidéo IA d'entreprise. Le prix de Google et l'angle de l'édition conversationnelle représentent une offensive directe vers le segment d'entreprise visé par ces concurrents.
Pour les développeurs indépendants et les petites équipes notamment, le tarif de 0,10 $/seconde au niveau de l'API signifie que la génération vidéo est désormais économiquement viable pour des workflows de prototypage et des outils internes qui ne justifieraient pas les coûts d'abonnement de Runway ni la complexité d'assemblage de plusieurs outils ponctuels.
Gemini Omni Flash est désormais disponible via l'API Gemini et Google AI Studio. Les développeurs peuvent accéder à la fiche du modèle et aux spécifications techniques via la documentation publiée de Google DeepMind.
Originally reported by VentureBeat. Read the original article for additional details.
View original source