Google lance Gemini Omni 1.1 Flash : vidéos IA jusqu'à 40 secondes et conversion ascendante en 4K

Google a présenté Gémeaux Omni 1.1 Flashla nouvelle version de son modèle de génération vidéo avec intelligence artificielle. La mise à jour vous permet d'étendre les scènes jusqu'à 40 secondes sans perdre la cohérence visuelle et ajoute le contrôle des images clés et la mise à l'échelle 4K, deux fonctions qui élargissent la portée du travail de ceux qui produisent du contenu audiovisuel avec l'IA.

La génération vidéo avec l'IA rencontrait depuis un certain temps la même limitation que nous avons nous-mêmes remarquée en testant des outils similaires : la mémoire du modèle était à peine suffisante pour mémoriser la dernière seconde de la séquence, donc toute continuation finissait par briser l'éclairage, le mouvement ou l'identité des personnages à l'écran. Avec Omni 1.1 Flash, Google étend cette fenêtre d'analyse à dix secondes avant de la vidéo originale, par rapport à la seule seconde traitée par la version précédente. Ainsi, le modèle peut conserver la physique d’une scène et la cohérence visuelle lors de la génération de la section suivante, au lieu d’improviser sur une seule image.

Extension des scènes par blocs de dix secondes

Le modèle peut construire des séquences allant jusqu'à 40 secondes, mais il ne le fait pas d'un seul coup : voyons comment. Omni 1.1 Flash génère la vidéo en fragments de dix secondes qui sont enchaînés, et chaque nouveau bloc prend la section immédiatement précédente comme référence. Cette méthode par étapes laisse la possibilité d'examiner le résultat avant de continuer à générer et empêche une erreur d'un fragment de se répercuter sur le reste de la séquence.

A cette amélioration s'ajoute l'interpolation de l'image initiale et finale : il suffit de télécharger une image qui marque le début du plan et une autre qui marque la fermeture pour que le modèle calcule le mouvement intermédiaire entre les deux. Google propose des usages tels que des orbites de caméra, des zooms, des transitions entre plans ou des boucles qui doivent correspondre à un point de départ et un point d'arrivée précis. Le système préserve également le édition conversationnelle des versions précédentes, afin que nous puissions demander des modifications à un clip déjà généré sans redémarrer le processus à partir de zéro.

Mise à l'échelle 4K et prix par seconde de vidéo

La résolution par défaut est toujours de 720p, avec 360p disponible pour des tests rapides. Selon la documentation de l'API Gemini, 1080p et 4K sont obtenus grâce à une mise à l'échelle à partir de cette base : le modèle ne génère pas ces pixels de manière native, il les étend ultérieurement. Nous vous conseillons de garder cette nuance à l’esprit avant d’évaluer la réelle clarté du résultat que nous allons obtenir.

Application officielle Google Gemini AI pour la création d'images. Photo : capture Softzone.

Google a fixé un prix différent pour chaque résolution, ce qui nous permet d'ajuster la dépense en fonction de la phase du projet :

  • 360p: 0,03 $ par seconde, destiné aux brouillons et aux preuves de concept.
  • 720p: 0,10 $ par seconde.
  • 1080p: 0,15 $ par seconde.
  • 4K: le tarif serait d'environ 0,30$ par seconde s'il suivait la même progression que le reste des résolutions, bien que ce prix précis ne soit pas confirmé dans la documentation disponible jusqu'à présent.

Si ce taux est confirmé, un extrait de 40 secondes en 4K coûterait environ 12$, contre 1,20$ pour la même durée en 360p. La différence laisse la possibilité de tester des idées en basse qualité et de réserver la dépense en 4K uniquement au résultat déjà validé, chose particulièrement utile si le projet nécessite plusieurs itérations avant de trouver le plan final.

Où le nouveau modèle est-il disponible ?

Omni 1.1 Flash fonctionne désormais via API Gémeaux et Google AI Studio, en plus de Gemini Enterprise Agent Platform, qui donne accès aux développeurs qui souhaitent l'intégrer dans leurs propres outils. Pour le public final, la mise à jour concerne Flow pour ceux qui disposent d'un abonnement Google AI Plus, Pro ou Ultra, et la fonction d'extension de scène est également disponible pour ces abonnés directement depuis l'application Gemini.

Le modèle sort également du catalogue de Google. Adobe a intégré Gemini Omni Flash dans Firefly, permettant à ceux qui travaillent déjà avec cette suite de montage de générer et d'étendre des vidéos sans quitter leur flux habituel. Google, de son côté, l'a également apporté à Vids, son outil de création de vidéos d'entreprise. Les deux intégrations ouvrent la porte à la génération de vidéos synthétiques pour atteindre des flux de travail qui dépendaient jusqu'à présent d'autres applications de montage externes.

FAQ Flash Gemini Omni 1.1

Quelle durée vidéo maximale le Gemini Omni 1.1 Flash peut-il produire ?

Le modèle permet d'étendre les scènes jusqu'à un total de 40 secondes, générant les fragments par blocs de 10 secondes pour maintenir la cohérence.

La résolution 4K est-elle générée nativement ?

Non, les résolutions 1080p et 4K sont obtenues grâce à une mise à l'échelle à partir d'une génération de base de 720p.

Quel est le prix de la génération de vidéo avec Gemini Omni 1.1 Flash ?

Le coût confirmé est de 0,03 $ par seconde en 360p, de 0,10 $ en 720p et de 0,15 $ en 1080p. Le taux de 4K serait d'environ 0,30 $ par seconde si la même progression se poursuivait, même si cette donnée n'est pas officiellement confirmée.

Où le nouveau modèle vidéo de Google est-il disponible ?

Il est disponible via l'API Gemini, Google AI Studio, Google Flow pour les abonnés payants et a été intégré à des outils comme Adobe Firefly et Google Vids.