L'API de Gemini reçoit le modèle de création d'étoiles pour l'IA: ce sont ses plans

Google continue d'avancer sans cesse dans la multifonction des Gémeaux. Et c'est qu'avec l'image 4, nous avons un puissant moteur de génération d'images. Maintenant, en outre, disponible via l'API de Gemini et Google AI Studio. Ce mouvement est également un saut pour les développeurs et les entreprises du monde entier.

Et maintenant, nous serons en mesure d'incorporer les meilleures capacités d'image de cette manière, nous pouvons transformer le texte en images chaque fois que nous le demandons. Mais toujours sous plusieurs degrés de qualité, de vitesse et de prix. Grâce à cette intégration, il n'est plus nécessaire de nous tourner vers une interface visuelle. Il suffit d'une ligne de code afin que tout site Web, application mobile ou backend commercial puisse générer des illustrations, des affiches, des croquis ou tout contenu graphique à partir d'une simple instruction.

L'API nous laisse également choisir entre trois variantes: Fast, Standart et Ultra. Cela dépendra de la nécessité de résolution, de fidélité ou de coût des élections. Par conséquent, nous avons une plate-forme beaucoup plus flexible et prête à intégrer complètement dans les services numériques.

Nouvelles de l'API: trois variantes conçues pour chaque besoin

La nouvelle API de Gemini met entre les mains de tout développeur – toujours avec un compte de paiement – trois variantes nouvelles et spécifiques:

  • Image 4 Rapide. Que nous pouvons consacrer aux processus à volume élevé tout besoin urgent. Prioriser la vitesse de réponse et le faible coût, et a une précision estimée de 2 cents par image (USD).
  • Image 4 Standard. Il s'agit du modèle spécialement conçu pour trouver un équilibre entre la qualité visuelle et les performances. Il a un prix estimé de 4 cents par image.
  • Image 4 Ultra. Le plus avancé des trois. Il est capable de capturer les instructions et de générer des résultats de «fidélité extrême». Par conséquent, nous sommes confrontés à un outil parfait pour les campagnes de marketing ou la conception exigeante. Son prix atteindra 6 cents par image.

Cette approche créée par différents modules nous permettra d'adapter à la fois le coût et la qualité des résultats en fonction du projet que nous réalisons. En tout cas, il s'adapte parfaitement à une génération massive de contenu pour le commerce électronique et même l'éducation. Mais dans des contextes moins professionnels, vous pouvez créer des mèmes ou des illustrations artistiques.

Vignette générée par le système d'image 4 Ultra. Photo: développeurs Google.

Paramètres de l'API: personnalisation et contrôle réel

Avec la documentation déjà accessible, l'API de Gemini nous permet d'intégrer l'image 4 dans n'importe quel système de travail, sous le code. Et pour chaque création de contenu, nous pouvons définir des paramètres tels que:

  • Nombre d'images à la demande, que nous trouverons de 1 à 4 pour chacun.
  • Taille de l'image qui variera entre 1k ou 2k px.
  • Relation d'apparence. Que nous pouvons configurer comme 1: 1, 3: 4, 4: 3, 9:16, 16: 9.
  • Instructions d'inclusion / exclusion des personnes. Par exemple, nous trouvons des options pour les adultes, tout ou pas humain. Quelque chose d'utile concernant la politique d'un responsable.

De plus, une nouvelle amélioration est la capacité de Créer du texte lisible dans l'image elle-même. Ce qui contribue plus de profondeur lors de la génération d'affiches, de publicité ou de contenu pour les réseaux sociaux.

Enfin, nous ne pouvons pas oublier la sécurité. Toutes les images sont synthétiques. Une marque invisible Google Digital Water qui garantit la paternité d'une image sans affecter sa qualité visuelle. Quelque chose de très apprécié à la fois pour la sécurité des utilisateurs et par les créateurs qui souhaitent assurer la paternité de leurs œuvres.