Gemini Pro 1.5 de Google peut désormais entendre et voir : ce que cela signifie pour vous

Par
Jugo Mobile
Jugo Mobile est une plateforme dédiée à du contenu de haute qualité dans les domaines du gaming, des sports et de la technologie. Engagez-vous avec un...
6 min de lecture

Google a mis à jour son modèle d’intelligence artificielle incroyablement puissant Gemini Pro 1.5 pour lui donner la possibilité d’entendre pour la première fois le contenu d’un fichier audio ou vidéo.

La mise à jour a été annoncée à Google Suivantle géant de la recherche confirmant que le modèle peut écouter un clip téléchargé et fournir des informations sans avoir besoin d’une transcription écrite.

Cela signifie que vous pouvez lui faire une présentation documentaire ou vidéo et lui poser des questions sur n’importe quel moment, audio et vidéo, du clip.

Cela fait partie d’une initiative plus large de Google visant à créer davantage de modèles multimodaux capables de comprendre une variété de types de saisie au-delà du simple texte. Cette décision est possible grâce au fait que la famille de modèles Gemini est formée simultanément à l’audio, à la vidéo, au texte et au code.

Quoi de neuf dans Gemini Pro 1.5 ?

Google Gemini est disponible en trois tailles de modèle

(Crédit image : Google)

Google a lancé Gemini Pro 1.5 en février avec une fenêtre contextuelle d’un million de jetons. Ceci, combiné aux données de formation multimodales, lui permet de traiter des vidéos.

Le géant de la technologie a désormais ajouté le son aux options de saisie. Cela signifie que vous pouvez lui proposer un podcast et lui faire écouter des moments clés ou des mentions spécifiques. Il peut faire la même chose pour l’audio joint à un fichier vidéo, tout en analysant également le contenu vidéo.

La mise à jour signifie également que Gemini peut désormais générer des transcriptions pour les clips vidéo, quelle que soit leur durée d’exécution, et trouver un moment spécifique dans le fichier audio ou vidéo.

La nouvelle mise à jour fait partie du niveau intermédiaire de la famille Gemini, qui se décline en trois facteurs de forme : le petit Nano pour l’appareil, Pro alimentant la version gratuite du chatbot Gemini et Ultra alimentant Gemini Advanced.

Pour une raison quelconque, Google n’a publié que la mise à jour 1.5 de Gemini Pro plutôt que d’Ultra, ce qui signifie que son modèle de niveau intermédiaire surpasse désormais la version la plus avancée. On ne sait pas s’il y aura un Gemini Ultra 1.5 ou quand il sera accessible s’il est lancé.

La fenêtre contextuelle massive — commençant à 250 000 (similaire à Claude 3 Opus) et pouvant atteindre plus d’un million pour certains utilisateurs approuvés — signifie que vous n’avez pas non plus besoin d’affiner un modèle sur des données spécifiques. Vous pouvez charger ces données au début d’une discussion et simplement poser des questions.

La mise à jour signifie également que Gemini peut désormais générer des transcriptions pour les clips vidéo, quelle que soit leur durée d’exécution, et trouver un moment spécifique dans le fichier audio ou vidéo.

Comment accéder à Gemini Pro 1.5 ?

sommetAI

(Crédit image : Google)

J’imagine qu’à un moment donné, Google mettra à jour son chatbot Gemini pour utiliser les modèles 1.5, peut-être après la conférence des développeurs Google I/O le mois prochain. Pour l’instant, il n’est disponible que via le tableau de bord des développeurs Google Cloud, VertexAI.

Bien que VertexAI soit un outil puissant pour interagir avec une gamme de modèles, créer des applications d’IA et tester ce qui est possible, il n’est pas largement accessible et s’adresse principalement aux développeurs, aux entreprises et aux chercheurs plutôt qu’aux consommateurs.

Grâce à VertexAI, vous pouvez insérer toute forme de média visuel ou audio, comme un court métrage ou une personne donnant une conférence, et ajouter une invite de texte. Cela pourrait être « donnez-moi cinq puces résumant le discours » ou « combien de fois ont-ils dit Gémeaux ».

Le public principal de Google pour Gemini Pro 1.5 est celui des entreprises avec des partenariats déjà en cours avec TBS, REplit et d’autres qui l’utilisent pour le balisage de métadonnées et la création de code.

Google a également commencé à utiliser Gemini Pro 1.5 dans ses propres produits, notamment l’assistant de codage Generative AI Code Assist pour suivre les modifications dans les bases de code à grande échelle.

Qu’est-ce que Google a annoncé d’autre ?

Les modifications apportées à Gemini Pro 1.5 ont été annoncées lors de Google Next, ainsi qu’une mise à jour importante du modèle d’image DeepMind AI Imagen 2 qui alimente les capacités de génération d’images Gemini.

Il s’agit d’une peinture et d’un support où les utilisateurs peuvent supprimer ou ajouter n’importe quel élément d’une image générée. Ceci est similaire aux mises à jour qu’OpenAI a récemment apportées à son modèle DALL-E.

Google va également commencer à ancrer ses réponses IA sur Gemini et d’autres plates-formes avec la recherche Google afin qu’elles contiennent toujours des informations à jour.

  • ChatGPT Plus vs Copilot Pro : quel chatbot premium est le meilleur ?
  • J’ai opposé Google Bard à Gemini Pro contre ChatGPT – voici le gagnant
  • Runway vs Pika Labs : quel est le meilleur outil vidéo d’IA ?

Partager cet article
Suivre
Jugo Mobile est une plateforme dédiée à du contenu de haute qualité dans les domaines du gaming, des sports et de la technologie. Engagez-vous avec un contenu de qualité et connectez-vous avec d'autres passionnés et experts. Découvrez les dernières tendances et innovations au sein de notre communauté dynamique. Rejoignez-nous et vivez l'avenir dès aujourd'hui !
Développez votre marque et atteignez un plus large public. Faites de la publicité avec nous dès aujourd’hui et soyez remarqué par des milliers de personnes.
© 2025 Jugo Mobile. Tous droits réservés.