Google a lancé mardi un nouveau produit d’intelligence artificielle lors de son événement Google I/O : Gemini Live. Nous avons tous supposé que c’était ce que l’assistant Gemini d’Android était censé faire, mais c’est Google et tout est permis.
Si cela n’avait pas lieu un jour seulement après le premier événement sur les produits grand public d’OpenAI, je me demanderais si Gemini Live a été lancé pour prendre en charge ChatGPT Voice. Les deux sont construits à l’aide de modèles d’IA multimodaux natifs et disposent de capacités vocales et vidéo impressionnantes.
Actuellement, dans la course mondiale à l’IA, les favoris semblent être OpenAI et Google, le premier semblant se rapprocher d’Apple et de l’iPhone et le second contrôlant Android. Oubliez les appareils IA comme le Rabbit r1 ou le Humane Pin : le gagnant à court terme est le smartphone.
ChatGPT Voice et Gemini Live sont tous deux intégrés dans un produit d’IA existant et aucun n’est disponible aujourd’hui, mais comment ces assistants de nouvelle génération se comparent-ils autrement ?
Comment Gemini Live et ChatGPT 4o se comparent-ils ?
Google est un peu en retrait en matière de crédibilité, notamment en ce qui concerne l’analyse vidéo en direct et les capacités vocales. Lorsqu’il a annoncé Gemini Ultra l’année dernière, il l’a fait avec une vidéo de celui-ci répondant à une vidéo en temps réel, mais ce n’était ni du temps réel ni de la vidéo.
Cependant, cette fois, ils ont mis un point d’honneur à rendre la technologie, au moins l’aspect sous-jacent du « Projet Astra », y compris la conversation vocale et vidéo, disponible pour être testé sur I/O.
Les deux offrent une interface vocale conversationnelle en langage naturel, les deux offrent la possibilité d’une analyse vidéo en direct via la caméra d’un smartphone et les deux semblent être suffisamment rapides pour une conversation vraiment naturelle où vous pouvez interrompre le flux de l’IA à mi-chemin.
Il existe cependant quelques différences notables. La voix ChatGPT d’OpenAI semble plus naturelle, peut détecter et répondre aux émotions et aux tonalités vocales et même s’adapter en temps réel à la façon dont vous lui demandez de parler. Je n’ai pas vu de preuve de cette capacité dans Gemini Live.
L’autre grande différence concerne la multimodalité. Gemini s’appuie toujours sur d’autres modèles pour la sortie, notamment en utilisant Imagen 3 pour les images et Veo pour la vidéo. GPT-4o est nativement multimodal dans les deux sens : le o signifie omni, ou dans toutes les directions. Il crée ses propres images et sons.
Gemini Live vs GPT-4o : l’avenir des assistants vocaux

Le monde semble s’orienter vers la voix et s’éloigner de la saisie de texte. Lorsque j’ai regardé pour la première fois l’annonce d’OpenAI, ma réaction a été qu’il s’agissait d’un changement de paradigme dans l’interface homme-machine, aussi important que le lancement de la souris ou de l’écran tactile.
Je partage toujours ce point de vue et le fait que Google lance également une interface vocale native au son naturel renforce encore ce sentiment. Même Meta a son MetaAI, un robot vocal disponible dans ses casques VR et ses lunettes intelligentes Ray-Ban.
Bien que le smartphone soit peut-être le gagnant pour le moment, il est clair que le véritable facteur de forme de ces modèles d’IA vocale est les lunettes intelligentes. Disponibles avec des caméras à hauteur des yeux et des bras pour envoyer des ondes sonores dans vos oreilles, ils constituent l’appareil d’IA parfait.
La question est de savoir si OpenAI se lance dans le matériel, en lançant sa propre paire de lunettes intelligentes, ou s’il s’agit du nouveau Siri qui alimentera un futur produit Apple Glasses. Aussi, si Google est vraiment assez courageux pour ressusciter les Google Glass.
- ChatGPT avec GPT-4o — Je ne me souviens pas de la dernière fois où j’ai été aussi époustouflé par une technologie
- Google vient de répondre à GPT-4o avec une démo Gemini conversationnelle et utilisant la vidéo
- OpenAI GPT-4o est en cours de déploiement : voici comment y accéder