OpenAI a dévoilé son nouveau modèle vidéo d’intelligence artificielle appelé Sora, qui fait ressembler les précédents outils vidéo d’IA à des jouets. Il est d’un réalisme incroyable et peut créer des clips cohérents d’une minute avec plusieurs prises de vue, le tout à partir d’une seule invite de texte.
Vous ne pourrez pas l’utiliser pendant un certain temps car, selon un porte-parole de l’entreprise avec qui j’ai parlé, « il y a des problèmes de sécurité à résoudre en premier », mais nous avons eu un aperçu de ses capacités impressionnantes.
Le réalisme est tellement avancé que j’ai vu plusieurs posts sur X du genre « Je ne peux plus dire ce qui est réel sur mon flux ». Il peut parfois s’égarer dans l’étrange vallée et ressembler davantage à un rendu hyper réaliste dans Unreal Engine qu’à celui d’un véritable appareil photo, mais cela reste impressionnant.
Mais comment OpenAI a-t-il réussi à réaliser ce « moment ChatGPT pour la vidéo générative » et que devront faire les autres modèles pour rattraper leur retard ? La réponse semble être « collecter plus d’argent ».
Tout est question de puissance de calcul

Depuis sa création, OpenAI a levé plus de 11 milliards de dollars de financement, dont la plupart proviennent de Microsoft.
Le PDG Sam Altman est désormais à la recherche de 7 000 milliards de dollars pour créer un réseau mondial d’usines de puces IA afin de répondre davantage aux besoins toujours plus exigeants en matière de puissance de traitement. C’est presque autant que le PIB combiné de l’Allemagne et de la France.
Bien que les développements majeurs observés dans Sora ne soient pas entièrement dus à l’argent ou aux ressources informatiques, ils jouent un rôle important.
La première ligne du document de recherche parle de l’utilisation d’une formation à grande échelle pour améliorer la qualité et la durée des modèles de diffusion.
Emad Mostaque, fondateur et PDG de Stability AI, l’une des sociétés qui ont construit Stable Diffusion et dirigé le développement de modèles de diffusion m’a dit que le travail sur Sora « prouve que vous pouvez évoluer à peu près n’importe quelle modalité ».
StabilityAI fonctionne également avec plusieurs modalités, notamment l’audio, l’image, la vidéo et le texte, et Mostque m’a dit lors d’une conversation sur X que l’entreprise avait désormais besoin de « obtenir plus de calcul » pour être compétitive et atteindre ces mêmes niveaux.
OpenAI a révélé un trio de vidéos montrant la valeur d’un calcul accru, allant d’une horrible créature proche d’un chien à un chien et un humain entièrement réalistes rebondissant dans la neige.
Des clips plus longs et plus variés
Actuellement, il semble universel dans la vidéo générée par l’IA que les clips durent environ 24 images par seconde, durent environ trois secondes et soient de faible qualité HD.
Sora est sorti avec une série d’exemples de clips, y compris ceux générés en réponse aux demandes des utilisateurs sur X, qui durent jusqu’à une minute et d’une résolution plus élevée. Il s’agit d’un changement radical dans la vidéo générée et promet des fonctionnalités similaires à celles de Google Lumiere.
L’autre différence significative, et cela vient probablement de la possibilité de créer un clip plus long en un seul coup, concerne plusieurs plans dans un clip généré. Un exemple fascinant se présente sous la forme d’un astronaute se préparant au lancement avec des tirs sautant entre l’homme et la machine.
Créer une simulation du monde entier

« Nos résultats suggèrent que la mise à l’échelle des modèles de génération vidéo est une voie prometteuse vers la création de simulateurs à usage général du monde physique », déclare la recherche OpenAI.
C’est l’un des principaux objectifs de tous les outils vidéo d’IA. Créer un mécanisme permettant de comprendre le monde entier tel que les humains le voient, puis l’utiliser pour créer une vidéo réaliste.
Runway, l’un des principaux laboratoires vidéo d’IA, travaille sur les modèles mondiaux généraux et écrit sur X : « Nous pensons que la prochaine avancée majeure en matière d’IA viendra de systèmes qui comprennent le monde visuel et sa dynamique, c’est pourquoi nous lançons un nouvel effort de recherche à long terme autour des modèles mondiaux généraux.
Même Meta travaille à la formation de modèles d’IA en leur faisant regarder et produire des vidéos. V-JEPA est une nouvelle méthode permettant d’apprendre aux machines à comprendre et à modéliser le monde physique à travers des vidéos.
Ils sont formés avec un objectif de prédiction de fonctionnalités et dans un exemple Le PDG Mark Zuckerberg joue de la guitarebloque le motif de grattement et V-JEPA peut le reproduire.
Qu’est-ce que cela signifie pour l’avenir de la vidéo IA ?

Le scénario de rêve ou de cauchemar – selon votre point de vue – est que vous irez sur Netflix et qu’au lieu de chercher un film, vous écrirez une invite « faites-moi un documentaire sur des créatures fictives en utilisant la voix de David Attenborough » et c’est » Je vais le générer à partir de cette invite.
C’est loin, même si avec quelques étapes supplémentaires, j’ai pu créer une bande-annonce IA pour une émission de fiction similaire.
La réalité est plus probable : tout comme Adobe l’a fait avec le remplissage génératif dans Photoshop, les outils de montage vidéo utiliseront la vidéo IA pour « combler les lacunes » ou remplacer les prises de vue perdues.
Le véritable avantage réside dans la création d’une compréhension plus profonde de l’IA du monde. Jim Fan, chercheur scientifique et expert en agents IA pour Nvidia, a expliqué qu’en son cœur, Sora est un moteur physique, une « simulation de nombreux mondes, réels ou fantastiques » et que le simulaire rend la physique, le raisonnement et la mise à la terre intuitifs.
Il prédit que Sora a probablement été formé sur des données synthétiques, telles que les rendus hyper réalistes possibles avec Unreal Engine 5, plutôt que uniquement sur de vraies vidéos. Cela l’aiderait également à comprendre la physique, car il disposerait de données d’étiquetage pour chaque aspect de l’environnement.
Cela signifie également que nous pourrions voir ces environnements vidéo reconvertis en mondes 3D et générer en temps réel des environnements virtuels ou de jeu pour les casques Vision Pro ou Quest.
- Le saut de l’IA « superintelligente » d’OpenAI a failli provoquer l’effondrement de l’entreprise – voici pourquoi
- OpenAI paie des chercheurs pour empêcher l’IA superintelligente de devenir malveillante
- OpenAI construit l’IA GPT-5 de nouvelle génération – et le PDG affirme qu’elle pourrait être superintelligente