L’amour est dans l’air en cette Saint-Valentin et quelle meilleure façon de célébrer qu’avec une chanson. Désormais, grâce à des outils d’IA comme Suno, créer de la musique pour exprimer votre passion est plus facile que jamais.
Inspiré par l’histoire d’un artiste espagnol épousant un hologramme, et pour voir à quel point il est facile de créer non seulement une chanson mais un clip vidéo en utilisant l’IA, j’ai décidé de l’essayer.
En utilisant une combinaison d’outils tels que ChatGPT, Suno, Leonardo, Stable Video et MidJourney, j’ai créé un clip vidéo pour la chanson générée « Echoes of a Digital Heart ».
Choisir un genre et générer des paroles
La première tâche consistait à trouver une idée de chanson. J’ai envisagé de travailler sur quelque chose pour ma femme, car nous sommes ensemble depuis 25 ans cette semaine, mais j’ai finalement décidé de suivre une voie amusante avec un morceau sur l’amour non partagé entre un homme et une IA.
L’étape suivante consistait à trouver un genre et à demander à ChatGPT d’écrire quelques paroles. Après quelques tentatives terribles, dont on ne parlera plus jamais, d’une chanson d’amour country classique, j’ai réalisé qu’elle devait avoir une touche plus électronique et j’ai opté pour la new wave des années 80.
Contrairement à Beyoncé, qui l’a écrasé avec le Texas Hold’em, l’IA n’a pas cette touche country. Il semble pouvoir s’inspirer du style d’A-ha, Ultravox et d’autres icônes des années 80.
Après cela, il s’agissait simplement de donner à ChatGPT le concept de base de l’histoire, le genre avec lequel je voulais jouer et de lui demander de générer les paroles d’une chanson complète avec deux couplets et un refrain.
Il en est résulté Echoes of a Digital Heart dont la phrase : « Cœurs et circuits, dans une danse du désespoir, je me perds dans ton code, un air essoufflé. » Si ce n’est pas de l’amour, qu’est-ce que c’est ?
Faire de la musique avec Suno

Suno est toujours le meilleur générateur de musique IA polyvalent que j’ai utilisé. Il y en a d’autres à venir et je pense que MusicFX de Google fait le meilleur instrument, mais Suno ajoute de la voix à ses morceaux.
J’ai créé une piste personnalisée dans Suno, en ajoutant les paroles de ChatGPT et le genre choisi. Il ne peut produire que jusqu’à environ une minute de musique en une seule fois, je l’ai donc pisé en cinq segments pour obtenir une chanson complète de trois minutes.
Chaque segment comprenait soit un couplet et un refrain, soit un pré-refrain et un refrain. Après avoir généré le clip, vous pouvez « continuer à partir de ce clip » pour conserver la musique et le style et simplement modifier les paroles. À la fin, vous pouvez « obtenir la chanson entière »
Réalisation du clip

Il s’agissait de la partie la plus difficile de tout le projet et impliquait de générer près de 80 images inpiduelles en utilisant une combinaison de MidJourney et Leonardo, puis d’animer les meilleures.
J’ai d’abord dû créer un plan d’histoire pour la chanson. J’ai demandé à ChatGPT de tracer une histoire basée sur les paroles, puis de suggérer des images (en supposant des clips de 5 secondes) qui correspondraient au récit.
Il a fait exactement ce que j’avais demandé et a même décomposé l’emplacement des clips en fonction de l’horodatage de la chanson. J’ai donc pris en compte ses suggestions, peaufiné la formulation et les ai intégrées à Leonardo. J’ai utilisé la plateforme d’IA de startup australienne car elle offre un photoréalisme et une génération vidéo impressionnants.

Près de 2 000 crédits plus tard, j’avais généré environ 90 % de la vidéo, mais il manquait deux choses : la séquence de rêve et un chanteur.
Pour la séquence de rêve, je me suis tourné vers un nouvel outil que je réviserai bientôt, Stable Video de StabilityAI. Stable Video est un générateur vidéo impressionnant basé sur le modèle Stable Video Diffusion, le même qui alimente Leonardo Motion mais avec plus de contrôle.
Pour le chanteur, je me suis tourné vers MidJourney et lui ai demandé de créer un chanteur au look britannique des années 1980 avec une ambiance rétro d’IA regardant directement la caméra. Cela n’a pas déçu, même si j’ai dû utiliser la fonction de zoom arrière MidJourney pour obtenir exactement ce que je voulais.
J’ai ensuite animé l’image du chanteur à l’aide de Pika Labs pour faire bouger la bouche et donner l’impression qu’il jouait dans la chanson.
Rassembler tout cela

La dernière étape consistait à prendre la myriade de clips générés, la musique et à tout assembler. Comme je suis sur un Mac et que je n’ai pas d’argent pour Final Cut Pro, je me suis tourné vers iMovie pour éditer le clip final de trois minutes et cela m’a donné tous les outils dont j’avais besoin.
Bien que ce ne soit pas la meilleure chanson de tous les temps, il y a un changement de style entre certains clips du clip et quelques moments où le récit est confus, je pense que dans l’ensemble, cela a fait du bon travail.
- Apple GPT : dernières nouvelles, date de sortie supposée et fonctionnalités prévues
- Bing avec ChatGPT est désormais Copilot : ce que cela signifie pour vous
- Google dévoile Gemini AI pour le chatbot Bard – et il pourrait battre ChatGPT