Claude 3 Opus, le modèle d’intelligence artificielle de nouvelle génération d’Anthropic, a pris la première place du classement Chatbot Arena, poussant le GPT-4 d’OpenAI à la deuxième place pour la première fois depuis son lancement l’année dernière.
Contrairement à d’autres formes d’analyse comparative des modèles d’IA, le Arène de chatbot LMSYS repose sur des votes humains, les gens classant à l’aveugle la sortie de deux modèles différents selon la même invite.
Les différentes versions GPT-4 d’OpenAI occupent la première place depuis si longtemps que tout autre modèle se rapprochant de ses scores de référence est connu sous le nom de modèle de classe GPT-4. Peut-être devons-nous introduire un nouveau modèle de classe Claude-3 pour les futurs classements.
Il convient de noter que le score entre Claude 3 Opus et GPT-4 est très proche, et que le modèle OpenAI est disponible depuis un an, le GPT-5 « nettement différent » étant attendu à un moment donné cette année – donc Anthropic pourrait ne pas le faire. garder le poste longtemps.
Qu’est-ce que l’arène des chatbots ?
La Chatbot Arena est gérée par LMSys, la Large Model Systems Organization, et présente une grande variété de grands modèles de langage qui s’affrontent dans des batailles aléatoires anonymes.
Lancé pour la première fois en mai de l’année dernière, il a recueilli plus de 400 000 votes d’utilisateurs, les modèles d’Anthropic, OpenAI et Google occupant la plupart des dix premiers au cours de cette période.
Récemment, d’autres modèles de la startup française d’IA Mistral et des sociétés chinoises comme Alibaba ont commencé à occuper davantage les premières places et les modèles open source sont de plus en plus présents.
Il utilise le système de notation Elo, largement utilisé dans des jeux tels que les échecs, pour calculer les niveaux de compétence relatifs des joueurs. Contrairement aux échecs, cette fois le classement s’applique au chatbot et non à l’humain utilisant le modèle.
Il existe des limites à l’arène car tous les modèles ou versions de modèles ne sont pas inclus, parfois les utilisateurs trouvent que les modèles GPT-4 ne se chargent pas, et cela peut favoriser les modèles avec accès Internet en direct tels que Google Gemini Pro.
Il manque également certains modèles haut de gamme tels que le Gemini Pro 1.5 de Google avec sa fenêtre contextuelle massive et Gemini Ultra.
Claude 3 Haiku pourrait être de niveau GPT-4
Plus de 70 000 nouveaux votes ont constitué la dernière mise à jour qui a vu Claude 3 Opus prendre la première place du classement, mais même le plus petit des modèles Claude 3 a bien performé.
LMSYS a expliqué : « Claude-3 Haiku a tout impressionné, atteignant même le niveau GPT-4 selon nos préférences d’utilisateur ! Sa vitesse, ses capacités et la durée de son contexte sont désormais inégalées sur le marché.
Ce qui rend cela encore plus impressionnant, c’est que Claude 3 Haiku est le modèle « de taille locale », comparable au Gemini Nano de Google. Il obtient des résultats impressionnants sans l’énorme échelle de paramètres de plus de mille milliards d’Opus ou de l’un des modèles de classe GPT-4.
Bien qu’il ne soit pas aussi intelligent qu’Opus ou Sonnet, le Haiku d’Anthropic est nettement moins cher, beaucoup plus rapide et, comme le suggèrent les résultats de l’arène, aussi bon que des modèles beaucoup plus grands lors de tests à l’aveugle.
Les trois modèles Claude 3 sont dans le top dix avec Opus en première place, Sonnet en quatrième position avec Gemini Pro et Haiku en sixième position avec une version antérieure de GPT-4.
Une victoire pour les modèles d’IA fermés
Tous les 20 principaux modèles de langages du classement Arena, sauf trois, sont propriétaires, ce qui suggère que l’open source a encore du travail à faire pour atteindre les grands acteurs.
Meta, qui se concentre fortement sur l’IA open source, devrait sortir Llama 3 dans les prochains mois, qui entrera probablement dans le top dix car il devrait avoir des capacités similaires à Claude 3 – après tout, Meta en a 300 000 + Nvidia. GPU H100 pour l’entraîner.
Nous assistons également à d’autres évolutions dans le domaine de l’IA open source et décentralisée, le fondateur de StabilityAI, Emad Mostaque, se retirant de ses fonctions de PDG pour se concentrer sur une intelligence artificielle plus distribuée et accessible. Il a dit qu’on ne peut pas battre l’IA centralisée avec une IA plus centralisée.
- La nouvelle IA VLOGGER de Google vous permet de créer un avatar réaliste à partir d’une simple photo
- Apple pourrait intégrer Google Gemini sur iPhone pour les tâches d’IA
- J’ai donné à Claude, ChatGPT et Gemini une photo des ingrédients pour voir lequel a donné la meilleure recette