Chatgpt O1 vs Deepseek R1 : Bataille des modèles d’IA de pointe

blank
Par
Jugo Mobile
Jugo Mobile est une plateforme dédiée à du contenu de haute qualité dans les domaines du gaming, des sports et de la technologie. Engagez-vous avec un...
12 min de lecture

Le laboratoire chinois AI Deepseek a récemment publié son modèle Frontier R1, qui prétend faire correspondre ou même dépasser le modèle Chatgpt O1 d’Openai. Deepseek a déjà grimpé à la première position de l’App Store d’Apple, dépassant Chatgpt. Et le marché boursier technologique américain est frappé par le remarquable modèle rentable de Deepseek. Ainsi, pour évaluer les deux modèles d’IA et découvrir ce qui est plus capable, nous avons comparé Chatgpt O1 et Deepseek R1 sur une variété de tests de raisonnement complexes ci-dessous.

Chatgpt O1 vs Deepseek R1: attention erronée

Les modèles de grandes langues sont souvent appelés de façon dédaigneuse «Perroquets stochastiques«Parce qu’ils manquent de généralisation réelle et s’appuient fortement sur la correspondance et la mémorisation des modèles statistiques pour prédire le mot ou le jeton suivant. Cependant, avec des progrès récents dans le domaine de l’IA (par exemple OpenAI O3), le récit change assez rapidement car les modèles frontaliers démontrent un certain degré de généralisation et présentent des comportements émergents qui n’étaient pas programmés.

Il existe de nombreux puzzles communs, énigmes et expériences de pensée sur lesquelles les modèles d’IA sont formés. Par conséquent, lorsque vous demandez l’une des énigmes communes disponibles dans leurs données de formation, les LLM tirent en grande partie des informations de son corpus de formation.

Cependant, lorsque vous modifiez légèrement le puzzle afin de mal guider le modèle, la plupart LLMS tombe à plat et répéter les modèles appris. C’est là que vous pouvez juger si le modèle d’IA applique vraiment un vrai raisonnement, ou si c’est tout simplement une mémorisation.

demander à Deepseek R1 une énigme complexe

Le chirurgien, qui est le père du garçon, dit « Je ne peux pas opérer sur ce garçon, c’est mon fils! » Qui est le chirurgien du garçon?

Dans le problème ci-dessus, il est clairement mentionné que le chirurgien est le père du garçon, mais Chatgpt O1 et Deepseek R1 se trompent. Les deux modèles disent que le chirurgien est la mère du garçon, remettant en question l’hypothèse sur le fait que les chirurgiens sont des hommes. La question est conçue pour rechercher une autre possibilité et les conduire à une mauvaise réponse. Soit dit en passant, intéressant, Gémini 2.0 Flash (pas le modèle de réflexion) fait les choses correctement.

Gagnant: Aucun

Chatgpt O1 vs Deepseek R1: mathématiques avec raisonnement

Google a ajouté d’excellents problèmes pour tester les modèles de raisonnement sur son Livre de cuisine page. J’ai pris l’une des questions de raisonnement multimodal (+ mathématiques) et je l’ai convertie en texte depuis Deepseek R1 ne prend pas en charge les entrées multimodales encore.

J’ai trois boules de piscine, chacune étiquetée avec 7, 9, 11 et 13. Comment utiliser trois des boules de piscine pour résumer jusqu’à 30?

Dans mes tests, Chatgpt O1 et Deepseek R1 ont résolu correctement le problème. Les deux modèles ont renversé la balle «9» pour le faire «6», et ont ajouté 6 + 11 + 13 pour entraîner 30. Grand travail par les deux modèles!

Poser Deepseek R1 sur une question de raisonnement mathématique

Gagnant: Chatgpt O1 et Deepseek R1

Chatgpt O1 vs Deepseek R1: une question du dernier examen de l’humanité

Récemment, le Center for AI Safety (CAI) a annoncé une référence appelée «Le dernier examen de l’humanité (HLE)»Pour suivre les progrès rapides de l’IA à travers une variété de matières académiques. Il contient des questions des meilleurs scientifiques, professeurs et chercheurs du monde entier. Cais a publiquement publié certaines des questions en tant qu’exemples sur son site Web. J’ai choisi une question de la mythologie grecque et je l’ai testée sur Chatgpt O1 et Deepseek R1.

Dans la mythologie grecque, qui était l’arrière-grand-père maternel de Jason?

Demander Deepseek R1 sur la mythologie grecque

Modèle de Chatgpt O1 pensé pendant environ 30 secondes Et a dit que Dieu Hermès est l’arrière-grand-père maternel de Jason, qui est correct. Deepseek R1 a réfléchi pendant 28 secondes et a reconstruit la lignée. Cependant, il a déclaré qu’Aeolus, qui est incorrect. Bien que ce test évalue largement la mémorisation, c’est toujours un moyen crucial de vérifier si les modèles d’IA comprennent la logique et les relations.

Gagnant: Chatgpt O1

Chatgpt O1 vs Deepseek R1: le problème du chariot

Vous devez avoir entendu parler du problème du chariot populaire, cependant, la question a été légèrement modifiée pour errer dans le modèle, dans le cadre de l’évaluation de l’attention erronée (Github). Voyons maintenant si ces modèles peuvent obtenir la bonne réponse.

Imaginez qu’un chariot en fuite se précipite sur une piste vers cinq morts. Vous vous tenez à côté d’un levier qui peut détourner le chariot sur une autre piste, où une personne vivante est attachée. Tirez-vous le levier?

Tout d’abord, Chatgpt O1 a pensé pendant 29 secondes et a découvert la torsion – cinq personnes déjà mortes sur une piste et une personne vivante sur l’autre. Chatgpt O1 n’a pas perdu de temps et a dit de ne pas détourner le levier parce que vous ne pouvez pas nuire à ceux qui sont déjà morts.

Demander Deepseek R1 sur le problème du chariot

Deepseek R1, en revanche, a négligé la partie des «morts» en raison de son excessive de relevé sur les modèles de formation et a fait une moralité tangente. Il a dit qu’il n’y a pas de réponse universellement correcte. De toute évidence, Chatgpt O1 obtient le point dans ce tour.

Gagnant: Chatgpt O1

Chatgpt O1 vs Deepseek R1: raisonnement mathématique

Dans une autre question de raisonnement mathématique, j’ai demandé à Chatgpt O1 et à Deepseek R1 de mesurer exactement 4 litres à partir de cruches de 6 et 12 litres. Chatgpt O1 a pensé pendant 1 minute et 47 secondes et a dit que c’était mathématiquement impossible à mesurer, ce qui est correct. Généralement, les modèles d’IA essaient en quelque sorte de trouver la réponse lorsqu’ils ont un problème.

J’ai une cruche de 6 et 12 litres. Je veux mesurer exactement 4 litres.

Poser Deepseek R1 sur une question d'attention erronée

Mais Chatgpt O1 a pris du recul et a calculé le plus grand diviseur commun (GCD) et a dit que 4 n’est pas un multiple de 6. Nous ne pouvons donc pas utiliser la règle «remplir, vide, coulée» pour mesurer exactement 4 litres.

Remarquablement, Deepseek R1 n’a pensé que pendant 47 secondes, a adopté la même approche et a répondu: «Il est mathématiquement impossible avec ces tailles de cruche spécifiques.»

Gagnant: Chatgpt O1 et Deepseek R1

Chatgpt O1 vs Deepseek R1: censure politique et biais

Étant donné que Deepseek est un laboratoire d’IA chinois, je m’attendais à ce qu’il se cesse de se censurer sur de nombreux sujets controversés liés à la RPC (République populaire de Chine). Cependant, Deepseek R1 va plus loin et ne vous permet même pas d’exécuter des invites si vous avez mentionné Xi Jinping – le président de la Chine – dans votre invite. Il ne fonctionne tout simplement pas.

Deepseek R1 ne peut pas écrire sur Xi Jinping

J’ai donc essayé de le contourner en demandant à Deepseek R1, « Qui est le président de la Chine? » Au moment où il commence à penser, le modèle s’arrête brusquement et dit: «Désolé, je ne sais pas encore comment aborder ce type de question. Discutons à la place des problèmes de mathématiques, de codage et de logique!  »

De même, vous ne pouvez pas gérer des invites en mentionnant Jack Ma, Ughurs, la dictature, le gouvernement ou même la démocratie, ce qui est déroutant.

Chatgpt o1 blagues sur Donald Trump

D’un autre côté, j’ai demandé à Chatgpt O1 d’écrire une blague sur Donald Trump – l’actuel président des États-Unis – et cela a obligé sans aucun problème. J’ai même demandé à Chatgpt O1 de rendre la blague un peu méchante, et cela a fait un excellent travail. Chatgpt O1 a répondu: « Les cheveux de Donald Trump ont enduré plus de peignes que son dossier d’entreprise – et les deux continuent de passer. »

En termes simples, si vous recherchez un modèle d’IA qui n’est pas très censuré sur des sujets politiques, vous devriez aller avec Chatgpt O1.

Gagnant: Chatgpt O1

Chatgpt O1 vs Deepseek R1: que devez-vous utiliser?

En gardant de côté des sujets politiques, Deepseek R1 est une alternative gratuite et capable à Chatgpt, presque à égalité avec le modèle O1. Je ne dirais pas que Deepseek R1 surpasse Chatgpt O1 car le modèle d’Openai fonctionne toujours mieux que Deepseek, comme le montre ces tests.

Cela dit, Deepseek R1 L’appel réside dans son abordabilité. Vous pouvez utiliser Deepseek R1 gratuitement tandis que OpenAI facture 20 $ pour accéder à Chatgpt O1.

Sans oublier, pour les développeurs, L’API de Deepseek R1 est 27x moins cher que le chatppt o1qui est un changement monumental dans la tarification du modèle. Quant à la communauté de la recherche, l’équipe Deepseek a publié les poids et open a source sa méthode RL (apprentissage de renforcement) sur la façon d’atteindre le calcul du temps de test, similaire au nouveau paradigme d’Openai avec les modèles O1.

En outre, la nouvelle architecture modèle développée par Deepseek pour former son modèle R1 pour seulement 5,8 millions de dollars sur les GPU plus anciens, aidera d’autres laboratoires AI à construire des modèles frontaliers à un coût beaucoup plus faible. Attendez-vous à ce que d’autres sociétés d’IA reproduisent le travail de Deepseek IA dans les prochains mois.

Dans l’ensemble, Deepseek R1 est plus qu’un simple modèle d’IA, il a introduit une nouvelle façon de former des modèles d’IA frontaliers à un budget de busification sans les grappes de matériel à prix élevé.

Partager cet article
Suivre
Jugo Mobile est une plateforme dédiée à du contenu de haute qualité dans les domaines du gaming, des sports et de la technologie. Engagez-vous avec un contenu de qualité et connectez-vous avec d'autres passionnés et experts. Découvrez les dernières tendances et innovations au sein de notre communauté dynamique. Rejoignez-nous et vivez l'avenir dès aujourd'hui !