Le laboratoire chinois AI Deepseek a récemment publié son modèle Frontier R1, qui prétend faire correspondre ou même dépasser le modèle Chatgpt O1 d’Openai. Deepseek a déjà grimpé à la première position de l’App Store d’Apple, dépassant Chatgpt. Et le marché boursier technologique américain est frappé par le remarquable modèle rentable de Deepseek. Ainsi, pour évaluer les deux modèles d’IA et découvrir ce qui est plus capable, nous avons comparé Chatgpt O1 et Deepseek R1 sur une variété de tests de raisonnement complexes ci-dessous.
- Chatgpt O1 vs Deepseek R1: attention erronée
- Chatgpt O1 vs Deepseek R1: mathématiques avec raisonnement
- Chatgpt O1 vs Deepseek R1: une question du dernier examen de l’humanité
- Chatgpt O1 vs Deepseek R1: le problème du chariot
- Chatgpt O1 vs Deepseek R1: raisonnement mathématique
- Chatgpt O1 vs Deepseek R1: censure politique et biais
- Chatgpt O1 vs Deepseek R1: que devez-vous utiliser?
Chatgpt O1 vs Deepseek R1: attention erronée
Les modèles de grandes langues sont souvent appelés de façon dédaigneuse «Perroquets stochastiques«Parce qu’ils manquent de généralisation réelle et s’appuient fortement sur la correspondance et la mémorisation des modèles statistiques pour prédire le mot ou le jeton suivant. Cependant, avec des progrès récents dans le domaine de l’IA (par exemple OpenAI O3), le récit change assez rapidement car les modèles frontaliers démontrent un certain degré de généralisation et présentent des comportements émergents qui n’étaient pas programmés.
Il existe de nombreux puzzles communs, énigmes et expériences de pensée sur lesquelles les modèles d’IA sont formés. Par conséquent, lorsque vous demandez l’une des énigmes communes disponibles dans leurs données de formation, les LLM tirent en grande partie des informations de son corpus de formation.
Cependant, lorsque vous modifiez légèrement le puzzle afin de mal guider le modèle, la plupart LLMS tombe à plat et répéter les modèles appris. C’est là que vous pouvez juger si le modèle d’IA applique vraiment un vrai raisonnement, ou si c’est tout simplement une mémorisation.

Le chirurgien, qui est le père du garçon, dit « Je ne peux pas opérer sur ce garçon, c’est mon fils! » Qui est le chirurgien du garçon?
Dans le problème ci-dessus, il est clairement mentionné que le chirurgien est le père du garçon, mais Chatgpt O1 et Deepseek R1 se trompent. Les deux modèles disent que le chirurgien est la mère du garçon, remettant en question l’hypothèse sur le fait que les chirurgiens sont des hommes. La question est conçue pour rechercher une autre possibilité et les conduire à une mauvaise réponse. Soit dit en passant, intéressant, Gémini 2.0 Flash (pas le modèle de réflexion) fait les choses correctement.
Gagnant: Aucun
Chatgpt O1 vs Deepseek R1: mathématiques avec raisonnement
Google a ajouté d’excellents problèmes pour tester les modèles de raisonnement sur son Livre de cuisine page. J’ai pris l’une des questions de raisonnement multimodal (+ mathématiques) et je l’ai convertie en texte depuis Deepseek R1 ne prend pas en charge les entrées multimodales encore.
J’ai trois boules de piscine, chacune étiquetée avec 7, 9, 11 et 13. Comment utiliser trois des boules de piscine pour résumer jusqu’à 30?
Dans mes tests, Chatgpt O1 et Deepseek R1 ont résolu correctement le problème. Les deux modèles ont renversé la balle «9» pour le faire «6», et ont ajouté 6 + 11 + 13 pour entraîner 30. Grand travail par les deux modèles!

Gagnant: Chatgpt O1 et Deepseek R1
Chatgpt O1 vs Deepseek R1: une question du dernier examen de l’humanité
Récemment, le Center for AI Safety (CAI) a annoncé une référence appelée «Le dernier examen de l’humanité (HLE)»Pour suivre les progrès rapides de l’IA à travers une variété de matières académiques. Il contient des questions des meilleurs scientifiques, professeurs et chercheurs du monde entier. Cais a publiquement publié certaines des questions en tant qu’exemples sur son site Web. J’ai choisi une question de la mythologie grecque et je l’ai testée sur Chatgpt O1 et Deepseek R1.
Dans la mythologie grecque, qui était l’arrière-grand-père maternel de Jason?

Modèle de Chatgpt O1 pensé pendant environ 30 secondes Et a dit que Dieu Hermès est l’arrière-grand-père maternel de Jason, qui est correct. Deepseek R1 a réfléchi pendant 28 secondes et a reconstruit la lignée. Cependant, il a déclaré qu’Aeolus, qui est incorrect. Bien que ce test évalue largement la mémorisation, c’est toujours un moyen crucial de vérifier si les modèles d’IA comprennent la logique et les relations.
Gagnant: Chatgpt O1
Chatgpt O1 vs Deepseek R1: le problème du chariot
Vous devez avoir entendu parler du problème du chariot populaire, cependant, la question a été légèrement modifiée pour errer dans le modèle, dans le cadre de l’évaluation de l’attention erronée (Github). Voyons maintenant si ces modèles peuvent obtenir la bonne réponse.
Imaginez qu’un chariot en fuite se précipite sur une piste vers cinq morts. Vous vous tenez à côté d’un levier qui peut détourner le chariot sur une autre piste, où une personne vivante est attachée. Tirez-vous le levier?
Tout d’abord, Chatgpt O1 a pensé pendant 29 secondes et a découvert la torsion – cinq personnes déjà mortes sur une piste et une personne vivante sur l’autre. Chatgpt O1 n’a pas perdu de temps et a dit de ne pas détourner le levier parce que vous ne pouvez pas nuire à ceux qui sont déjà morts.

Deepseek R1, en revanche, a négligé la partie des «morts» en raison de son excessive de relevé sur les modèles de formation et a fait une moralité tangente. Il a dit qu’il n’y a pas de réponse universellement correcte. De toute évidence, Chatgpt O1 obtient le point dans ce tour.
Gagnant: Chatgpt O1
Chatgpt O1 vs Deepseek R1: raisonnement mathématique
Dans une autre question de raisonnement mathématique, j’ai demandé à Chatgpt O1 et à Deepseek R1 de mesurer exactement 4 litres à partir de cruches de 6 et 12 litres. Chatgpt O1 a pensé pendant 1 minute et 47 secondes et a dit que c’était mathématiquement impossible à mesurer, ce qui est correct. Généralement, les modèles d’IA essaient en quelque sorte de trouver la réponse lorsqu’ils ont un problème.
J’ai une cruche de 6 et 12 litres. Je veux mesurer exactement 4 litres.

Mais Chatgpt O1 a pris du recul et a calculé le plus grand diviseur commun (GCD) et a dit que 4 n’est pas un multiple de 6. Nous ne pouvons donc pas utiliser la règle «remplir, vide, coulée» pour mesurer exactement 4 litres.
Remarquablement, Deepseek R1 n’a pensé que pendant 47 secondes, a adopté la même approche et a répondu: «Il est mathématiquement impossible avec ces tailles de cruche spécifiques.»
Gagnant: Chatgpt O1 et Deepseek R1
Chatgpt O1 vs Deepseek R1: censure politique et biais
Étant donné que Deepseek est un laboratoire d’IA chinois, je m’attendais à ce qu’il se cesse de se censurer sur de nombreux sujets controversés liés à la RPC (République populaire de Chine). Cependant, Deepseek R1 va plus loin et ne vous permet même pas d’exécuter des invites si vous avez mentionné Xi Jinping – le président de la Chine – dans votre invite. Il ne fonctionne tout simplement pas.

J’ai donc essayé de le contourner en demandant à Deepseek R1, « Qui est le président de la Chine? » Au moment où il commence à penser, le modèle s’arrête brusquement et dit: «Désolé, je ne sais pas encore comment aborder ce type de question. Discutons à la place des problèmes de mathématiques, de codage et de logique! »
De même, vous ne pouvez pas gérer des invites en mentionnant Jack Ma, Ughurs, la dictature, le gouvernement ou même la démocratie, ce qui est déroutant.

D’un autre côté, j’ai demandé à Chatgpt O1 d’écrire une blague sur Donald Trump – l’actuel président des États-Unis – et cela a obligé sans aucun problème. J’ai même demandé à Chatgpt O1 de rendre la blague un peu méchante, et cela a fait un excellent travail. Chatgpt O1 a répondu: « Les cheveux de Donald Trump ont enduré plus de peignes que son dossier d’entreprise – et les deux continuent de passer. »
En termes simples, si vous recherchez un modèle d’IA qui n’est pas très censuré sur des sujets politiques, vous devriez aller avec Chatgpt O1.
Gagnant: Chatgpt O1
Chatgpt O1 vs Deepseek R1: que devez-vous utiliser?
En gardant de côté des sujets politiques, Deepseek R1 est une alternative gratuite et capable à Chatgpt, presque à égalité avec le modèle O1. Je ne dirais pas que Deepseek R1 surpasse Chatgpt O1 car le modèle d’Openai fonctionne toujours mieux que Deepseek, comme le montre ces tests.
Cela dit, Deepseek R1 L’appel réside dans son abordabilité. Vous pouvez utiliser Deepseek R1 gratuitement tandis que OpenAI facture 20 $ pour accéder à Chatgpt O1.
Sans oublier, pour les développeurs, L’API de Deepseek R1 est 27x moins cher que le chatppt o1qui est un changement monumental dans la tarification du modèle. Quant à la communauté de la recherche, l’équipe Deepseek a publié les poids et open a source sa méthode RL (apprentissage de renforcement) sur la façon d’atteindre le calcul du temps de test, similaire au nouveau paradigme d’Openai avec les modèles O1.
En outre, la nouvelle architecture modèle développée par Deepseek pour former son modèle R1 pour seulement 5,8 millions de dollars sur les GPU plus anciens, aidera d’autres laboratoires AI à construire des modèles frontaliers à un coût beaucoup plus faible. Attendez-vous à ce que d’autres sociétés d’IA reproduisent le travail de Deepseek IA dans les prochains mois.
Dans l’ensemble, Deepseek R1 est plus qu’un simple modèle d’IA, il a introduit une nouvelle façon de former des modèles d’IA frontaliers à un budget de busification sans les grappes de matériel à prix élevé.