Les modèles d’IA s’améliorent en mathématiques à l’école primaire – mais une nouvelle étude suggère qu’ils pourraient tricher

Par
Jugo Mobile
Jugo Mobile est une plateforme dédiée à du contenu de haute qualité dans les domaines du gaming, des sports et de la technologie. Engagez-vous avec un...
5 min de lecture

Les grands modèles de langage (LLM) qui alimentent les chatbots comme ChatGPT pourraient mieux répondre aux questions de référence qui mesurent le raisonnement mathématique. Mais cela pourrait en réalité être une mauvaise chose.

UN pré-impression Un document de recherche publié mercredi par des chercheurs de Scale AI détaille comment les LLM ont obtenu des résultats impressionnants aux tests de référence en mathématiques, mais on s’inquiète de plus en plus du fait que la contamination des ensembles de données alimente les notes élevées.

C’est à ce moment-là que des données ressemblant à des questions de référence s’infiltrent dans les données de formation. Le LLM peut alors finir par se former d’une manière qui donne la priorité à la réussite de ces tests standardisés plutôt qu’à une véritable compréhension du problème mathématique qu’il tente de résoudre.

C’est la même chose si vous vous préparez à un quiz mathématique en mémorisant les réponses, plutôt qu’en apprenant à résoudre le problème. Ce problème est appelé surapprentissage.

Cependant, les auteurs de l’article affirment que leurs résultats ne soutiennent pas cette théorie, suggérant que cela ne signifie pas que l’IA est mauvaise en raisonnement, mais simplement qu’elle n’est peut-être pas aussi bonne que le suggèrent les benchmarks.

Développer un nouveau référentiel mathématique

Dans l’article, les auteurs écrivent : « Le fait qu’un modèle soit surajusté ne signifie pas qu’il est mauvais en matière de raisonnement, mais simplement qu’il n’est pas aussi bon que les critères de référence pourraient l’indiquer. » Ils ont constaté que bon nombre des modèles les plus surajustés les modèles peuvent toujours raisonner et résoudre des problèmes qu’ils n’ont jamais rencontrés auparavant dans leurs ensembles de formation.

Pour effectuer ces évaluations, ils ont développé leur propre test de référence mathématique (GSM1k) qui, selon eux, teste la capacité de l’IA à comprendre le problème, et pas seulement la réponse.

Le fait qu’un modèle soit surajusté ne signifie pas qu’il est mauvais en matière de raisonnement, mais simplement qu’il n’est pas aussi bon que les références pourraient l’indiquer.

Auteurs de l’étude

Les questions sont au niveau mathématique de l’école primaire et une question GSM1k typique ressemblerait à : Jim veut dépenser 15 % de ses revenus mensuels en épicerie. Il gagne 2 500 $ par mois. Combien d’argent lui restera-t-il ? La bonne réponse est 2 125 $.

Bien que ces questions ressemblent beaucoup à celles du test de référence de l’industrie (GSM8k) en difficulté, elles sont suffisamment différentes pour tester si les LLM peuvent résoudre des énigmes mathématiques qu’ils n’ont jamais vues auparavant.

À l’aide de leur nouveau test, l’équipe de recherche de Scale AI a signalé des baisses de précision allant jusqu’à 13 % lors de l’évaluation des principaux LLM open source et fermés. D’autres modèles à la frontière, tels que Gemini, GPT et Claude, ont montré des signes minimes de surajustement.

Et après?

Ce « problème » pourrait finir par se résoudre de lui-même avec le temps, car les auteurs prédisent que d’ici 2025, les mathématiques à l’école primaire ne seront probablement plus assez difficiles pour évaluer les nouveaux LLM. Pourtant, ils affirment que l’amélioration du raisonnement dans les LLM « est l’une des directions les plus importantes de la recherche actuelle ».

Jim Fan, chercheur scientifique principal chez NVIDIA, a déclaré sur X que les critères académiques perdent de leur puissance.

Il a déclaré que trois types d’évaluations LLM qui compteront à l’avenir seraient des tests privés comme celui de Scale AI, des benchmarks comparatifs publics comme Chatbot Arena où vous pouvez tester des modèles côte à côte, et des benchmarks privés pour chaque entreprise. cas d’utilisation.

  • ChatGPT Plus vs Copilot Pro : quel chatbot premium est le meilleur ?
  • J’ai opposé Google Bard à Gemini Pro contre ChatGPT – voici le gagnant
  • Runway vs Pika Labs : quel est le meilleur outil vidéo d’IA ?


Partager cet article
Suivre
Jugo Mobile est une plateforme dédiée à du contenu de haute qualité dans les domaines du gaming, des sports et de la technologie. Engagez-vous avec un contenu de qualité et connectez-vous avec d'autres passionnés et experts. Découvrez les dernières tendances et innovations au sein de notre communauté dynamique. Rejoignez-nous et vivez l'avenir dès aujourd'hui !
Développez votre marque et atteignez un plus large public. Faites de la publicité avec nous dès aujourd’hui et soyez remarqué par des milliers de personnes.
© 2025 Jugo Mobile. Tous droits réservés.