Le nouveau petit modèle de langage de Microsoft peut lire des images — voici à quoi vous pouvez l’utiliser

Par
Jugo Mobile
Jugo Mobile est une plateforme dédiée à du contenu de haute qualité dans les domaines du gaming, des sports et de la technologie. Engagez-vous avec un...
3 min de lecture

Au cours de la build 2024, Microsoft a annoncé une nouvelle version du modèle d’IA en petit langage de l’entreprise, Phi-3, capable d’analyser les images et d’indiquer aux utilisateurs ce qu’elles contiennent.

La nouvelle version, Phi-3-vision, est un modèle multimodal. Pour ceux qui ne le savent pas, en particulier avec le GPT-4o d’OpenAI et les mises à jour de Google vers Gemini, un modèle multimodal signifie que l’outil d’IA peut lire du texte et des images.

Phi-3-vision est destiné à être utilisé sur les appareils mobiles car il présente un modèle de 4,2 milliards de paramètres. Les paramètres d’un modèle d’IA sont un raccourci permettant de comprendre la complexité d’un modèle et la part de la formation qu’il reçoit qu’il comprend. Microsoft a itéré le modèle Phi sur les versions précédentes. Ainsi, Phi-2, par exemple, a appris de Phi-1 et s’est développé avec de nouvelles capacités, et Phi-3 est similaire à Phi-2, formé sur Phi-2 et a ajouté des capacités.

Phi-3-vision peut effectuer des tâches générales de raisonnement visuel, telles que l’analyse de graphiques et d’images. Contrairement à d’autres modèles plus connus, comme le DALL-E d’OpenAI, Phi-3-vision ne peut « lire » qu’une image ; il ne peut pas générer d’images.

Microsoft a publié plusieurs de ces petits modèles d’IA. Ils sont conçus pour fonctionner localement et sur une plus large gamme d’appareils que les modèles plus grands comme Gemini de Google ou même ChatGPT. Aucune connexion internet n’est requise. Ils réduisent également la puissance de calcul nécessaire à l’exécution de certaines tâches, comme la résolution de problèmes mathématiques, comme le fait le petit modèle Orca-Math de Microsoft.

La première itération du Phi-3 a été annoncée en avril lorsque Microsoft a lancé le petit Phi-3-mini. Lors des tests de référence, il s’est plutôt bien comporté par rapport à des modèles plus grands comme le Meta’s Llama 2. Le mini modèle ne compte que 3,8 milliards de paramètres. Il existe deux autres modèles, Phi-3-small et Phi-3-medium, qui comportent respectivement 7 milliards de paramètres et 14 milliards de paramètres.

Phi-3-vision est disponible en avant-première dès maintenant. Les trois autres modèles Phi-3, Phi-3-mini, Phi-3-small et Phi-3-medium, sont accessibles via le catalogue et les collections de modèles Azure Machine Learning. Pour les utiliser, vous aurez besoin d’un compte Azure payant et d’un hub Azure AI Studio.

  • Microsoft Build 2024 LIVE — toutes les dernières nouvelles de Windows 11 et Copilot après le lancement massif de Surface
  • Microsoft Surface Pro 11 et Surface Laptop 7 annoncés avec Snapdragon X Elite
  • OpenAI supprime Sky Voice après la menace juridique de Scarlett Johansson

Partager cet article
Suivre
Jugo Mobile est une plateforme dédiée à du contenu de haute qualité dans les domaines du gaming, des sports et de la technologie. Engagez-vous avec un contenu de qualité et connectez-vous avec d'autres passionnés et experts. Découvrez les dernières tendances et innovations au sein de notre communauté dynamique. Rejoignez-nous et vivez l'avenir dès aujourd'hui !