À moins que vous n’ayez vécu sous un rocher ou dans une capsule martienne simulée dans un désert quelque part, vous avez peut-être remarqué que l’IA a pris le relais. Des chatbots prenant des photos aux chatières refusant l’entrée si votre ami félin a une souris dans la bouche, l’intelligence artificielle surveille.
Cependant, nous avons à peine effleuré la surface de ce que l’IA peut faire, pourrait faire et fera pour l’humanité au cours des prochaines années et Groq espère être au centre de cette révolution.
Formé au bord d’un pool, le générateur d’argent de Groq est le Language Processing Unit (LPU), une nouvelle catégorie de puces conçues non pas pour entraîner des modèles d’IA mais pour les exécuter très rapidement.
Le GroqChip est actuellement un processeur 14 nm et bénéficie de performances accrues grâce à son évolutivité, fonctionnant dans le cloud comme un cluster d’unités bien structurées analysant efficacement les données.
L’accès à l’inférence d’IA à très faible latence contribue à éliminer certains des goulots d’étranglement dans la fourniture de solutions d’IA. Par exemple, la synthèse vocale et vice-versa peuvent se produire en temps réel, permettant des conversations naturelles avec un assistant IA, vous permettant notamment de l’interrompre.
Créer une puce spécifiquement pour exécuter l’IA
https://www.youtube.com/watch?v=dXnZboXpEt8
De nombreuses entreprises essayant de rivaliser avec Nvidia dans le domaine de l’intelligence artificielle s’attaquent au marché de la formation, mais Groq a pris la décision de se concentrer sur l’exploitation des modèles.
« Nous nous sommes concentrés sur la fourniture d’une vitesse d’inférence inégalée et d’une faible latence », a expliqué Mark Heap, évangéliste en chef de Groq lors d’une conversation avec Jugo Mobile. « C’est essentiel dans un monde où les applications d’IA générative deviennent omniprésentes. »
var triggerHydrate = function() { window.sliceComponents.newsletterForm.hydrate(data, componentContainer); }
if (window.lazyObserveElement) { window.lazyObserveElement(componentContainer, triggerHydrate); } else { triggerHydrate(); } } }).catch(err => console.log('Hydration Script has failed for newsletterForm-articleInbodyContent-86V6bDsdQB6wZsc7ZTzkTe Slice', err)); }).catch(err => console.log('Externals script failed to load', err));
Les puces, conçues par le fondateur et PDG de Groq, Jonathan Ross, qui a également dirigé le développement des unités de traitement tensoriel (TPU) de Google utilisées pour entraîner et exécuter Gemini est conçu pour une évolutivité rapide et pour un flux efficace de données via la puce.
Heaps l’a expliqué comme fonctionnant davantage comme une ville planifiée et quadrillée où la circulation sait où aller et peut facilement suivre le tracé, où les autres puces ressemblent à la conduite à Delhi avec des tracés routiers complexes et un trafic intense.
« Notre architecture nous permet d’évoluer horizontalement sans sacrifier la vitesse ou l’efficacité… Cela change la donne pour le traitement des tâches intensives d’IA », m’a-t-il expliqué.
Placé sous les feux de la rampe

L’entreprise repose sur un ensemble de piliers fondamentaux, notamment la lutte contre la latence tout en garantissant l’évolutivité de l’ensemble du programme. Ceci est réalisé en grande partie via sa propre infrastructure cloud, avec davantage de centres de données mondiaux mis en ligne cette année ou l’année prochaine.
Alors que les appareils de pointe tels que les voitures sans conducteur pourraient devenir viables lorsqu’ils réduiront les puces à 4 nm dans la version deux, pour l’instant, l’accent est uniquement mis sur le cloud.
Cela inclut l’accès via une API pour les développeurs tiers cherchant à offrir un accès rapide et fiable aux modèles open source comme Mistral ou Meta. Ainsi qu’une interface directe de type chatbot grand public appelée GroqChat.
C’est le lancement de cette interface publique et facile d’accès qui semble propulser cette entreprise vieille de six ans sur le devant de la scène. Ils travaillaient en arrière-plan, y compris pendant la pandémie de Covid, pour assurer un traitement rapide des données aux laboratoires, mais c’était un moment charnière.
Notre architecture nous permet d’évoluer horizontalement sans sacrifier la vitesse ou l’efficacité… Cela change la donne pour le traitement des tâches intensives d’IA,
Marquer les tas
Heaps m’a dit que la discussion avec Jonathan Ross était « pourquoi ne pas simplement le mettre là-bas et le faire pour que les gens puissent l’essayer. » Cela était dû à des expériences internes visant à faire fonctionner des modèles open source comme Llama 2 et Mixtral sur GroqChips.
« Il y a à peine un mois et demi, nous avions un site Web complètement différent et il fallait cliquer sur trois liens profonds pour le trouver. Et c’était juste une sorte d’imbrication et c’était une sorte d’expérience », a expliqué Heaps. « Et puis quelques personnes l’ont frappé et ont dit, vous savez, c’est génial, mais bon sang, pourquoi me faites-vous faire tous ces clics ? »
Ross a dit à l’équipe d’en faire la page d’accueil. Littéralement, la première chose que les gens voient lorsqu’ils visitent le site Groq. « C’était un peu effrayant », a admis Heaps. « Son objectif était : je veux qu’il n’y ait pas de site Web en ce qui concerne les pages marketing. Je veux seulement que ce soit le chat. C’est donc ce qu’ils ont mis en œuvre.
Ce que vous pouvez faire avec l’IA à faible latence
L’IA à faible latence permet une véritable génération en temps réel. Pour l’instant, l’accent a été mis sur les grands modèles de langage incluant le code et le texte. Nous voyons jusqu’à 500 jetons par seconde, ce qui est des dizaines de fois plus rapide que ce qu’un humain peut lire, et cela se produit même sur des requêtes complexes.
De nouveaux modèles seront bientôt ajoutés, mais ils s’efforceront ensuite de fournir la même génération rapide d’images, d’audio et même de vidéo. C’est là que vous constaterez les réels avantages, notamment la génération potentielle d’images en temps réel, même à haute résolution.
L’autre avantage significatif est de pouvoir trouver une seule information à partir d’une grande fenêtre contextuelle, bien que ce soit dans les futures versions où vous pourrez même affiner les modèles en temps réel, apprendre de l’interaction humaine et vous adapter.
Cela pourrait alors permettre la création d’un véritable jeu en monde ouvert, quelque chose qui s’apparente à l’Oasis du roman fondateur d’Ernest Cline, Ready Player One. Le rendu et le recyclage de l’IA en direct permettraient le type d’adaptabilité requis pour refléter tant d’interactions et de changements de la part de plusieurs joueurs.
Le pivot vers l’exécution de modèles d’IA était un projet parallèle
https://www.youtube.com/watch?v=nGbZSrC1ZEs
Groq existe depuis 2016 et a passé une grande partie des premières années à perfectionner la technologie. Cela impliquait de travailler avec des laboratoires et des entreprises pour accélérer l’exécution de tâches complexes d’apprentissage automatique telles que la découverte de médicaments ou la dynamique des flux.
Le tournant vers l’exécution de LLM a coïncidé avec la montée en puissance de ChatGPT et la fuite du grand modèle de langage Llama de Meta. Heaps a déclaré à Jugo Mobile : « Nous avions littéralement un ingénieur qui disait : « Je me demande si je peux compiler [Llama]. Il a ensuite passé 48 heures sans le faire fonctionner sur GroqChip.
Ce qui a pris le plus de temps a été de supprimer une grande partie du matériel mis dans Llama pour le faire fonctionner plus efficacement sur un GPU, car cela « allait l’enliser pour nous », a déclaré Heaps. Ajoutant : « Une fois qu’il a nettoyé tout cela, parce que nous n’utilisons pas de bibliothèques ou de noyaux CUDA ou quoi que ce soit, nous nous sommes dit : « oh, nous pouvons exécuter Llama ». Depuis, nous l’utilisons en interne.
Nous avions littéralement un ingénieur qui disait : Je me demande si je peux compiler [Llama]. Il a ensuite passé 48 heures sans le faire fonctionner sur GroqChip.
Marquer les tas
Au cours des mois suivants, ils ont commencé à intégrer d’autres modèles et bibliothèques et, bien que seuls Mixtral et Llama 2 soient disponibles sur l’interface publique de Groq, d’autres, y compris l’IA audio comme les générateurs de synthèse vocale, sont activement testés et convertis pour fonctionner. sur GroqChips.
Une chose à laquelle nous pouvons nous attendre est une perturbation importante dans un espace technologique qui perturbe déjà l’ensemble du secteur technologique. Nous constatons une augmentation du nombre de PC IA et de matériel local, mais avec une connectivité Internet améliorée et la résolution du problème de latence, sont-ils toujours nécessaires ?
- 5 utilisations étonnantes de l’IA en ce moment
- Sam Altman espère affronter Nvidia avec un nouveau réseau mondial d’usines de puces IA
- AMD lance de nouveaux processeurs et GPU bon marché axés sur l’IA au CES 2024