xAI vient de lancer un modèle 314B MoE appelé Grok-1. Alors ?
Par Adil Asif, Matthew Choi, Mark Coatsworth, Jacob Junqi Tian et John Willes
Grok-1 a été rendu open source par xAI le 17 mars 2024. À ce jour, il s'agit du plus grand modèle de langage jamais rendu disponible au public, avec un nombre impressionnant de 314 milliards de paramètres. Grok-1 met en œuvre l'architecture de plus en plus populaire Mixture of Experts (MoE) , qui serait à la base des plus grands modèles de Google et d'OpenAI, Gemini et GPT-4.
Grok-1 représente-t-il la nouvelle référence en matière de logiciels libres ? Annoncé initialement dans un article de blogue en novembre 2023, ce modèle a vu ses poids discrètement publiés la semaine dernière, accompagnés d'une implémentation d'inférence minimaliste. Afin de déterminer si Grok-1 constitue une nouvelle référence en matière de logiciels libres, les membres de l'équipe d'ingénierie IA de Vector ont évalué ses performances, le comparant aux modèles de pointe et prenant en compte les aspects liés à son utilisation responsable.
Commençons par regarder le Grok-1 de près.
Grok-1 : Explication
Grok-1 est un modèle MoE de 314 milliards de paramètres avec une longueur de contexte maximale de 8 192 jetons. Cela le rend environ 4,5 fois plus volumineux que Llama-2-70B et environ 6,7 fois plus volumineux que Mixtral 8x7B . xAI n'a pas encore publié d'informations détaillées sur les données ou le matériel utilisés pour l'entraînement de Grok-1, bien qu'ils affirment qu'il a été entraîné en deux mois à l'aide d'une pile d'entraînement personnalisée basée sur Jax, Rust et Kubernetes.
L'architecture MoE utilise huit experts, dont deux par jeton. Ainsi, seulement environ 25 % (soit 79 milliards de paramètres) sont actifs pour un jeton donné. Les modèles MoE remplacent les couches denses à propagation avant par des couches MoE clairsemées et un mécanisme de routage. Leur principal avantage réside dans leur capacité à effectuer un préentraînement et une inférence nettement plus rapides que les modèles denses présentant un nombre de paramètres similaire.
Les poids de Grok-1 correspondent aux résultats bruts de la phase de pré-entraînement. Ils n'ont subi aucun ajustement fin ni alignement, notamment par des méthodes telles que l'apprentissage par renforcement avec rétroaction humaine (RLHF). Sans ces étapes d'entraînement supplémentaires, il ne faut pas s'attendre à ce que Grok-1 soit performant dans les applications de messagerie instantanée.
Grok-1 a été publié sous la licence permissive Apache 2.0, ce qui signifie que vous pouvez utiliser les poids du modèle à des fins commerciales.
Grok-1 : En pratique
Pour exécuter l'inférence Grok-1, les utilisateurs ont besoin de 8 GPU A100 de 80 Go ou d'un matériel doté d'une mémoire vidéo équivalente. Bien que seulement deux des huit experts soient utilisés pour chaque jeton, et que les poids aient été quantifiés dans la version officielle afin de réduire l'empreinte mémoire, une quantité importante de mémoire vidéo reste nécessaire pour charger tous les experts en mémoire.
En plus des poids du modèle, xAI a publié un script d'inférence léger qui privilégie la correction de l'implémentation de la couche MoE à l'optimisation. L'inférence risque d'être lente, même sur du matériel puissant, jusqu'à la publication ou le développement d'une inférence JAX optimisée par la communauté open source.
Pour obtenir un premier aperçu des performances de Grok-1, nous l'avons évalué sur l' ensemble de données MMLU (Massive Multi-task Language Understanding) . En raison des contraintes de vitesse d'inférence, nous avons limité l'évaluation à trois matières : mathématiques du secondaire, mathématiques universitaires et connaissances générales. À l'aide d'une méthode d'évaluation en cinq étapes, nous avons comparé Grok-1 à plusieurs générations de grands modèles des deux dernières années.
MMLU (5 coups)
| Modèle (Paramètres) | Mathématiques au secondaire | Mathématiques universitaires | Faits mondiaux |
|---|---|---|---|
| FLEUR (176B) | 27.0% | 25.0% | – |
| OPT (175B) | 24.4% | 33.0% | – |
| Lama-2 (70B) | 35.56% | 40% | 48% |
| Mixtral 8x7B (47B) | 38.5% | 46.0% | 51% |
| Grok-1 (314B) | 39.63% | 41% | 44% |
Pour un modèle aussi gourmand en ressources matérielles, les résultats sont décevants. Grok-1 surpasse les anciens modèles, mais reste en deçà des modèles open source les plus performants actuellement disponibles sur ce sous-ensemble de MMLU.
Lors de l'évaluation d'un nouveau modèle, la performance n'est qu'un critère parmi d'autres. Il est tout aussi important de s'assurer de sa sécurité de déploiement. Le modèle produira-t-il des résultats toxiques, biaisés ou présentant d'autres risques ? À l'instar de l'évaluation comparative des performances, nous évaluons Grok-1 sur le sous-ensemble « Difficile » de l'ensemble de données RealToxicityPrompts . Nous calculons le score moyen de toxicité des réponses aux invites et le comparons aux meilleurs modèles, qu'ils soient propriétaires ou open source. Les scores de toxicité sont obtenus via l'API Perspective.
Toxicité moyenne – RealToxicityPrompts – Défi
| Modèle | Score moyen de toxicité |
|---|---|
| GPT-3.5 | 0.255 |
| GPT-4 | 0.222 |
| Mixtral 8x7B | 0.378 |
| Grok-1 | 0.355 |
Nos résultats suggèrent que Grok-1 pourrait être nettement plus toxique que les modèles propriétaires, mais comparable aux modèles open source les plus performants. Ce niveau de toxicité pourrait être intentionnel ; xAI a présenté Grok comme un modèle « un peu espiègle et rebelle ». Il est important de noter que Grok-1 est le modèle préentraîné brut et ne bénéficie pas des étapes d'entraînement secondaires qui visent souvent à réduire sa toxicité.
Conclusion
À l'heure actuelle, Grok-1 est le plus grand modèle d'IA open source jamais mis à disposition. Il est plusieurs fois plus volumineux que les modèles open source de pointe actuels tels que Llama-2-70B ou Mixtral 8x7B. Cependant, les premiers résultats indiquent que Grok-1 est nettement moins performant que les modèles open source de pointe et que les données générées sont beaucoup plus toxiques que celles des alternatives propriétaires.