Une révolution de l'efficacité des modèles linguistiques de grande taille est en cours. Le laboratoire de super-intelligence de Meta a récemment lancé une technologie disruptive qui accélère la vitesse de raisonnement des modèles linguistiques de grande taille dans les tâches de génération enrichie par la recherche de plus de 30 fois. Ce résultat innovant est présenté dans un article intitulé « REFRAG: Rethinking RAG based Decoding », apportant un changement profond dans la manière dont les modèles d'IA fonctionnent.
Le laboratoire de super-intelligence de Meta a été créé en juin de cette année à Menlo Park en Californie. La création du laboratoire s'est déroulée suite à la frustration du PDG de Meta, Mark Zuckerberg, face aux performances du nouveau modèle Llama4 de la société. Il a demandé au groupe d'accélérer le développement et même d'obliger les employés à travailler des heures supplémentaires pour accélérer les progrès technologiques. Cette pression a conduit à la création du laboratoire et a attiré de nombreux talents de premier plan.
Dans l'organisation du laboratoire, l'équipe de recherche est divisée en quatre groupes, chacun se concentrant sur le développement de modèles linguistiques de grande taille, les recherches fondamentales, l'application technique des produits et la garantie des infrastructures. L'introduction du cadre REFRAG représente une étape importante prise par le laboratoire pour optimiser les performances des grands modèles linguistiques.
La principale innovation du cadre REFRAG réside dans l'utilisation d'un modèle léger pour compresser le contenu long en un résumé concis, réduisant ainsi la quantité d'informations que le décodeur doit traiter. Cette méthode accélère non seulement le traitement, mais aussi réduit la complexité calculatoire, améliorant ainsi l'efficacité globale du modèle. L'équipe de recherche a également adopté une stratégie de pré-entraînement continu, entraînant le modèle via des tâches de reconstruction, en préservant autant que possible les détails des informations clés tout en compressant les informations.
Au cours de tests complets, REFRAG a montré d'excellents résultats dans plusieurs tâches, notamment une amélioration notable du délai temporel et du volume de données traitées. Les données expérimentales montrent qu'avec un taux de compression de 16 fois, REFRAG dépasse non seulement le modèle le plus avancé précédent CEPE en termes de vitesse, mais n'a pratiquement pas perdu en précision. Cette percée ouvre de nouvelles possibilités pour les applications futures de l'IA.
La technologie de génération enrichie par la recherche est actuellement la méthode clé pour améliorer la qualité et la précision des réponses des modèles linguistiques de grande taille, en enrichissant les sorties du modèle grâce à l'information extraite d'une base de connaissances externe. Cependant, le principal obstacle des méthodes RAG traditionnelles réside dans la charge de calcul lors du traitement d'un grand volume d'informations récupérées. REFRAG résout ce problème grâce à une compression intelligente, améliorant ainsi considérablement l'efficacité d'exécution tout en maintenant les performances du modèle.