Récemment, l'équipe de pointe en intelligence artificielle Thinking Machine a présenté une méthode d'entraînement révolutionnaire appelée "Distillation en politique en ligne", qui accélère jusqu'à 50 à 100 fois l'efficacité de l'entraînement des modèles de petite taille sur des tâches spécifiques. Cette avancée, une fois publiée, a été partagée personnellement par Mira Murati, ancien directeur technique d'OpenAI, suscitant un grand intérêt dans le monde académique et industriel.

image.png

Intégrer l'apprentissage par renforcement et l'apprentissage supervisé pour créer un nouveau modèle d'"entraîneur d'IA"

Le long terme, l'entraînement traditionnel d'IA a connu un dilemme : l'apprentissage par renforcement permet au modèle d'explorer par essais et erreurs, ce qui est flexible mais peu efficace ; la micro-optimisation supervisée fournit directement les réponses correctes, ce qui est efficace mais rigide. La distillation en politique en ligne combine habilement ces deux approches — comme si on dotait le modèle étudiant d'un "entraîneur en temps réel" : l'étudiant génère du contenu de manière autonome, tandis que le modèle maître puissant évalue et guide ses sorties étape par étape, en minimisant la divergence de Kullback-Leibler entre les deux, afin d'assurer un transfert précis et stable des connaissances.

Cette mécanique évite non seulement les inconvénients de l'apprentissage classique où l'on apprend uniquement les résultats sans comprendre le processus, mais elle empêche également efficacement le modèle de "prendre des raccourcis" ou de surapprendre, améliorant ainsi considérablement sa capacité de généralisation.

image.png

Résultats impressionnants en pratique : réduction de 7 à 10 fois des étapes, augmentation de 100 fois de l'efficacité

Dans les tâches de raisonnement mathématique, l'équipe de recherche a atteint des performances proches de celles d'un modèle de 32 milliards de paramètres avec un modèle de 8 milliards de paramètres, en utilisant seulement 1/7 à 1/10 du nombre d'étapes d'entraînement requis par la méthode d'apprentissage par renforcement traditionnelle, réduisant ainsi le coût de calcul de deux ordres de grandeur. Cela signifie que les petites entreprises ou les équipes de recherche ayant des ressources limitées peuvent désormais entraîner efficacement des modèles professionnels compétitifs avec ceux des géants.

Plus important encore, cette méthode a résolu efficacement le problème du "rétrécissement catastrophique" rencontré lors de la mise en œuvre de l'IA dans les entreprises. Dans une expérience sur un assistant d'entreprise, le modèle a conservé pleinement ses capacités de dialogue et d'utilisation d'outils tout en apprenant de nouvelles connaissances métier — ce qui offre une voie faisable pour les systèmes d'IA sectoriels capables d'être itérés continuellement.

image.png

Background de l'équipe principale solide, la technologie provient d'expériences pratiques chez OpenAI

Cette recherche est dirigée par Kevin Lu, qui a mené plusieurs projets clés chez OpenAI. Aujourd'hui, en tant que membre principal de Thinking Machine, il apporte son expertise en entraînement de grands modèles vers une écologie de petits modèles performants. Selon son équipe, dans un contexte où l'IA devient plus verticale et scénarisée, les modèles "petits mais spécialisés" sont les acteurs principaux du déploiement commercial, et la distillation en politique en ligne est le moteur clé pour ouvrir cette voie.

Avec l'augmentation croissante des contraintes de calcul, l'industrie passe progressivement d'une vision axée sur les seuls grands modèles à une nouvelle norme axée sur l'intelligence efficace. Cette percée de Thinking Machine ne réduit pas seulement les barrières à l'entraînement de l'IA, mais annonce également l'arrivée accélérée d'une ère marquée par des modèles professionnels à haute performance et à faible coût.

Article : https://thinkingmachines.ai/blog/on-policy-distillation/