Recentemente, a equipe de IA emergente Thinking Machine lançou um método inovador de treinamento chamado "Distilização de Estratégia em Tempo Real" (On-Policy Distillation), que aumenta até 50 a 100 vezes a eficiência do treinamento de modelos pequenos em tarefas específicas. O resultado foi imediatamente compartilhado pelo ex-CTO da OpenAI, Mira Murati, gerando grande atenção da comunidade acadêmica e industrial.

Integração de Aprendizado por Reforço e Aprendizado Supervisionado, Criando um Novo Modelo de "Treinador de IA"
O treinamento tradicional de IA enfrentava um dilema: o aprendizado por reforço permite que o modelo explore sozinho, sendo flexível mas ineficiente; a fine-tuning supervisionado fornece respostas corretas diretamente, sendo eficiente mas rígido. Já a distilização de estratégia em tempo real combina esses dois métodos de forma inteligente – como se fosse um "treinador em tempo real" para o modelo estudante: enquanto o estudante gera conteúdo autonomamente, o modelo professor poderoso fornece classificação e orientação dinâmica para cada passo, minimizando a divergência de Kullback-Leibler entre os dois, garantindo uma transferência precisa e estável de conhecimento.
Essa mecânica não apenas evita os problemas tradicionais de "aprender apenas os resultados, não o processo", mas também previne efetivamente que o modelo "encontre atalhos" ou sobreajuste, melhorando significativamente sua capacidade de generalização.

Efeitos Prévios Surpreendentes: Redução de 7 a 10 Vezes nos Passos, Aumento de 100 Vezes na Eficiência
Em tarefas de raciocínio matemático, a equipe de pesquisa conseguiu que um modelo pequeno de 8B alcance desempenho próximo ao de um modelo grande de 32B com apenas 1/7 a 1/10 dos passos de treinamento usados pelos métodos tradicionais de aprendizado por reforço, reduzindo o custo computacional em duas ordens de magnitude. Isso significa que empresas e equipes de pesquisa com recursos limitados também podem treinar modelos profissionais com eficiência comparáveis aos de grandes corporações.
O mais importante é que esse método resolveu com sucesso o problema de "esquecimento catastrófico" nas implementações empresariais de IA. Em um experimento com assistente corporativo, o modelo manteve todas as habilidades de diálogo e uso de ferramentas existentes, enquanto aprendia novos conhecimentos de negócios – isso fornece uma rota viável para sistemas de IA industrial com atualizações contínuas.

Experiência de Equipe Profunda, Tecnologia Baseada em Experiências da OpenAI
O estudo foi liderado por Kevin Lu, que já dirigiu vários projetos importantes na OpenAI. Agora, como membro principal da Thinking Machine, ele aplica suas experiências avançadas no treinamento de modelos grandes à ecologia de modelos pequenos eficientes. Sua equipe acredita que, com a IA se tornando mais verticalizada e cenarizada, os modelos "pequenos e especializados" são os principais motores para o desempenho comercial, e a distilização de estratégia em tempo real é a chave para abrir essa via.
Com a escassez crescente de potência de computação, a indústria está mudando do "modelo grande" para uma nova abordagem chamada "inteligência eficiente". Essa inovação da Thinking Machine não apenas reduz significativamente a barreira para o desenvolvimento de IA, mas também indica que uma era de modelos profissionais com alto custo-benefício está se aproximando rapidamente.
Artigo: https://thinkingmachines.ai/blog/on-policy-distillation/