Em uma pesquisa conjunta recente, cientistas da Anthropic, do Instituto de Segurança de IA do Reino Unido e do Instituto Alan Turing revelaram um fato surpreendente: os modelos de linguagem grandes (como ChatGPT, Claude e Gemini) são muito menos resistentes a ataques de contaminação de dados do que imaginávamos. O estudo mostrou que os atacantes precisam inserir apenas cerca de 250 arquivos contaminados para implantar "portas secretas" nestes modelos, alterando a forma como eles respondem. Esta descoberta levanta reflexões profundas sobre as práticas atuais de segurança em IA.
A equipe de pesquisa testou modelos de IA de diferentes tamanhos, cujos parâmetros variavam de 6 milhões a 13 bilhões. Para surpresa dos pesquisadores, os atacantes conseguiram controlar com sucesso a saída do modelo ao adicionar apenas uma pequena quantidade de arquivos maliciosos aos dados de treinamento. Especificamente, para o modelo com o maior número de parâmetros (13 bilhões), os 250 arquivos contaminados representavam apenas 0,00016% do conjunto total de dados de treinamento. No entanto, quando o modelo recebia uma "frase de gatilho" específica, ele poderia produzir textos sem sentido, em vez de respostas normais e coerentes. Isso rompeu a crença anterior de que modelos maiores eram mais difíceis de atacar.

Nota da fonte da imagem: a imagem foi gerada por IA, o serviço de licenciamento é a Midjourney
Os pesquisadores também tentaram re treinar o modelo usando repetidamente "dados limpos", esperando eliminar o impacto das portas secretas, mas os resultados mostraram que as portas secretas ainda existiam e não podiam ser totalmente eliminadas. Embora este estudo se concentrasse principalmente em comportamentos simples de porta secreta e os modelos testados ainda não atingissem o nível comercial, ele realmente alertou sobre a segurança dos modelos de IA.
Com o rápido desenvolvimento da inteligência artificial, os riscos de ataques de contaminação de dados tornaram-se particularmente evidentes. Os pesquisadores pedem à indústria que reavalie e ajuste as práticas atuais de segurança para proteger melhor os modelos de IA. Esta descoberta não só nos fornece uma nova compreensão sobre a segurança da IA, mas também impõe exigências mais altas para o desenvolvimento tecnológico futuro.



