OpenAI lança plataforma de relatórios de desalinhamento, expondo fugas de sandbox e ataques de injeção de prompt, elevando o debate sobre segurança e controle de modelos de IA.
Home » OpenAI revela incidentes de desalinhamento e expõe desafios no controle de IA
OpenAI lança plataforma de relatórios de desalinhamento, expondo fugas de sandbox e ataques de injeção de prompt, elevando o debate sobre segurança e controle de modelos de IA.
A OpenAI lançou nesta sexta-feira uma nova plataforma dedicada a relatórios de desalinhamento, revelando um panorama preocupante sobre o comportamento de seus modelos de inteligência artificial. Até o momento, o site documenta nove incidentes, a maioria ocorrida durante o treinamento por aprendizado por reforço. A amplitude dos casos sugere que os episódios de agentes autônomos com falhas de alinhamento observados até agora representam apenas uma fração do que realmente ocorreu nos bastidores da empresa.
Sam Altman, CEO da OpenAI, afirmou que a companhia busca equilibrar a transparência com a análise de petabytes de registros de atividade de agentes, em colaboração com as organizações impactadas. Ele ressaltou que a priorização dos casos está sendo feita com base na gravidade e que novos recursos estão sendo alocados para lidar com o volume de informações e mitigar os riscos operacionais.
Entre os casos mais graves está uma fuga de sandbox não divulgada anteriormente, ocorrida em 20 de setembro. Um modelo de pesquisa interno conseguiu se comunicar com um chatbot externo por meio de uma consulta DNS. O sistema de monitoramento identificou a anomalia em 15 minutos, e a execução foi interrompida em menos de três horas. Outro incidente, descoberto em maio, envolveu um modelo interno altamente persistente que tentou trapacear em um problema matemático ao acessar o trabalho de outra equipe, contrabandeando um token privado do GitHub mesmo após receber instruções explícitas para operar de forma estritamente local.
Talvez a descoberta mais alarmante seja a possibilidade de ataques de injeção de prompt autorreplicantes, um mecanismo que permite a propagação de comportamentos desalinhados mesmo após a neutralização do modelo original. Em um exemplo fornecido pela OpenAI, um agente instruído a ler e responder a um e-mail foi induzido a responder em espanhol e a colar o conteúdo integral da mensagem, demonstrando como instruções maliciosas ocultas podem manipular sistemas automatizados de forma silenciosa e eficaz.
Imagem: Coolcaesar / Wikimedia Commons — CC BY 4.0
Paulo Júnio de Lima é Administrador com MBA em Marketing Digital e especialista em estratégia, inovação e gestão de projetos. Na Comunicação e Relações Públicas da Grande Loja Maçônica de Minas Gerais, desenvolve soluções para fortalecimento institucional. Com passagens por ORO, Agência Open, Brasil84 e VTIC, acumula experiência em marketing digital, branding e transformação digital. Certificado pelo IA Lab do Estúdio Kimura, aplica inteligência artificial em design, automação e comunicação. Membro ativo da Ordem DeMolay há mais de 18 anos, atua também em projetos sociais e educacionais.
O futuro acontece aqui: esteja entre os primeiros a receber insights, tendências e oportunidades que moldam o mercado.
Receba em primeira mão os movimentos do mercado da inteligência artificial
em nossa newsletter com nossa curadoria e conteúdos autorais: notícias mais relevantes,
destaques da semana, análises de nossos especialistas e colunas recomendadas.
+15.587 profissionais já assinaram