The New York Times acusa OpenAI de ocultar evidências em processo de direitos autorais

Publicações acusam a OpenAI de ocultar evidências e excluir bilhões de logs no processo de direitos autorais, escalando a disputa judicial sobre o treinamento do ChatGPT.

O The New York Times e o Daily News acusam a OpenAI de ocultar evidências cruciais no processo de direitos autorais em andamento. Segundo as publicações, a empresa de inteligência artificial mentiu sobre sua capacidade de buscar obras jornalísticas protegidas em seus logs de conversas e conjuntos de dados de treinamento. A alegação representa uma escalada significativa na disputa judicial de dois anos, que questiona o uso de conteúdo protegido para treinar modelos generativos.

Ao longo do litígio, a OpenAI sustentou que não possuía a capacidade técnica de vasculhar seu próprio corpus de treinamento. A empresa também argumentou que a recuperação e o processamento de seu vasto acervo de conversas do ChatGPT seriam excessivamente onerosos e violariam a privacidade dos usuários. No entanto, um depoimento em abril revelou que a OpenAI já havia realizado buscas internas e avaliações em seu corpus para localizar obras jornalísticas com direitos autorais.

O engenheiro de privacidade de dados da OpenAI, Vinnie Monaco, admitiu em depoimento que, antes mesmo da ação do The New York Times, a companhia já havia acumulado um banco de dados com cerca de 78 milhões de conversas do ChatGPT anonimizadas. Esse acervo seria utilizado internamente para mensurar o nível de infração a obras de terceiros. Além disso, logo após o início do processo, a empresa implementou o Project Giraffe, um conjunto de ferramentas com um filtro Bloom projetado para detectar e registrar a reprodução não autorizada de conteúdo em suas saídas.

Essas revelações lançam dúvidas sobre a conduta da OpenAI em relação às descobertas documentais. As autoras da ação haviam solicitado inicialmente 120 milhões de registros de chat, negociando uma redução para 20 milhões. A amostra entregue em dezembro continha tantas redações que o tribunal a considerou inutilizável. Adicionalmente, as publicações alegam que a OpenAI excluiu bilhões de saídas do ChatGPT após o ajuizamento da ação, em suposta violação direta das ordens de preservação de provas.

Imagem: Esculenta / Wikimedia Commons — CC BY-SA 4.0

Paulo Junio

Paulo Júnio de Lima é Administrador com MBA em Marketing Digital e especialista em estratégia, inovação e gestão de projetos. Na Comunicação e Relações Públicas da Grande Loja Maçônica de Minas Gerais, desenvolve soluções para fortalecimento institucional. Com passagens por ORO, Agência Open, Brasil84 e VTIC, acumula experiência em marketing digital, branding e transformação digital. Certificado pelo IA Lab do Estúdio Kimura, aplica inteligência artificial em design, automação e comunicação. Membro ativo da Ordem DeMolay há mais de 18 anos, atua também em projetos sociais e educacionais.