🎬 Assista esta matéria
Documentos do processo do New York Times contra a OpenAI e a Microsoft foram liberados sem tarjas e vieram a público na quinta-feira, 17 de setembro de 2026. Neles, um diretor da própria Microsoft descreve a raspagem de conteúdo jornalístico para treinar modelos como “o maior roubo de trabalho da história da humanidade”.
A frase é de Brent Hecht, diretor de ciência aplicada da Microsoft, num memorando interno de janeiro de 2023. No mesmo texto ele fala em “um roubo espantoso, de proporções sem precedentes”. A Microsoft é ré no caso ao lado da OpenAI por ter financiado e distribuído os modelos em questão.
O que os números mostram
Os arquivos trazem contagens que até agora estavam cobertas. Os autores apontam mais de 91.692 cópias de obras do New York Times, do Daily News e do Center for Investigative Reporting dentro de conjuntos de dados usados no meio do treino da OpenAI, além de mais de 2 milhões de documentos do domínio nytimes.com em bases derivadas do Common Crawl. Um conjunto interno apelidado de Project Mango reuniria 160.903 obras únicas de veículos jornalísticos.
Há também um dado sobre tráfego: segundo o material, a taxa de cliques que levavam ao site do Times pelo Copilot, da Microsoft, caiu 93%.
As peças descrevem ainda práticas como contornar paywalls sem ser detectado, remover avisos de direito autoral dos dados de treino e trocar bases entre as duas empresas por meio dos projetos internos batizados de Taxi e Mango.
Depoimentos dos executivos
Satya Nadella, presidente-executivo da Microsoft, afirmou em depoimento que conteúdo pago “deveria ser licenciado por qualquer um que queira usá-lo para grounding ou treino” e disse que teria exigido o retreino dos modelos se soubesse da raspagem não autorizada.
Do lado da OpenAI, Nick Turley, responsável pelo ChatGPT, descreve os veículos diante de uma “ameaça existencial” vinda de produtos de IA “amplamente substitutivos” — ou seja, que entregam o conteúdo em vez de mandar o leitor até a fonte. O presidente da OpenAI, Greg Brockman, aparece dizendo que os modelos são “excelentes em notícias”.
O material contrasta com a posição pública recente do governo americano no mesmo caso, que tratou o treino de modelos como uso justo. A ação segue em curso, e os documentos ainda passarão por disputa sobre admissibilidade.
Fontes: TechCrunch
🎙️ Gostou? Receba só o que te interessa, todo dia
Escolha seus temas e receba um briefing diário em áudio e texto, de graça, no WhatsApp ou e-mail.
Montar meu briefing grátis