🎬 Assista esta matéria
Um pesquisador independente publicou no Hugging Face, em 3 de setembro de 2026, uma base de dados com 4,5 bilhões de registros de vídeos do TikTok. O material foi obtido em uma raspagem de três semanas contra a API privada do aplicativo Android da plataforma e ocupa 289 GB.
Segundo a descrição do próprio conjunto, a operação varreu 5,94 bilhões de vídeos e 3,23 bilhões de perfis de criadores. Desse total, 4,5 bilhões de registros de vídeo foram liberados para download gratuito, no repositório publicado sob o usuário kuben-developer.
O que está dentro
Não há arquivos de vídeo. O conjunto é composto apenas de metadados: legenda, contagem de visualizações, curtidas, comentários e salvamentos, o áudio usado, o país e o horário de publicação. É por isso que 4,5 bilhões de linhas cabem em 289 GB — o volume seria impensável se houvesse mídia.
Ainda assim, é um retrato do comportamento de uma plataforma inteira em escala que nenhum pesquisador acadêmico costuma alcançar sem acordo formal com a empresa. O custo declarado da coleta chama atenção pela desproporção: US$ 950 por mês de infraestrutura, algo em torno de R$ 5 mil.
O problema jurídico fica com quem baixa
A página do conjunto admite duas coisas incômodas. A primeira: a coleta violou os termos de uso do TikTok. A segunda: as legendas configuram dado pessoal sob o GDPR, o regulamento europeu de proteção de dados, mesmo tendo sido publicadas em perfis abertos.
Em seguida, o texto transfere a responsabilidade ao usuário — a obrigação legal passa a ser de quem faz o download. A restrição contra usos de identificação, perfilamento e segmentação publicitária está escrita em política, não em barreira técnica: nada no arquivo impede que seja usado exatamente para isso.
A lógica se repete sob a LGPD. Dado publicado em perfil aberto não vira dado livre: o tratamento continua exigindo base legal, e a origem irregular da coleta enfraquece qualquer tentativa de invocar legítimo interesse. Para pesquisadores e empresas brasileiras, baixar o conjunto é assumir o passivo que o autor da raspagem descartou.
O episódio expõe uma lacuna prática do Hugging Face, que virou o repositório padrão de conjuntos de dados de IA sem ter mecanismo de verificação de procedência. Até a publicação desta matéria, o repositório seguia no ar.
Fontes: Hugging Face, Hacker News
🎙️ Gostou? Receba só o que te interessa, todo dia
Escolha seus temas e receba um briefing diário em áudio e texto, de graça, no WhatsApp ou e-mail.
Montar meu briefing grátis