article

Base com 4,5 bi de vídeos do TikTok vai ao ar

3 min de leitura

🎬 Assista esta matéria

Um pesquisador independente publicou no Hugging Face, em 3 de setembro de 2026, uma base de dados com 4,5 bilhões de registros de vídeos do TikTok. O material foi obtido em uma raspagem de três semanas contra a API privada do aplicativo Android da plataforma e ocupa 289 GB.

Segundo a descrição do próprio conjunto, a operação varreu 5,94 bilhões de vídeos e 3,23 bilhões de perfis de criadores. Desse total, 4,5 bilhões de registros de vídeo foram liberados para download gratuito, no repositório publicado sob o usuário kuben-developer.

O que está dentro

Não há arquivos de vídeo. O conjunto é composto apenas de metadados: legenda, contagem de visualizações, curtidas, comentários e salvamentos, o áudio usado, o país e o horário de publicação. É por isso que 4,5 bilhões de linhas cabem em 289 GB — o volume seria impensável se houvesse mídia.

Ainda assim, é um retrato do comportamento de uma plataforma inteira em escala que nenhum pesquisador acadêmico costuma alcançar sem acordo formal com a empresa. O custo declarado da coleta chama atenção pela desproporção: US$ 950 por mês de infraestrutura, algo em torno de R$ 5 mil.

O problema jurídico fica com quem baixa

A página do conjunto admite duas coisas incômodas. A primeira: a coleta violou os termos de uso do TikTok. A segunda: as legendas configuram dado pessoal sob o GDPR, o regulamento europeu de proteção de dados, mesmo tendo sido publicadas em perfis abertos.

Em seguida, o texto transfere a responsabilidade ao usuário — a obrigação legal passa a ser de quem faz o download. A restrição contra usos de identificação, perfilamento e segmentação publicitária está escrita em política, não em barreira técnica: nada no arquivo impede que seja usado exatamente para isso.

A lógica se repete sob a LGPD. Dado publicado em perfil aberto não vira dado livre: o tratamento continua exigindo base legal, e a origem irregular da coleta enfraquece qualquer tentativa de invocar legítimo interesse. Para pesquisadores e empresas brasileiras, baixar o conjunto é assumir o passivo que o autor da raspagem descartou.

O episódio expõe uma lacuna prática do Hugging Face, que virou o repositório padrão de conjuntos de dados de IA sem ter mecanismo de verificação de procedência. Até a publicação desta matéria, o repositório seguia no ar.

Fontes: Hugging Face, Hacker News

🎙️ Gostou? Receba só o que te interessa, todo dia

Escolha seus temas e receba um briefing diário em áudio e texto, de graça, no WhatsApp ou e-mail.

Montar meu briefing grátis