Dados de treino para IA: como coletar sem virar réu em 2025

Dados de treino para IA: como coletar sem virar réu em 2025

Sony e Warner vs. Anthropic: o que devs de IA precisam entender sobre dados de treino

Em mais um capítulo da briga judicial entre indústria musical e big techs de IA, Sony Music e Warner Music entraram com ação conjunta contra a Anthropic, segundo reportagem do Olhar Digital. A acusação é pesada: “um dos maiores e mais flagrantes roubos contínuos de propriedade intelectual da história”, incluindo torrenting, scraping e download massivo de obras protegidas para treinar o Claude.

Na minha experiência construindo e integrando LLMs em produção, isso não me surpreende. A questão é técnica, jurídica e ética ao mesmo tempo. E a maioria dos devs que estão embarcando agora no hype de fine-tuning e RAG não faz ideia do terreno minado em que está pisando.

O que está realmente acontecendo tecnicamente

Quando uma empresa como a Anthropic precisa de bilhões de tokens para treinar um modelo de fronteira, ela não vai atrás de datasets licenciados — eles são caros, limitados e raros. O caminho mais barato, e aparentemente o escolhido por muitos, é raspar a internet aberta: Common Crawl, sites de letras de música, repositórios GitHub, fóruns, PDFs acadêmicos.

O problema é que a maior parte desse conteúdo é protegido por direitos autorais. A Anthropic, segundo as gravadoras, não apenas raspou, como também baixou ativamente via torrent arquivos de música protegida. Isso é tecnicamente equivalente a:

  • Rastrear URLs em datasets públicos (Common Crawl, C4, The Pile)
  • Baixar livros piratas de bibliotecas como LibGen, Z-Library, Bibliotik
  • Fazer scraping de sites como Genius, AZLyrics e similares

O caso anterior dos autores — encerrado com acordo de US$ 1,5 bilhão — já dava o recado. Esse novo processo da Sony e Warner, somado ao da Concord e Universal (que pede mais de US$ 3 bilhões), mostra que a indústria do conteúdo não vai aceitar o “ask for forgiveness, not permission” que dominou os últimos anos.

Por que isso importa pra você, dev

Se você trabalha com IA, três cenários te colocam em risco direto:

  1. Você está fazendo fine-tuning de um modelo open-source usando dados que você mesmo coletou da web.
  2. Você está construindo um RAG indexando documentos internos da empresa — mas que vieram de fontes externas.
  3. Você está vendendo um produto cujo diferencial é “treinado em dados proprietários” — sem nunca ter licenciado esses dados.

Já vi startup inteira ser derrubada por usar datasets como Books3 sem entender as implicações. Books3 foi tirado do ar em 2023 justamente por causa de pressão legal — e qualquer modelo treinado nele carrega o risco de contaminação.

Na Prática: como coletar dados de treino sem virar réu

Trabalho com RAG há três anos e posso te dizer: a alternativa legal existe e é mais barata que parece. Vou te mostrar um pipeline mínimo viável.

1. Use fontes explicitamente licenciadas

  • Common Crawl — filtrar apenas o subconjunto com licenças compatíveis (CC-BY, CC0, public domain)
  • The Stack v2 — dataset de código com filtros de licença por arquivo
  • Wikipedia + Wikisource — licença CC-BY-SA permite uso comercial com atribuição
  • arXiv — papers com licenças variáveis, precisa filtrar

2. Implemente um filtro de qualidade e licença no pipeline

Abaixo um exemplo em Python de um filtro básico que você pode usar para descartar conteúdo com baixa confiança de licenciamento:

import re
from pathlib import Path
from urllib.parse import urlparse

# Domínios com licença explícita ou permissiva
DOMINIOS_PERMITIDOS = {
    "wikipedia.org", "wikisource.org", "arxiv.org",
    "github.com",  # cuidado: cada repo tem sua licença
    "creativecommons.org",
    "gutenberg.org",  # public domain
}

# Padrões de URL que indicam pirataria ou agregadores duvidosos
URLS_BLOQUEADOS = re.compile(
    r"(libgen|z-library|bibliotik|annas-archive|sci-hub)", 
    re.IGNORECASE
)

# Licenças válidas para uso comercial
LICENCAS_VALIDAS = {
    "CC0", "CC-BY", "CC-BY-SA", "MIT", "Apache-2.0",
    "BSD-2-Clause", "BSD-3-Clause", "Public Domain"
}

def document_to_seguro(doc: dict) -> bool:
    """Filtra documentos antes de entrar no dataset de treino."""
    url = doc.get("source_url", "")
    dominio = urlparse(url).netloc.lower()
    
    # Bloqueia domínios de pirataria
    if URLS_BLOQUEADOS.search(dominio):
        return False
    
    # Whitelist de domínios seguros
    if any(perm in dominio for perm in DOMINIOS_PERMITIDOS):
        return doc.get("license") in LICENCAS_VALIDAS
    
    # Para outros domínios, exige licença explícita + verificação
    licenca = doc.get("license", "").strip()
    return licenca in LICENCAS_VALIDAS

# Exemplo de uso em pipeline
documentos_brutos = [
    {"text": "...", "source_url": "https://pt.wikipedia.org/wiki/IA",
     "license": "CC-BY-SA"},
    {"text": "...", "source_url": "https://libgen.rs/book.pdf",
     "license": "Unknown"},
]

dataset_limpo = [d for d in documentos_brutos if document_to_seguro(d)]
print(f"Filtrados: {len(documentos_brutos) - len(dataset_limpo)} documentos")

3. Documente a procedência (provenance tracking)

Isso é crítico e pouca gente faz. Cada documento que entra no seu dataset deve carregar metadados de procedência: URL de origem, data de coleta, licença, hash do conteúdo. Se um juiz bater na sua porta, você precisa responder “de onde veio cada token” em segundos.

Erros comuns que devs cometem (e como evitar)

Erro 1: “Está na internet, é público, posso usar.”
Não. “Público” e “domínio público” são coisas completamente diferentes. Uma letra de música no Genius é pública no sentido de acessível, mas os direitos autorais pertencem à gravadora. Esse é o argumento central que derrubou a Anthropic no acordo dos autores.

Erro 2: Confundir RAG com uso de dados de treino.
RAG busca documentos em tempo de inferência e injeta no contexto. Isso é diferente de treinar um modelo. Mas se você indexou conteúdo pirata, ainda assim pode haver problema — especialmente em jurisdições como a UE, com a diretiva DSM (Art. 4). Documente sempre a origem do índice.

Erro 3: Achar que dataset open-source = juridicamente seguro.
Books3 era distribuído abertamente e foi removido. The Pile, C4 e Common Crawl contêm material com copyright. Usar o dataset não te blinda — você ainda responde solidariamente pelo conteúdo que ingeriu.

Erro 4: Ignorar opt-out.
Desde 2023, a robots.txt evoluiu com diretivas como User-agent: GPTBot e User-agent: ClaudeBot. Respeitar essas diretivas virou praticamente um padrão de mercado. Se você está fazendo scraping, implemente o filtro.

import urllib.robotparser as robotparser

def pode_coletar(url: str, user_agent: str = "MeuBot/1.0") -> bool:
    rp = robotparser.RobotFileParser()
    parsed = urlparse(url)
    robots_url = f"{parsed.scheme}://{parsed.netloc}/robots.txt"
    rp.set_url(robots_url)
    rp.read()
    return rp.can_fetch(user_agent, url)

Erro 5: Não olhar o ToS da fonte.
Mesmo conteúdo com licença CC pode ter Termos de Serviço que proíbem scraping automatizado. Reddit, Twitter/X e Stack Overflow já moveram processos por isso.

O “porquê” por trás das decisões técnicas

Por que a Anthropic não licencia? Porque datasets de qualidade para treinar modelos de fronteira custam dezenas de milhões de dólares em negociação, curadoria e revisão. A Universal Music, por exemplo, licencia seu catálogo em valores que startups em série B não conseguem pagar.

Isso cria um incentivo perverso: empresas que não têm grana para licenciar direito recorrem ao scraping ilegal. Quando viram grandes, viram alvos de processo. É um ciclo que a indústria musical está determinada a romper.

A solução real para o ecossistema vai passar por:

  • Licenças coletivas estilo PROs da música (ASCAP, BMI), adaptadas para texto
  • Sindicatos de dados como o já existente “Authors Guild” que negociam em bloco
  • Modelos de opt-in com pagamento por uso, tipo o que a Spotify faz com música

O que muda na sua stack amanhã

Se você está montando um produto com IA generativa em 2025/2026, três mudanças são inevitáveis:

  1. Provenance tracking obrigatório — registre a origem de cada documento do seu dataset e do seu índice RAG.
  2. Filtro de robots.txt no seu crawler, com tratamento explícito para GPTBot, ClaudeBot, Google-Extended.
  3. Auditoria de licença automatizada antes de qualquer retreino ou reindexação.

O custo de fazer isso direito é 5-10% a mais no seu pipeline. O custo de fazer errado é terminar numa lista de defendants ao lado da Anthropic.

FAQ — Perguntas que devs realmente fazem

Posso usar dados do Common Crawl sem me preocupar?
Não. Common Crawl contém conteúdo com copyright. O que você pode fazer é filtrar pelos subconjuntos com licenças compatíveis e manter provenance tracking do que restou.

RAG me protege de processo de copyright?
Parcialmente. RAG não é treinamento, mas se você indexou conteúdo pirata para alimentar o RAG, ainda pode ser responsabilizado dependendo da jurisdição (UE é mais rigorosa que EUA aqui).

Se eu usar só dados sintéticos, estou seguro?
Dados sintéticos gerados por um modelo que foi treinado em dados piratas herdam o problema. Você precisa garantir que toda a cadeia, incluindo o modelo base, tem origem limpa.

Qual a diferença prática entre CC-BY-SA e domínio público?
CC-BY-SA exige atribuição e herança da mesma licença. Domínio público não tem nenhuma restrição. Para uso comercial sem complicação, priorize CC0 e domínio público.

Devo usar a API do Claude/GPT em vez de treinar meu próprio modelo?
Do ponto de vista jurídico, sim. Usar a API transfere a responsabilidade legal para a Anthropic/OpenAI. Mas cuidado com outputs que reproduzam material protegido — ainda há risco de infração indireta.

Gostou? Me segue no GitHub e deixa um comentário se tiver dúvida ou quiser aprofundar algum ponto.

Y

Yuri Sousa

Front-End Developer / Designer

Desenvolvedor apaixonado por criar experiências digitais acessíveis e visualmente perfeitas. Escrevo sobre desenvolvimento web, design e tecnologia.