OpenAI vs NYT: como a defesa do fair use impacta devs de IA

OpenAI vs NYT: como a defesa do fair use impacta devs de IA

2>O que está em jogo: o governo Trump entrou na briga OpenAI vs. New York Times — e isso muda tudo para quem desenvolve com IA

Quando li a notícia no Olhardigital.com.br sobre a administração Trump ter apresentado uma statement of interest defendendo que treinar modelos de linguagem com material protegido pode ser uso justo, minha primeira reação foi: “isso é a maior decisão sobre IA desde o lançamento do GPT-3”. Não é exagero. Se a Justiça americana acatar essa posição, todo o ecossistema de desenvolvimento em cima de LLMs ganha um colchão de segurança jurídica que hoje não tem.

O The New York Times processou a OpenAI em dezembro de 2023, alegando que a empresa usou artigos do jornal para treinar modelos como o GPT-4 sem autorização. A cobrança é bilionária — OpenAI e Microsoft no alvo. Agora, o governo americano entrou com uma manifestação oficial dizendo que esse tipo de treinamento se enquadra na doutrina de fair use. Vou te mostrar o impacto prático disso no código que você escreve todo dia.

O pano de fundo técnico: como LLMs realmente aprendem com textos

Antes de entrar no mérito jurídico, preciso destrinchar o que acontece tecnicamente quando um modelo “consome” um artigo do New York Times. A maioria dos devs que usa ChatGPT ou Claude no dia a dia nunca parou pra pensar no pipeline real.

Quando você faz fine-tuning ou treina um modelo do zero, o fluxo é mais ou menos este:

  1. Coleta e limpeza: raspagem de textos, remoção de HTML, normalização de encoding
  2. Tokenização: o texto vira uma sequência de tokens (pedaços de palavras)
  3. Embedding: cada token vira um vetor numérico de alta dimensionalidade
  4. Treinamento: o modelo ajusta bilhões de parâmetros pra prever o próximo token dado um contexto

O ponto crítico é: durante o treinamento, o modelo não “memoriza” artigos palavra por palavra. Ele aprende padrões estatísticos — distribuições de probabilidade sobre sequências de tokens. É a diferença entre fotocópia e abstração.

O argumento central do governo Trump

Segundo os advogados do governo, o NYT quer “restringir a doutrina de uso justo para excluir o treinamento dos grandes modelos de linguagem”. A administração defende que isso entra em conflito com princípios básicos da legislação de direitos autorais e prejudicaria o avanço da ciência e das artes úteis.

Em outras palavras: se cada texto usado para treinar um modelo precisar de licença individual, o custo computacional e financeiro de treinar qualquer LLM novo explode. E aqui mora o perigo — não só para big techs como OpenAI, mas para qualquer dev brasileiro que queira treinar um modelo regional em português com corpus jornalístico.

Na Prática: um exemplo real de pipeline de pré-processamento

Vou te mostrar um snippet que escrevi pra um projeto de classificação de textos. É o tipo de coisa que entra num pipeline de treinamento e que, dependendo do corpus, pode estar pisando em terreno minado hoje.

import re
from typing import List, Iterator
from pathlib import Path

class CorpusPreprocessor:
    """Pipeline básico de limpeza de texto para fine-tuning."""

    def __init__(self, min_length: int = 100, max_length: int = 2048):
        self.min_length = min_length
        self.max_length = max_length
        self.html_pattern = re.compile(r'<[^>]+>')
        self.url_pattern = re.compile(r'https?://\S+')

    def clean(self, text: str) -> str:
        text = self.html_pattern.sub('', text)
        text = self.url_pattern.sub('[URL]', text)
        text = re.sub(r'\s+', ' ', text).strip()
        return text

    def filter_quality(self, docs: List[str]) -> Iterator[str]:
        for doc in docs:
            cleaned = self.clean(doc)
            if self.min_length <= len(cleaned) <= self.max_length:
                yield cleaned

    def estimate_tokens(self, text: str, chars_per_token: float = 4.0) -> int:
        return int(len(text) / chars_per_token)

# Uso real
corpus_path = Path('./data/articles/')
raw_docs = [f.read_text(encoding='utf-8') for f in corpus_path.glob('*.txt')]
preprocessor = CorpusPreprocessor()
clean_corpus = list(preprocessor.filter_quality(raw_docs))
print(f"Documentos válidos: {len(clean_corpus)}")
print(f"Tokens estimados: {sum(preprocessor.estimate_tokens(d) for d in clean_corpus)}")

Perceba: nada nesse código é ilegal isoladamente. O problema está na origem do corpus. Se eu raspar artigos do NYT sem licença e usar isso pra treinar um modelo comercial, hoje estou exposto. Se a decisão a favor do fair use prevalecer, esse mesmo código deixa de ser um risco jurídico.

Comparação com outras batalhas do setor

Esse caso NYT vs. OpenAI não está sozinho. O ecossistema de IA virou um campo minado jurídico:

  • Getty Images vs. Stability AI (2023): processo por uso de imagens no treinamento do Stable Diffusion. Getty reivindica propriedade sobre o dataset LAION-5B.
  • Authors Guild vs. OpenAI: escritores como George R.R. Martin processam por uso de obras literárias no treinamento.
  • Sarah Silverman e autores: ação coletiva alegando que o ChatGPT reproduz trechos literais de livros protegidos.

A manifestação do governo americano é a primeira vez que o poder executivo se posiciona formalmente a favor da indústria de IA nesses casos. Isso pesa. Não é opinião de especialista — é política pública.

Erros comuns que devs cometem (e que podem virar problema sério)

Depois de anos vendo gente construir produto com IA, listei os deslizes mais frequentes que podem te queimar se o cenário jurídico apertar:

1. Raspar sites sem checar o robots.txt e os Termos de Uso

Tecnicamente scraping pode ser legal em várias jurisdições, mas treinar um modelo comercial com dados de sites que proíbem isso explicitamente é convite pra processo. Use APIs oficiais sempre que possível. Se não tiver, consulte advogado.

2. Achar que fair use é global

A doutrina de fair use é americana. No Brasil, a regra é diferente — a Lei 9.610/98 fala em “utilização livre” com exceções específicas. Treinar modelo com jornal brasileiro sem autorização não é automaticamente fair use só porque o governo Trump acha que é nos EUA.

3. Não documentar a proveniência do dataset

Eu sei: todo dev quer ir direto pro notebook e treinar o modelo. Mas sem um data lineage claro — de onde veio cada pedaço do corpus — você não consegue responder “sim, tenho licença ou base legal” se um publisher vier perguntar. Crie um dataset_card.json desde o dia 1.

4. Confundir RAG com treinamento

Retrieval-Augmented Generation não é a mesma coisa que treinar um modelo. RAG busca documentos em tempo real e injeta no contexto. Se o documento está no seu banco de vetores e você responde ao usuário citando ele, não houve “treinamento” com a obra — só leitura e citação. Mas atenção: há controvérsias sobre isso também.

5. Ignorar a LGPD pensando “dados públicos são livres”

Texto jornalístico pode envolver dados pessoais. Se você está extraindo artigos que mencionam pessoas identificáveis, entra território de proteção de dados. A LGPD não morreu só porque seu corpus é público.

O que muda na prática se a Justiça aceitar o argumento do governo?

Vou ser direto: muda muita coisa.

Cenário positivo (fair use ganha): o custo de treinar novos modelos cai, mais players entram no mercado, devs conseguem experimentar com datasets maiores, e a inovação em modelos regionais (português, espanhol, línguas africanas) ganha fôlego.

Cenário negativo (NYT ganha): licenças passam a ser obrigatórias, OpenAI e Microsoft pagam indenizações bilionárias, e o setor caminha pra um modelo tipo Spotify — onde publishers negociam coletivamente. Isso concentra poder nas mãos de quem pode pagar, e devs pequenos ficam de fora.

Na minha leitura, o mais provável é um meio-termo: a Justiça aceita fair use para treinamento, mas obriga mecanismos de opt-out mais robustos e regras de transparência sobre o que está no dataset.

FAQ — Perguntas que devs realmente fazem

Posso usar artigos de jornal pra treinar um modelo open-source sem fins lucrativos?

Depende da jurisdição. Nos EUA, a probabilidade de fair use ser aplicado é maior em uso não-comercial. No Brasil, mesmo sem fins lucrativos, a lei de direitos autorais é mais restritiva. Sempre consulte um advogado especializado.

O que é uma “statement of interest” e quanto pesa numa decisão?

É uma manifestação oficial em que o governo expõe sua posição sobre um caso, sem ser parte do processo. Juízes federais americanos costumam dar peso significativo a essas manifestações porque refletem interpretação executiva da lei. Não é vinculante, mas influencia.

Como saber se um dataset que estou usando tem licença problemática?

Plataformas como Hugging Face têm dataset cards com a procedência declarada. Mas “declarada” não é “comprovada”. Para projetos sérios, vale auditar manualmente amostras e cruzar com licenças originais dos publishers.

Fine-tuning com dados do meu cliente é mais seguro do que treinar do zero?

Sim, na maioria dos casos. Se o cliente é dono do dado e te deu autorização por contrato escrito, o risco jurídico é dele, não seu. Mas garanta que isso está explícito no contrato, incluindo cláusulas sobre uso para melhoria de modelo.

Ferramentas como o OpenAI Playground usam meus prompts pra treinar?

Por padrão, a OpenAI não usa dados da API para treinamento, a menos que você opte explicitamente por isso (ou use a interface web do ChatGPT sem desativar a opção). Confira os termos de uso sempre — eles mudam com frequência.

Considerações finais

Essa briga entre NYT, OpenAI e governo Trump não é só uma novela jurídica americana. É o tipo de decisão que vai definir o que devs como eu e você podem ou não fazer nos próximos dez anos. Se você trabalha com IA — mesmo que seja só chamando API de LLM num SaaS — vale acompanhar esse processo de perto.

Na minha experiência, o melhor que a gente pode fazer enquanto a poeira baixa é documentar tudo, usar fontes oficiais sempre que der, e manter um dataset lineage impecável. Não é só boa prática — é seguro-vida.

Gostou? Me segue no GitHub e deixa um comentário se tiver dúvida ou quiser aprofundar algum ponto. Se quiser, posso escrever um próximo post mostrando como montar um pipeline de treinamento com data lineage automático — é um tema que dá pano pra manga.

Y

Yuri Sousa

Front-End Developer / Designer

Desenvolvedor apaixonado por criar experiências digitais acessíveis e visualmente perfeitas. Escrevo sobre desenvolvimento web, design e tecnologia.