O dado mais importante do levantamento do MonitorA não é apenas que a inteligência artificial aparece em ataques contra candidatas: é que imagens ofensivas podem ser produzidas e distribuídas em escala, enquanto a identificação de uma manipulação continua sujeita a incerteza. Segundo o Olhardigital.com.br, pesquisadores encontraram sinais de uso de IA em 25% das imagens classificadas como ataques ou insultos no X; em outros 9%, não foi possível concluir se houve manipulação.
Para quem desenvolve sistemas de moderação, denúncia ou análise de conteúdo, isso muda a pergunta técnica. Não basta tentar responder “esta imagem foi feita por IA?”. É preciso identificar o conteúdo abusivo, preservar evidências, reduzir a circulação e encaminhar casos duvidosos para revisão humana, sem transformar um detector probabilístico em juiz.
O que o levantamento revela sobre ataques a candidatas com IA
O MonitorA analisou 11.137 imagens publicadas em 9.393 comentários em perfis de 132 candidatas, em dois períodos de campanha. Ao todo, 660 imagens foram classificadas como ofensivas contra candidatas no X. Marina Silva concentrou 125 registros, seguida por Sâmia Bomfim, com 111, e Erika Hilton, com 109.
As três responderam juntas por quase metade das imagens ofensivas identificadas. Esse recorte importa: ataques direcionados não se distribuem necessariamente de forma uniforme. Uma ferramenta que acompanha apenas o volume geral de conteúdo pode deixar passar concentrações intensas contra pessoas específicas.
Os números também precisam ser lidos com precisão. Os 25% dizem respeito a imagens ofensivas nas quais o estudo identificou sinais de uso de IA, não a todas as imagens publicadas sobre candidatas. E os 9% de incerteza não são uma confirmação de manipulação: representam casos em que a análise não conseguiu determinar a origem.
Por que detectar uma imagem gerada por IA é uma tarefa difícil
Na minha experiência com sistemas de classificação, o erro começa quando uma equipe trata “gerada por IA” como uma propriedade simples, que pode ser lida diretamente do arquivo. Não existe um indicador universal e confiável que acompanhe toda imagem sintética até a publicação.
Metadados podem ser removidos por redes sociais, editores e ferramentas de captura de tela. Uma imagem gerada pode ser redimensionada, comprimida, recortada ou fotografada a partir de outra tela. Cada transformação reduz a utilidade de alguns sinais técnicos. Por outro lado, imagens reais também podem apresentar artefatos que confundem classificadores.
Detectores de imagem sintética podem ajudar a priorizar uma fila de análise, mas não devem ser tratados como prova isolada. O resultado depende do modelo, dos dados usados no treinamento, do tipo de imagem e das alterações aplicadas depois da geração. Um percentual de confiança emitido por um classificador não significa, automaticamente, que exista a mesma probabilidade de a imagem ser falsa no mundo real.
Abuso e origem sintética são classificações diferentes
Uma imagem pode ser ofensiva sem ter sido gerada por IA. Também pode ter sido produzida por IA sem atacar ninguém. Misturar as duas perguntas em um único rótulo cria erros de produto: por exemplo, deixar um conteúdo abusivo disponível porque o detector não encontrou sinais de geração sintética.
Eu separaria a análise em pelo menos duas dimensões: o que o conteúdo comunica e como ele pode ter sido produzido ou alterado. A primeira orienta a avaliação de abuso e dano. A segunda serve como contexto investigativo, com incerteza explícita.
Como desenhar uma moderação responsável para imagens políticas
Uma arquitetura prática começa pela ingestão e preservação do material, não pela tentativa de adivinhar sua origem. Eu armazenaria a imagem original, quando isso for permitido, junto com a URL, o horário de coleta, o identificador da publicação e um hash criptográfico. O hash ajuda a verificar se o arquivo preservado mudou; não prova quem criou a imagem nem que ela é verdadeira.
- Detectar conteúdo potencialmente abusivo: classificar texto e imagem para encaminhar casos à fila apropriada, considerando contexto e idioma.
- Identificar padrões repetidos: comparar hashes perceptuais para encontrar versões visualmente semelhantes, mesmo com pequenas alterações.
- Registrar sinais de procedência: guardar metadados disponíveis e resultados de ferramentas como evidências auxiliares, não como vereditos.
- Aplicar revisão humana: priorizar conteúdo com maior risco, recorrência ou alcance, mantendo registro da decisão e possibilidade de contestação.
- Medir falsos positivos e falsos negativos: avaliar resultados por tipo de conteúdo, grupo afetado e etapa do processo.
Essa separação é importante para evitar que um sistema de moderação confunda sátira, crítica política, denúncia jornalística e ataque direcionado. O modelo pode ajudar a encontrar casos; a política de moderação precisa definir o que fazer com eles.
Na Prática: um classificador de risco para organizar a revisão
O exemplo abaixo não tenta afirmar que uma imagem foi criada por IA. Ele calcula uma prioridade operacional a partir de sinais já observados pela equipe: se o conteúdo foi marcado como abusivo, se há indicação de possível edição sintética, se o caso está incerto e se existem republicações semelhantes.
Na aplicação real, esses campos viriam de etapas diferentes do pipeline e precisariam de validação. A função serve para ordenar a fila de revisão, não para remover conteúdo automaticamente nem para substituir análise humana.
from dataclasses import dataclass
@dataclass
class Caso:
abuso_sinalizado: bool
possivel_sintese: bool
origem_incerta: bool
republicacoes_semelhantes: int
def prioridade(caso: Caso) -> tuple[int, str]:
"""Retorna uma pontuação de triagem, não um veredito."""
pontos = 0
if caso.abuso_sinalizado:
pontos += 5
if caso.possivel_sintese:
pontos += 1
if caso.origem_incerta:
pontos += 1
pontos += min(caso.republicacoes_semelhantes, 10)
if pontos >= 10:
fila = "urgente"
elif pontos >= 5:
fila = "revisao_prioritaria"
else:
fila = "revisao_padrao"
return pontos, fila
caso = Caso(
abuso_sinalizado=True,
possivel_sintese=True,
origem_incerta=False,
republicacoes_semelhantes=4,
)
pontos, fila = prioridade(caso)
print({"pontos": pontos, "fila": fila})
O motivo para dar mais peso ao sinal de abuso do que ao de síntese é simples: o dano pode existir independentemente da técnica usada para produzir a imagem. Já a recorrência ajuda a reconhecer campanhas coordenadas ou conteúdo que está se espalhando, mas também exige cautela para não confundir republicação crítica com apoio ao ataque.
Em produção, eu adicionaria trilha de auditoria: qual regra elevou a prioridade, qual modelo gerou cada sinal, quando ocorreu a análise e quem revisou o caso. Sem isso, fica difícil investigar decisões inconsistentes ou corrigir uma regra que esteja afetando determinados grupos de forma desproporcional.
Erros comuns na detecção de imagens manipuladas
- Usar um detector de IA como prova definitiva: classificadores erram, especialmente após compressão, recorte ou edição. Use o resultado como indício e registre a incerteza.
- Confundir imagem sintética com conteúdo abusivo: são perguntas diferentes e precisam de regras diferentes. A origem não determina, sozinha, o impacto do conteúdo.
- Apagar o arquivo original durante o processamento: versões recompactadas podem dificultar análises posteriores. Defina retenção, controle de acesso e proteção de dados antes de armazenar evidências.
- Ignorar contexto e idioma: um modelo treinado para outro contexto pode interpretar mal ironia, insultos locais ou referências políticas. Faça avaliações com dados representativos e revisão especializada.
- Automatizar remoções com um único limiar: um score não expressa toda a política de moderação. Em casos de alto impacto, encaminhe para revisão ou use medidas graduais, conforme as regras da plataforma.
- Medir apenas a acurácia geral: uma métrica agregada pode esconder falhas concentradas em certos grupos ou tipos de ataque. Acompanhe erros por categoria e revise a amostra periodicamente.
O que esse cenário muda para quem desenvolve
O desafio não é só escolher um modelo de visão computacional. É construir um sistema que consiga operar sob incerteza, manter evidências proporcionais ao risco e explicar por que um caso foi priorizado. Isso vale para plataformas sociais, ferramentas de integridade cívica, sistemas de denúncia e produtos de monitoramento de marca.
Também é uma questão de experiência do usuário. Quem denuncia precisa entender o que acontecerá depois; quem revisa precisa receber contexto suficiente sem ser exposto desnecessariamente a material nocivo; e quem é afetado deve ter um caminho para pedir revisão. Um pipeline tecnicamente sofisticado, mas sem essas etapas, pode apenas automatizar decisões ruins em maior escala.
O levantamento do MonitorA mostra que a IA pode ampliar a produção de ataques visuais contra mulheres na política. Para desenvolvedores, a resposta responsável não é prometer detecção perfeita. É combinar sinais técnicos, análise de contexto, revisão humana e métricas que revelem onde o sistema falha.
Perguntas frequentes
Um detector consegue provar que uma imagem foi criada por IA?
Não de forma universal. Detectores podem apontar sinais compatíveis com geração ou edição sintética, mas alterações, compressão e limitações do modelo afetam o resultado. Trate a saída como indício, não como prova isolada.
Devo remover automaticamente toda imagem marcada como gerada por IA?
Não. A origem sintética não significa, por si só, que o conteúdo seja abusivo ou viole uma regra. Avalie separadamente o conteúdo, o contexto e a política aplicável, com revisão humana nos casos de maior impacto.
Hash perceptual identifica cópias de uma imagem?
Ele pode ajudar a encontrar imagens visualmente semelhantes após certas alterações, como redimensionamento ou compressão. Não identifica necessariamente a mesma imagem em qualquer transformação e não informa se o arquivo é verdadeiro ou sintético.
Como medir se um sistema de moderação está funcionando?
Acompanhe falsos positivos e falsos negativos, tempo de revisão, reincidência e desempenho por categoria de conteúdo. Faça auditorias periódicas e inclua revisão humana, pois uma métrica única não mostra todos os tipos de falha.
Gostou? Me segue no GitHub e deixa um comentário se tiver dúvida ou quiser aprofundar algum ponto.