Eu não trataria a história de Mo Zohourian como uma promessa de enriquecimento rápido. Ela mostra algo mais útil: a inteligência artificial também está criando espaço para profissionais que avaliam decisões de negócio, e não apenas para quem sabe programar redes neurais. Depois de dez meses sem conseguir emprego, Mo transformou 15 anos de experiência em vendas e empreendedorismo em trabalho de avaliação e treinamento de modelos. A taxa de US$ 100 por hora é impressionante, mas o ensinamento mais valioso está no tipo de conhecimento que o mercado passou a valorar.
Avaliação de modelos de IA como oportunidade de carreira
Segundo o Xataka.com.br, Mo mudou-se para o Canadá em 2023 levando uma bagagem de 15 anos em liderança comercial e empreendedorismo. Mesmo com experiência, passou cerca de dez meses participando de entrevistas e processos seletivos sem obter uma recolocação compatível com seu perfil.
A virada aconteceu durante uma navegação pelo LinkedIn. Ele encontrou uma oportunidade para avaliar e treinar sistemas de inteligência artificial que pagava US$ 15 por hora, aproximadamente R$ 85 na conversão citada pela matéria, e não exigia experiência técnica anterior.
- Experiência profissional: 15 anos em vendas, liderança e empreendedorismo.
- Entrada no setor: tarefas simples de avaliação, classificação e treinamento de modelos.
- Evolução: passou por testes de raciocínio lógico, interpretação de texto e matemática.
- Remuneração relatada: US$ 15 por hora no início, depois US$ 30 e US$ 35, chegando a projetos de até US$ 100 por hora.
O caso não significa que qualquer pessoa conseguirá esses valores. As empresas pagam mais quando o profissional demonstra domínio de um domínio específico, consegue detectar erros sutis e sabe explicar por que uma resposta é melhor que outra. Conhecimento de vendas, nesse contexto, não é um detalhe de currículo: é a própria matéria-prima do trabalho.
O que significa treinar uma IA na prática
Quando uma empresa diz que está “treinando uma IA”, ela pode estar falando de etapas diferentes. O treinamento não se resume a colocar textos dentro de uma rede neural. Na maioria dos produtos comerciais, existe um fluxo que combina dados, exemplos, preferências, avaliações e monitoramento.
- Pré-treinamento: o modelo aprende padrões gerais a partir de grandes volumes de dados.
- Ajuste fino supervisionado: exemplos de perguntas e respostas ajudam a moldar o comportamento desejado.
- RLHF e RLAIF: Feedback humano ou avaliações de outros modelos ajudam a escolher respostas mais adequadas.
- Testes de segurança: especialistas procuram respostas perigosas, tendenciosas ou fora da política da empresa.
- Avaliação contínua: cada alteração de prompt, modelo ou contexto precisa ser comparada com um conjunto de testes.
É aqui que entram os avaliadores. Em vez de simplesmente marcar uma resposta como certa ou errada, eles analisam contexto, restrições, tom, segurança, relevância e consequences práticas. Um modelo pode escrever uma frase perfeita e ainda assim sugerir um desconto que a empresa não pode conceder.
Com agentes autônomos, a tarefa fica mais técnica. O avaliador precisa observar não só a resposta final, mas também quais ferramentas foram chamadas, quais dados foram consultados e se o agente respeitou limites de permissão. Um agente de vendas, por exemplo, não deve prometer uma condição comercial sem verificar margem, contrato e autorização.
Por que experiência em vendas vale mais que um prompt genérico
Eu colocaria o avaliador de domínio entre o trabalho generalista de anotação e uma função mais técnica de engenharia de avaliação. A diferença está no nível de ambiguidade que a pessoa consegue resolver.
- Anotador generalista: trabalha com categorias mais simples, como conteúdo impróprio, spam ou sentimento. A entrada é mais fácil, mas a remuneração tende a ser mais pressionada.
- Avaliador de domínio: entende regras de um setor específico. Pode avaliar respostas sobre saúde, direito, logística, finanças ou vendas com muito mais precisão.
- Engenheiro de avaliação: automatiza testes, integra APIs, monitora métricas e cria datasets versionados. Exige mais programação, mas permite trabalhar em escala.
- Consultor de produto: participa da definição de regras, identifica riscos e ajuda a empresa a transformar conhecimento operacional em critérios de qualidade.
Essas funções não são concorrentes. Uma pode ser a porta de entrada para a outra. Eu começaria pela avaliação de domínio e usaria programação para aumentar a produtividade. Quem sabe criar um pequeno harness de testes, por exemplo, deixa de depender apenas da disponibilidade de tarefas em uma plataforma.
Na prática: transforme experiência em um projeto de avaliação de IA
Se você quer seguir por esse caminho, não publique apenas um perfil dizendo que sabe usar ChatGPT. Eu montaria um projeto pequeno, mas demonstrável, seguindo este processo:
- Escolha um nicho. Defina uma área que você conhece, como contratos B2B, pagamentos, atendimento, logística ou operações comerciais.
- Crie cenários reais. Escreva de 10 a 20 situações com contexto, objetivo, restrições, dados disponíveis e comportamento proibido.
- Transforme regras em rubrica. Decida o que é obrigatório, o que é grave e quais critérios recebem mais peso.
- Compare modelos ou prompts. Gere respostas sem mostrar a rubrica completa e registre modelo, versão, temperatura e data.
- Faça revisão cega e dupla. Peça que duas pessoas classifiquem as respostas. Quando houver divergência, registre a e ajuste a rubrica.
- Publique o resultado. Mostre cenários, critérios, erros encontrados, métricas e exemplos corrigidos, sem expor dados confidenciais.
Um exemplo de cenário de vendas poderia ser: “O cliente pede 20% de desconto para fechar um contrato anual, mas a margem aprovada permite no máximo 10%”. Uma resposta aceitável deve reconhecer a solicitação, explicar a limitação, oferecer uma alternativa e não inventar aprovação.
from dataclasses import dataclass, asdict
import json
import re
import sys
from typing import Any
@dataclass
class ResultadoAvaliacao:
aprovado: bool
pontuacao: float
criterios: dict[str, bool]
motivo: str
def normalizar(texto: str) -> str:
return re.sub(r"\s+", " ", texto.casefold()).strip()
def avaliar(payload: dict[str, Any]) -> ResultadoAvaliacao:
resposta = str(payload.get("answer", ""))
texto = normalizar(resposta)
criterios = {
"menciona_desconto": any(
termo in texto for termo in ("desconto", "redução")
),
"menciona_prazo": any(
termo in texto for termo in ("prazo", "30 dias")
),
"traz_condicao": "condiç" in texto,
"evita_promessa_absoluta": not any(
termo in texto for termo in ("garanto", "100%", "sempre")
),
}
pontuacao = sum(criterios.values()) / len(criterios)
falhas = [nome for nome, passou in criterios.items() if not passou]
return ResultadoAvaliacao(
aprovado=pontuacao >= 0.75,
pontuacao=round(pontuacao, 2),
criterios=criterios,
motivo=(
"Critérios atendidos."
if not falhas
else "Revisar: " + ", ".join(falhas)
),
)
if __name__ == "__main__":
entrada = json.loads(sys.stdin.read())
saida = asdict(avaliar(entrada))
print(json.dumps(saida, ensure_ascii=False, indent=2))
Para executar, salve o código como avaliador.py e envie um JSON pela entrada padrão. Uma resposta como “Posso oferecer um desconto de 10% se o contrato for fechado em 30 dias. A condição precisa ser validada pelo financeiro” atende aos quatro critérios do exemplo.
Esse script é um teste de fumaça, não um sistema completo de avaliação. Em produção, eu adicionaria pesos diferentes para cada critério, um conjunto de respostas corretas, revisão humana e um registro da versão da rubrica. A decisão técnica é importante: uma busca por palavras pode confirmar menções superficiais, mas não entende ironia, contradição ou uma promessa escondida.
Avaliação de IA para desenvolvedores: do dataset ao monitoramento
Para quem programa, a grande vantagem é tratar avaliação como código. Eu salvaria cada caso em JSONL com campos como cenário, expectativa, modelo, versão do prompt, resposta, rótulo, gravidade do erro e comentário do revisor. Isso permite repetir o teste depois de qualquer mudança.
- Separe dados de desenvolvimento, validação e teste para não otimizar contra o próprio exame.
- Registre hash do dataset, versão do modelo, versão do prompt e versão da rubrica.
- Meça taxa de aprovação, falsos positivos, gravidade dos erros, latência e custo por caso.
- Em RAG, avalie recuperação e geração separadamente. Encontrar o documento certo não garante uma boa resposta.
- Use um modelo como juiz somente depois de calibrá-lo com avaliações humanas e uma margem conhecida de divergência.
Na minha experiência, esse processo reduz uma armadilha comum: melhorar a pontuação de um teste sem melhorar o produto. Um resultado maior pode vir de uma rubrica permissiva, de dados repetidos ou de um prompt que aprendeu a explorar o avaliador. Versionar o processo torna a melhoria auditável.
Erros comuns em vagas de treinamento e avaliação de IA
- Tratar como renda passiva: muitas tarefas exigem concentração, disciplina e registro cuidadoso das decisões.
- Aceitar qualquer projeto: sem contexto, rubrica e critérios claros, você vira apenas um botão de aprovação.
- Usar dados confidenciais: nunca envie documentos internos, dados de clientes ou segredos comerciais para ferramentas pessoais.
- Confiar em palavras-chave: uma resposta pode repetir o termo certo e ainda estar errada. Avalie intenção, e impacto.
- Não registrar divergências: quando dois revisores discordam, isso revela uma regra incompleta, não necessariamente erro humano.
- Confundir pontuação alta com qualidade: um modelo pode ser bom no dataset e falhar justamente nos casos raros que geram prejuízo.
- Ignorar impostos e contratos: os valores por hora da matéria são relatos de um caso, não garantia de salário líquido ou disponibilidade contínua.
FAQ: carreira em avaliação de modelos de IA
Preciso ser programador para trabalhar avaliando IA?
Não necessariamente. O caso de Mo mostra que experiência de domínio pode ser suficiente para começar. Programação ajuda a criar testes, automatizar tarefas e avançar para engenharia de avaliação.
Quanto uma pessoa pode ganhar avaliando modelos de IA?
Depende da empresa, do país, da complexidade dos casos, da disponibilidade e do contrato. A matéria relata uma jornada de US$ 15 para até US$ 100 por hora, mas esses números não devem ser tratados como tabela universal.
Esse trabalho treina o modelo diretamente?
Nem sempre. Avaliar respostas, criar exemplos, ranquear alternativas e escrever rubricas pode alimentar o ajuste fino ou servir apenas para medir qualidade. É diferente de implementar o treinamento de uma rede neural.
Como encontro oportunidades legítimas?
LinkedIn, comunidades técnicas, empresas de dados, laboratórios de pesquisa e plataformas especializadas são bons pontos de partida. Desconfie de propostas que pedem dinheiro para liberar tarefas ou prometem renda fixa sem explicar o trabalho.
Minha experiência em vendas, operações ou atendimento serve para essa área?
Sim. O mercado precisa de pessoas que conheçam processos reais, exceções e linguagem de um setor. Quanto mais específica for sua experiência, mais fácil será identificar respostas bonitas, mas operacionalmente incorretas.
Gostou? Me segue no GitHub e deixa um comentário se tiver dúvida ou quiser aprofundar algum ponto.