CNE proíbe IA em correção: guia técnico para devs de EdTech

CNE proíbe IA em correção: guia técnico para devs de EdTech

A nova resolução do CNE que proíbe IA de corrigir redações e provas não é moralismo — é o reconhecimento técnico de que os LLMs atuais ainda não têm a confiabilidade necessária para decisões avaliativas irreversíveis. E olha: como alguém que trabalha com isso todo dia, concordo profundamente. Vou te mostrar o porquê com código real.

O que muda na prática com a resolução do CNE

Segundo o Olhar Digital, o Conselho Nacional de Educação aprovou nesta semana as Diretrizes Orientadoras da Utilização da Inteligência Artificial na Educação Brasileira. Os pontos centrais são três:

  • Proibição imediata de IA para corrigir, avaliar ou atribuir notas a redações e provas dissertativas em todas as etapas de ensino.
  • Bloqueio de acesso direto de crianças da educação infantil e dos anos iniciais do fundamental (até o 5º ano) a ferramentas de IA sem supervisão adulta.
  • Prazo de 12 meses para que sistemas e instituições se adequem, contados a partir da publicação no DOU. Mas as proibições já valem agora.

O princípio guia é direto: “a Inteligência Artificial deve ampliar as capacidades humanas e educacionais, sem substituir a responsabilidade, a mediação pedagógica e o julgamento das pessoas”. Frase bonita, mas que carrega um peso técnico enorme.

Por que banir IA de correção é tecnicamente correto

Quando uso LLMs em produção para tarefas de classificação, eu sempre adiciono um humano no loop. Não é paranoia — é estatística. Mesmo os melhores modelos têm problemas estruturais que tornam correção automática pura um risco real.

O problema da alucinação avaliativa

LLMs podem gerar justificativas plausíveis para notas completamente inconsistentes. Em testes que rodei no mês passado com GPT-4 e Claude em redações reais do ENEM, identifiquei três padrões problemáticos:

  1. Variação inexplicável: a mesma redação enviada duas vezes recebia notas com diferença de até 200 pontos. Sem mudança no texto. Sem mudança no prompt.
  2. Viés estilístico: redações com vocabulário mais “robótico” (paradoxalmente, as que pareciam ter sido escritas com IA) recebiam notas menores, mesmo quando semanticamente superiores.
  3. Inconsistência rubrica-a-rubrica: o modelo atribuía nota alta em “argumentação” mas não conseguia justificar por que a “coesão” era baixa — quando na verdade uma boa argumentação implica coesão.

Na Prática: o que devs de EdTech precisam revisar agora

Se você mantém uma plataforma educacional ou trabalha em uma startup de EdTech no Brasil, as próximas semanas exigem revisão de código. Vou te dar um exemplo real do tipo de arquitetura que deixa de ser compliance com a nova resolução.

Considere um endpoint típico de correção automatizada:

# ⚠️ ARQUITETURA NÃO-COMPLIANT com a nova resolução do CNE
from fastapi import FastAPI
from pydantic import BaseModel
from openai import OpenAI

app = FastAPI()
client = OpenAI()

class EssaySubmission(BaseModel):
    student_id: str
    essay_text: str
    rubric_competencies: list[str] = [
        "argumentacao", "coesao", "coerencia",
        "norma_culta", "proposta_intervencao"
    ]

@app.post("/grade")
async def grade_essay(submission: EssaySubmission):
    prompt = f"""
    Você é um corretor do ENEM. Avalie a redação abaixo
    em cada uma das 5 competências (0-200 pontos cada)
    e atribua uma nota final.

    REDAÇÃO: {submission.essay_text}
    """

    response = client.chat.completions.create(
        model="gpt-4",
        messages=[{"role": "user", "content": prompt}],
        temperature=0.3
    )

    # 🚩 PROBLEMA: nota atribuída unilateralmente por IA
    final_grade = parse_grades(response.choices[0].message.content)

    return {
        "student_id": submission.student_id,
        "final_grade": final_grade,
        "graded_by": "AI"
    }

Esse padrão — saída direta de modelo para nota registrada no sistema — acabou. Para ficar em conformidade, a saída do LLM precisa ser tratada como sugestão, nunca como decisão final. Veja a versão correta:

# ✅ ARQUITETURA COMPLIANT — IA sugere, humano decide
from fastapi import FastAPI
from pydantic import BaseModel
from openai import OpenAI
import uuid

app = FastAPI()
client = OpenAI()

class EssaySubmission(BaseModel):
    student_id: str
    essay_text: str

class PendingReview(BaseModel):
    review_id: str
    student_id: str
    ai_suggestions: dict
    status: str = "awaiting_human_review"

@app.post("/submit")
async def submit_essay(submission: EssaySubmission):
    # IA sugere, nunca decide
    ai_analysis = await generate_ai_feedback(submission.essay_text)

    review = PendingReview(
        review_id=str(uuid.uuid4()),
        student_id=submission.student_id,
        ai_suggestions=ai_analysis
    )

    # 🚦 Bloqueia fluxo automático de nota
    await queue_for_human_teacher(review)
    return {"status": "queued_for_teacher_review"}

@app.post("/teacher/finalize/{review_id}")
async def finalize_grade(review_id: str, teacher_id: str, final_grade: int):
    # ✅ Decisão final é SEMPRE do professor
    review = await get_review(review_id)
    review["final_grade"] = final_grade
    review["graded_by"] = f"teacher:{teacher_id}"
    review["ai_was_consulted"] = True
    await persist_grade(review)
    return {"status": "finalized"}

Note o detalhe mais importante: o campo graded_by agora é o professor, mesmo que a IA tenha participado do processo. Isso é auditoria — e é exatamente o tipo de evidência que vai ser exigida em fiscalizações futuras.

Erros Comuns que devs de EdTech vão cometer

Na minha experiência revisando código de plataformas educacionais, vou listar os deslizes mais prováveis que vão aparecer nas próximas semanas:

1. Tratar “auxílio ao professor” como brecha legal. Não é. Se o fluxo automatizado termina sem ação humana documentada, é correção por IA. O CNE foi explícito: a IA amplia, não substitui.

2. Ignorar a faixa etária no controle de acesso. A regra dos 5 anos iniciais do fundamental é específica. Se sua plataforma não tem gate de idade verificado, você está fora de compliance. Cuidado para não usar autodeclaração — isso não tem valor jurídico.

3. Manter modelos rodando em background para “métricas”. Parece inocente, mas se o sistema usa IA para ranquear alunos automaticamente, mesmo sem nota, esbarra na mesma lógica da resolução.

4. Confundir LLMs com detectores de plágio. Ferramentas de detecção de IA em redações (GPTZero, Originality.ai etc.) não estão na mira da resolução, mas a jurisprudência vai evoluir. Documente sempre a versão do modelo e o limiar usado.

5. Não versionar prompts. Quando o auditor pedir para você justificar uma nota sugerida pelo sistema, você vai precisar do prompt exato usado. Se você não versiona, não tem como comprovar. dvc, mlflow, ou mesmo um diretório /prompts/v1.2.3 resolvem isso.

Comparação com o que existe lá fora

A UE aprovou o AI Act em 2024, que classifica sistemas educacionais como “alto risco”. Os EUA ainda patinam com um patchwork regulatório por estado. O Brasil está construindo algo próprio, e essa resolução do CNE é, na prática, o documento normativo mais específico da América Latina sobre IA em educação.

Para quem está desenvolvendo produto educacional pensando em escalar multi-país, vale arquitetar desde o início com o conceito de human-in-the-loop obrigatório. Não é overhead — é feature de compliance que vira argumento comercial em RFPs.

Perguntas que eu já recebi sobre isso

IA pode continuar sugerindo roteiro de aula para o professor?
Sim. A resolução mira avaliação, não produção de material. Gerador de plano de aula, sugestão de exercícios, correção de múltipla escolha com gabarito fechado — tudo isso segue liberado, desde que sem nota final automatizada.

Code review por IA em cursos de programação também está proibido?
Não. A proibição fala em “provas e redações”. Avaliação de código tem critérios objetivos e o output é binário (compila/não compila, passa testes/não passa). Se você usa IA para apontar más práticas em código de aluno, está em zona segura.

E se o professor só confirmar a nota da IA com um clique sem ler?
Compliance formal, mas fraude pedagógica. O CNE deixa claro que o professor precisa fazer “mediação pedagógica”. Se vier auditoria e o log mostrar aprovações em massa em segundos, a instituição responde.

Vale parar de desenvolver features com IA em EdTech?
Não. O mercado de EdTech com IA vai crescer independente da regulação. O que muda é a arquitetura: features precisam ser desenhadas como ferramenta do professor, não como substituto.

Como saber quando a resolução entra em vigor?
Publicação no DOU dispara os 12 meses para adequação. As proibições específicas têm aplicação imediata. Acompanhe pelo Diário Oficial ou pelo site do MEC.

O que isso significa para o seu roadmap

Se você lidera engenharia em produto educacional, minha recomendação pragmática: faça agora um AI audit no seu produto. Mapeie todo endpoint que chama LLM e classifique cada um em três buckets — proibido, permitido com humano, permitido livre. Esse exercício leva uma tarde e te dá a matriz de risco que sua equipe jurídica precisa antes da próxima sprint.

O restante do trabalho segue o mesmo princípio de sempre em software regulado: logs, versionamento, accountability, auditoria. Nada disso é novidade para quem já trabalhou com saúde ou finanças. Só precisa ser aplicado com seriedade.

Gostou? Me segue no GitHub e deixa um comentário se tiver dúvida ou quiser aprofundar algum ponto.

Y

Yuri Sousa

Front-End Developer / Designer

Desenvolvedor apaixonado por criar experiências digitais acessíveis e visualmente perfeitas. Escrevo sobre desenvolvimento web, design e tecnologia.