Nível 3 — Automação e escala · Módulo 3.6 — Engenharia de prompt e avaliação
3.6.2 · Por que avaliar
4 min de vídeoTODOS
Objetivo: ao final, o consultor sabe por que julgar um prompt por uma amostra é indistinguível de adivinhar, e reconhece em quais situações da Wayon a avaliação deixa de ser opcional.
O que você precisa levar desta aula
Julgar prompt por uma amostra é indistinguível de adivinhar. Dois prompts com 28 pontos de diferença podem produzir a mesma saída no primeiro caso testado — e produzem, com frequência.
A avaliação entrega mais que uma nota: ela diz onde o erro se concentra. Erro agrupado numa categoria é conserto de prompt; erro espalhado costuma ser problema de tarefa mal definida ou de dataset.
Avaliar não é obrigatório sempre. Vira obrigatório quando o prompt roda em volume, entra em produto do cliente ou vira automação desassistida — a mesma régua de proporcionalidade da aula 3.4.1, aplicada antes em vez de depois.
Por que a intuição falha aqui
O problema não é falta de atenção. É estatístico, e tem três causas que se somam:
Causa
O que acontece
Amostra pequena
Com um caso, dois prompts de 61% e 89% concordam em mais da metade das vezes
Viés de escolha do caso
Você testa com o caso que tinha à mão — quase sempre um caso típico, nunca um de borda
Fluência ≠ correção
É a mesma armadilha da aula 3.4.2: o Claude escreve bem, e texto bem escrito parece certo
Você conhece a resposta
Sabendo o rótulo correto, você lê a saída procurando confirmação, não erro
A quarta linha é a mais traiçoeira em contexto de consultoria: quem escreve o prompt de triagem é quem conhece o AMS. Essa pessoa lê a saída e reconstrói mentalmente o raciocínio que faria a saída estar certa.
Quando avaliar, e quando não
Situação
Avaliar?
Prompt de uso próprio, em sessão que você acompanha
Não. Você é a verificação
Skill do módulo 2.4 usada pela squad no dia a dia
Leve — alguns casos de borda bastam
Prompt que roda em volume (centenas de itens)
Sim
Prompt dentro de produto entregue ao cliente
Sim, e o resultado vai junto da entrega
Prompt dentro de automação desassistida (módulo 3.5)
Sim — não há humano no caminho
Prompt que decide algo com consequência (alçada, valor, aprovação)
Sim, independentemente do volume
O que uma avaliação entrega além da nota
Uma avaliação bem montada produz quatro coisas, e só a primeira é a nota:
O número agregado — serve para comparar duas versões
A distribuição do erro por categoria — serve para saber o que consertar
A lista dos casos que falharam — serve para entender por que
Um piso que não pode regredir — serve para a próxima alteração não quebrar o que já funcionava
O item 4 é o que transforma avaliação em ativo: depois de montada, ela vira teste de regressão do prompt. É o equivalente, para prompt, do stop hook de teste da aula 3.4.3.
Regra Wayon
Nenhuma automação com Claude é proposta a cliente com uma taxa de acerto afirmada sem medição. Se a proposta diz "classifica corretamente a maioria dos chamados", ou existe uma avaliação por trás desse número, ou a frase sai da proposta. Estimativa sem medição vira compromisso contratual do mesmo jeito.
1.Dois prompts foram testados num chamado e produziram a mesma saída. O que se pode concluir?
a)Que são equivalentes para essa tarefa, e a escolha pode ser pelo mais legível
Um caso concordante é compatível com uma diferença enorme no agregado — foi o que a aula mostrou com 61% e 89%.
b)Que o caso testado é fácil demais e deve ser descartado do dataset
Caso fácil tem lugar no dataset; o problema é a conclusão tirada de um caso só, não o caso.
c)Praticamente nada — dois prompts com 28 pontos de diferença concordam com frequência num caso isolado
Correto. É o motivo de a aula existir.
Ver resposta e por quê
❌a) Um caso concordante é compatível com uma diferença enorme no agregado — foi o que a aula mostrou com 61% e 89%.
❌b) Caso fácil tem lugar no dataset; o problema é a conclusão tirada de um caso só, não o caso.
✅c) Correto. É o motivo de a aula existir.
2.Em qual destas situações a avaliação formal do prompt não é exigida pela Regra Wayon?
a)Um consultor escreve um prompt para reorganizar suas próprias anotações numa sessão que ele acompanha
Correto. Supervisão direta é a própria verificação — mesma proporcionalidade da aula 3.4.1.
b)Um prompt que classifica os chamados de AMS do mês inteiro numa rodada
Roda em volume: entra nas três situações que tornam a medição obrigatória.
c)Um prompt embutido num relatório automático entregue mensalmente ao Meridiano
Produto entregue ao cliente e desassistido — dois dos três gatilhos ao mesmo tempo.
Ver resposta e por quê
✅a) Correto. Supervisão direta é a própria verificação — mesma proporcionalidade da aula 3.4.1.
❌b) Roda em volume: entra nas três situações que tornam a medição obrigatória.
❌c) Produto entregue ao cliente e desassistido — dois dos três gatilhos ao mesmo tempo.
3.A avaliação mostra que o prompt acerta 74% e que quase todo o erro está em chamados que misturam duas áreas. Qual é o valor específico dessa segunda informação? ---
a)Confirma que 74% é um bom resultado, já que o erro está concentrado
Concentração não qualifica o número; ela indica onde agir, não se o patamar é aceitável.
b)Permite remover esses casos do dataset para o número subir
Removê-los mede um problema mais fácil que o real — é como apagar o teste que falha.
c)Transforma a nota em instrução de conserto: o próximo ajuste do prompt tem alvo definido
Correto. Erro agrupado numa categoria aponta o que mudar; erro espalhado indicaria outro tipo de problema.
Ver resposta e por quê
❌a) Concentração não qualifica o número; ela indica onde agir, não se o patamar é aceitável.
❌b) Removê-los mede um problema mais fácil que o real — é como apagar o teste que falha.
✅c) Correto. Erro agrupado numa categoria aponta o que mudar; erro espalhado indicaria outro tipo de problema.