Problema 08 · Tecnologia · Gestão
Avaliar qualidade e risco.
“Não sei se a saída da IA está boa o bastante para confiar.”
"Está bom o bastante?" só tem resposta com critério escrito, uma tabela de critérios — também chamada de rubrica — e teste comparativo, antes de colocar em produção, não depois.
Critérios de aceitação, rubrica e um teste comparativo antes de colocar em produção.
Como reconhecer
Sinais, causas e por onde começar.
Sinais concretos
- A saída da IA é aceita ou rejeitada "no olho".
- Duas pessoas avaliam a mesma resposta de jeitos diferentes.
- O erro aparece com o cliente, não no teste.
Causas prováveis
- Critério de aceitação nunca foi escrito.
- Não existe amostra de casos difíceis para testar.
- Risco de uma saída errada não foi estimado.
Quando uma automação simples basta
- Validações de formato, campo obrigatório e regra fixa são checagens de código.
- Comparar versões com a mesma amostra é processo, não IA.
Quando IA pode fazer sentido
- Avaliação assistida em escala (rubrica aplicada por modelo) — só depois de calibrar com avaliação humana.
- Nunca como único juiz em decisão de risco.
Materiais
Para começar por este problema.
11 materiais publicados na Biblioteca, em ordem de aplicação. Formato (prompt, skill, repositório, playbook, ferramenta) é a segunda camada.
- Briefing de projeto com IATransforma uma demanda solta em briefing com objetivo, contexto, restrições e critério de saída.
- Revisão editorialCria uma sequência de revisão de estrutura, clareza, prova e tom antes da publicação.
- Desenhar teste comparativo de saída de IAEstrutura um teste comparativo para duas versões de prompt, modelo, configuração ou fluxo de IA, reduzindo comparações impressionistas e tornando explícitos amostra, rubrica e condições.
- LangSmith: avaliação offline antes de descobrir o erro em produçãoAjuda equipes que já têm comportamento de IA para comparar a transformar exemplos dispersos em avaliação repetível antes de promover uma versão.
- Langfuse: observabilidade e avaliação sem tratar trace como respostaO Langfuse entrou para investigar observabilidade e avaliação de aplicações com IA: ligar comportamento a uma execução concreta, sem tratar telemetria como prova de qualidade.
- Especificar critérios de aceitação para trabalho com IATransforma uma tarefa de IA, seu contexto e o risco de uma saída errada em um contrato de aceitação com critérios observáveis, falhas críticas e responsável pela decisão.
- Briefing de trabalho para IA com critérioOrganiza a delegação sem inventar requisito que o responsável ainda não definiu.
- Transformar uma ideia de IA em hipótese testávelTransforma entusiasmo de solução em teste reversível que pode falhar sem virar projeto permanente.
- Checar uma afirmação antes de publicarAjuda a reduzir conclusões com aparência de fato quando uma fonte só sustenta parte da frase.
- Comparar fontes sem achatar divergênciasPreserva escopo, método, data e interesse de cada fonte antes de elaborar uma leitura.
- Construir uma rubrica antes de avaliar uma saída de IAReduz a tendência de criar uma justificativa de qualidade depois de conhecer a saída do modelo.
Sinais
O que mudou em IA e toca este problema.
Falha de isolamento em avaliações fez agentes Claude atingir sistemas reais.A Anthropic relatou três incidentes em avaliações de cibersegurança. O caso combina agente capaz, ambiente mal isolado e suposição errada sobre escopo.Ler o sinal →Anthropic defende testes por capacidade em vez de proibição geral de open weights.Em texto de seu CEO, a empresa afirma não defender uma proibição por categoria e propõe testes obrigatórios para modelos suficientemente capazes, abertos ou fechados.Ler o sinal →Claude Opus 5 chega com controle de effort e betas para configuração agentic.A Anthropic lançou o modelo com ajuste de effort e atualizações de plataforma. Para uso aplicado, o ponto é avaliar a configuração completa, não só o nome do modelo.Ler o sinal →
Nas mesmas áreas
Materiais que costumam aparecer junto.
- Diagnóstico de automação antes da ferramentaTransforma uma vontade vaga — “precisamos automatizar isso” — em uma descrição verificável do trabalho e uma matriz de prioridade comparável.
- Mapa de oportunidades com IAOrganiza oportunidades de IA por esforço, impacto e necessidade de revisão humana.
- PerplexityAjuda a abrir uma investigação e localizar fontes para leitura, não substitui a verificação da fonte primária.
- Notion AIAjuda a trabalhar sobre documentos e notas já existentes quando a base de conhecimento está organizada.

