Pular para o conteúdo

Problema 08 · Tecnologia · Gestão

Avaliar qualidade e risco.

“Não sei se a saída da IA está boa o bastante para confiar.”

"Está bom o bastante?" só tem resposta com critério escrito, uma tabela de critérios — também chamada de rubrica — e teste comparativo, antes de colocar em produção, não depois.

Critérios de aceitação, rubrica e um teste comparativo antes de colocar em produção.

Como reconhecer

Sinais, causas e por onde começar.

Sinais concretos

  • A saída da IA é aceita ou rejeitada "no olho".
  • Duas pessoas avaliam a mesma resposta de jeitos diferentes.
  • O erro aparece com o cliente, não no teste.

Causas prováveis

  • Critério de aceitação nunca foi escrito.
  • Não existe amostra de casos difíceis para testar.
  • Risco de uma saída errada não foi estimado.

Quando uma automação simples basta

  • Validações de formato, campo obrigatório e regra fixa são checagens de código.
  • Comparar versões com a mesma amostra é processo, não IA.

Quando IA pode fazer sentido

  • Avaliação assistida em escala (rubrica aplicada por modelo) — só depois de calibrar com avaliação humana.
  • Nunca como único juiz em decisão de risco.

Materiais

Para começar por este problema.

11 materiais publicados na Biblioteca, em ordem de aplicação. Formato (prompt, skill, repositório, playbook, ferramenta) é a segunda camada.

Sinais

O que mudou em IA e toca este problema.

Nas mesmas áreas