Pular para o conteúdo

PROMPT / DESENHO DE TESTE / CDD-CONTENT-000160 / 2026-08-22

Desenhar teste comparativo de saída de IA

Monte uma comparação controlada entre duas configurações usando a mesma amostra, rubrica, repetições e registro de falhas.

10 MIN · INTERMEDIÁRIO

O QUE ESTE PROMPT FAZ

01 / ANTES DA CÓPIA

Estrutura um teste comparativo para duas versões de prompt, modelo, configuração ou fluxo de IA, reduzindo comparações impressionistas e tornando explícitos amostra, rubrica e condições.

USE QUANDO
  • Já existem duas configurações concretas e uma pergunta comparável.
  • A equipe quer saber qual opção se comporta melhor em um conjunto delimitado de casos.
  • A decisão precisa sair de exemplos soltos para critérios e evidências explícitos.
VOCÊ RECEBE
  • Pergunta de comparação
  • Variáveis controladas e fatores de confusão
  • Rubrica e registro de falhas
  • Regra de decisão que admite inconclusivo
NÃO SERVE PARA
  • Comparação de marketing baseada em um exemplo.
  • Substituir avaliação estatística especializada quando a decisão exige inferência formal ou envolve alto risco.
  • Forçar um vencedor quando a evidência permanece inconclusiva.

O QUE PREPARAR ANTES

LACUNA NÃO É DADO
  • Configuração A e B descritas com precisão.
  • Amostra de casos autorizados.
  • Critérios de qualidade definidos antes de olhar o resultado.
  • Restrições de custo, latência ou segurança relevantes.

PROMPT PARA COPIAR

Desenhe um teste comparativo entre duas configurações de IA sem executar o teste.

CONFIGURAÇÃO A
{config_a}

CONFIGURAÇÃO B
{config_b}

TAREFA
{tarefa}

AMOSTRA DISPONÍVEL
{amostra}

CRITÉRIOS DE QUALIDADE
{criterios}

RESTRIÇÕES
{restricoes}

Entregue:
1. Pergunta de comparação.
2. Variáveis que devem permanecer iguais entre A e B.
3. Fatores que podem confundir a comparação.
4. Forma de selecionar e congelar a amostra.
5. Rubrica por critério, com exemplos de aprovado/reprovado quando houver evidência.
6. Justificativa para repetições; não invente um número ideal.
7. Ordem e randomização sugeridas quando aplicável.
8. Registro de falhas e casos ambíguos.
9. Medidas operacionais relevantes e mensuráveis.
10. Regra de decisão que preserve “inconclusivo” como resultado possível.
11. Plano de revisão humana para divergências.

Não declare vencedor. Não crie taxa de sucesso hipotética.
VARIÁVEIS DE CONTEXTOCONFIG ACONFIG BTAREFAAMOSTRACRITERIOSRESTRICOES

CENÁRIO ILUSTRATIVO

Hipotético: duas versões de instrução produzem resumos diferentes.

Em vez de escolher pela saída mais bonita, a equipe congela a mesma amostra, avalia por rubrica e registra divergências.

O cenário mostra o instrumento; não representa cliente, resultado real ou teste conduzido pelo Café com DD.

COMO RECONHECER UMA BOA SAÍDA

  • Muda uma coisa por vez sempre que possível.
  • Define a amostra antes dos resultados.
  • Permite reprovar uma saída fluente, mas incorreta.
  • Mantém “inconclusivo” disponível quando a evidência não separa as opções.
LLMs podem variar entre execuções e avaliadores automáticos também podem errar. Use este instrumento para estruturar comparação, não para substituir julgamento, amostra representativa ou revisão humana.

FONTES E CONTINUIDADE

Use, observe e volte ao contexto.

01AI RMF Playbook — Measure / NIST02LangSmith Evaluation / LangSmith03Diagnóstico de automação antes da ferramenta04Mapa de oportunidades com IA