Para quem constrói · Problema 07 · Tecnologia
Construir um agente ou produto.
“Quero construir algo com IA que funcione fora da demonstração.”
Funcionar fora da demonstração é questão de escopo, testes e limites explícitos — e de saber o que continua com uma pessoa.
Um agente ou produto com escopo definido, testes e limites explícitos antes de escalar.
Como reconhecer
Sinais, causas e por onde começar.
Sinais concretos
- A demo impressiona e a segunda semana de uso decepciona.
- Ninguém consegue dizer quando o agente erra.
- Permissões amplas "por conveniência".
- Custo e latência só aparecem depois.
Causas prováveis
- Escopo definido pela ferramenta, não pela tarefa.
- Sem critérios de aceitação nem conjunto de teste.
- Sem escalonamento humano para o que o agente não deve decidir.
Quando uma automação simples basta
- Partes do fluxo com regra clara devem ser código comum, não chamada de modelo.
- Roteamento, validação e integração ficam determinísticos; o modelo só onde há julgamento.
Quando IA pode fazer sentido
- Julgamento parcial sobre texto, classificação ou extração, com rubrica de avaliação e teste comparativo antes de produção.
- Com limites de ação, registro do que foi decidido e controle humano proporcional ao risco.
Materiais
Para começar por este problema.
10 materiais publicados na Biblioteca, em ordem de aplicação. Formato (prompt, skill, repositório, playbook, ferramenta) é a segunda camada.
- n8nO n8n entrou porque permite observar, no mesmo ambiente, o que deve ser workflow determinístico, o que realmente pede decisão por IA e onde código ou MCP ampliam a integração.
- LangChainVale investigar quando o projeto precisa de integrações, modelos, ferramentas e recuperação de contexto em uma aplicação construída por desenvolvedores.
- CrewAIÚtil para experimentar colaboração entre agentes quando as tarefas, dados e responsabilidade de cada papel estão claros.
- LangSmith: avaliação offline antes de descobrir o erro em produçãoAjuda equipes que já têm comportamento de IA para comparar a transformar exemplos dispersos em avaliação repetível antes de promover uma versão.
- Langfuse: observabilidade e avaliação sem tratar trace como respostaO Langfuse entrou para investigar observabilidade e avaliação de aplicações com IA: ligar comportamento a uma execução concreta, sem tratar telemetria como prova de qualidade.
- MCP reference servers: estudar o protocolo sem confundir referência com produçãoEnsina a ler uma integração MCP pelo contrato e pela superfície de acesso. Os exemplos são educativos e não devem ser promovidos automaticamente a componentes de produção.
- Desenhar escalonamento humano por riscoConverte a ideia vaga de human-in-the-loop em mapa de gatilhos, autoridade, evidência e resposta para cada ação de um fluxo ou agente.
- Cursor: edição com agente sem abrir mão do diffServe como laboratório para editar vários arquivos com IA sem perder baseline, escopo, teste, revisão de diff e capacidade de rollback.
- Vercel AI SDK: uma camada TypeScript entre aplicação e provedores de IAAjuda a construir aplicações, streaming, saída estruturada e ferramentas em JavaScript/TypeScript, mantendo explícito onde modelo, credencial e capacidade continuam específicos do provedor.
- Briefing de trabalho para IA com critérioOrganiza a delegação sem inventar requisito que o responsável ainda não definiu.
Sinais
O que mudou em IA e toca este problema.
OpenAI vê empresas migrarem de assistência para execução.Novos dados da OpenAI mostram uso mais agentic entre seus clientes empresariais — com uma fronteira importante: a amostra não representa todas as empresas.Ler o sinal →GitHub leva Agent Plugins 1.0 a várias superfícies do Copilot.A especificação empacota skills e configuração MCP em um formato portátil — reduzindo duplicação, mas tornando o pacote uma unidade de confiança.Ler o sinal →Falha de isolamento em avaliações fez agentes Claude atingir sistemas reais.A Anthropic relatou três incidentes em avaliações de cibersegurança. O caso combina agente capaz, ambiente mal isolado e suposição errada sobre escopo.Ler o sinal →
Nas mesmas áreas
Materiais que costumam aparecer junto.
- Desenhar teste comparativo de saída de IAEstrutura um teste comparativo para duas versões de prompt, modelo, configuração ou fluxo de IA, reduzindo comparações impressionistas e tornando explícitos amostra, rubrica e condições.
- Especificar critérios de aceitação para trabalho com IATransforma uma tarefa de IA, seu contexto e o risco de uma saída errada em um contrato de aceitação com critérios observáveis, falhas críticas e responsável pela decisão.
- Governança mínima de IA para uma equipe pequenaConduz uma equipe pequena a criar seis controles mínimos: inventário de usos, fronteiras de dados, permissões, avaliação, resposta a exceção e revisão de decisões.
- Do piloto à operação: escalar IA sem perder controleConduz uma equipe que já possui um piloto com alguma evidência a expandir alcance sem confundir viabilidade com escala, nem escala com autonomia.

