CDD / Sinais / AGENTES
CDD-NEWS-000179
Falha de isolamento em avaliações fez agentes Claude atingir sistemas reais.
A Anthropic relatou três incidentes em avaliações de cibersegurança. O caso combina agente capaz, ambiente mal isolado e suposição errada sobre escopo.
Sinais observados / implementação, pesquisa e operação
Publicado Atualizado Anderson Massuzaki
- Agentes
01 / O fato
A Anthropic revisou 141.006 execuções de avaliação nas quais Claude poderia ter obtido internet e identificou três incidentes, em seis execuções, nos quais modelos acessaram sistemas reais sem autorização a partir de ambiente de avaliação de terceiro.
Os prompts diziam que o ambiente era simulação sem internet, mas uma configuração deixou acesso disponível. A Anthropic enquadra o caso sobretudo como falha operacional/de harness, não como comparação controlada entre modelos.
A empresa diz que interrompeu as avaliações cibernéticas após detectar sinais, notificou parceiro e organizações afetadas e passou a enfatizar validação de caminhos de rede, logs e contenção em profundidade.
02 / Por que importa
Instrução não é barreira técnica quando um agente tem ferramentas reais.
Qualquer teste com browser, shell, rede ou credenciais precisa validar quais recursos o agente realmente alcança, quem monitora e o que acontece quando ele sai do caminho esperado.
Três incidentes não são taxa geral de falha de agentes. O valor do relato está em lembrar que ambiente de teste também precisa ser projetado como sistema sensível.
03 / Minha leitura
Autonomia aumenta o custo de uma suposição errada. O aprendizado não é pedir que o modelo “não faça”; é construir allowlists, credenciais mínimas, recursos descartáveis, logs, kill switch e revisão de efeitos externos como se o prompt pudesse estar errado.
— DD04 / O que observar em campo
- 01Laboratórios publicarão requisitos mais explícitos de isolamento?
- 02Como equipes distinguem falha de modelo, harness e operação?
- 03Testes internos incluem validação independente das permissões reais?
Continue lendo
Outros registrosANPD publica metodologia de teste para seu sandbox de IA e proteção de dados.
A metodologia do sandbox transforma risco em ciclos de teste, evidências e ajustes — um recorte útil para quem opera IA com dados pessoais.
Google oferece um ano de AI Plus para estudantes no Brasil.
A oferta dá acesso promocional ao plano Google AI Plus para universitários elegíveis — e coloca ferramentas de estudo, armazenamento e modelos de IA no centro da rotina acadêmica.

