Pular para o conteúdo

CDD / Sinais / REGULAÇÃO

CDD-NEWS-000187

Anthropic defende testes por capacidade em vez de proibição geral de open weights.

Em texto de seu CEO, a empresa afirma não defender uma proibição por categoria e propõe testes obrigatórios para modelos suficientemente capazes, abertos ou fechados.

Sinais observados / implementação, pesquisa e operação

Publicado Atualizado Anderson Massuzaki

  • Governança
Pessoa escrevendo em um caderno em uma mesa de trabalho
Registro visual / contexto de trabalho Arquivo Café com DD

01 / O fato

Em 27 de julho de 2026, Dario Amodei publicou a posição da Anthropic sobre modelos open weights. O texto afirma que a empresa não defende uma proibição de modelos open weights como categoria.

A posição sustenta que modelos abertos sem capacidades perigosas podem ser um bem público, e que modelos suficientemente capazes — abertos ou fechados — deveriam passar por testes obrigatórios de segurança antes de sua liberação.

O texto argumenta que, após a publicação de pesos, mecanismos de retirada, monitoramento e alguns controles centralizados deixam de estar disponíveis. Essa é uma argumentação da Anthropic, apoiada no próprio post por referências externas; não é uma medição conduzida pelo Café com DD.

02 / Por que importa

Forma de distribuição não substitui teste de capacidade e contexto.

Para equipes que avaliam modelos locais ou open weights, controle de infraestrutura pode ser uma vantagem operacional, mas também transfere responsabilidade por acesso, atualização, avaliação e resposta a abuso.

A posição ajuda a separar dimensões que costumam ser confundidas: pesos, código, dados, licença e possibilidade de modificar salvaguardas não são a mesma coisa.

03 / Minha leitura

O texto vale menos como recomendação de fornecedor e mais como lembrete metodológico: não usar categoria de distribuição como substituto de teste. Um modelo pequeno para classificação interna e um modelo de fronteira capaz de executar ferramentas não têm o mesmo perfil de risco apenas porque ambos permitem download. A decisão deveria começar pelo que o sistema pode fazer no contexto real e pelos controles que permanecem disponíveis depois da implantação.

— DD

04 / O que observar em campo

  1. 01Que benchmarks e thresholds passam a orientar políticas públicas para definir capacidade relevante?
  2. 02Como licenças e termos de uso diferem quando os pesos são baixáveis?
  3. 03Que controles locais equipes realmente implementam ao deixar de depender das salvaguardas do fornecedor?

Continue lendo

Outros registros

Rastro desta matéria