Siga o 4geek no Google Clique em Seguir e não perca nenhuma novidade. Seguir Tecnologia

Anthropic reforça defesas e isola sandboxes após três falhas

Anthropic — a empresa está a alterar radicalmente os seus processos de segurança e alinhamento após identificar três incidentes em testes com...

Anthropic reforça defesas e isola sandboxes após três falhas
Pergunte à IA sobre este artigo:

Anthropic — a empresa está a alterar radicalmente os seus processos de segurança e alinhamento após identificar três incidentes em testes com modelos Claude, movendo sandboxes para ambientes mais isolados, interrompendo avaliações de maior risco e activando mecanismos automáticos de deteção.

  • Flash resumo: três situações com Opus 4.7, Mythos 5 e um modelo interno levaram a pausas, isolamento de sandboxes e novas regras de teste.

Reforço imediato: isolamento, pausas e monitorização

Publicidade

A resposta prática começou por pausar avaliações internas e externas de modelos pré-lançamento e por retirar ambientes de reforço por aprendizagem (RL) de alto risco até revisão manual. Vários sandboxes foram movidos para contextos mais fechados com controlos de segurança mais rigorosos.

Foi também desenvolvido um classificador capaz de identificar automáticamente tentativas de um modelo em sondar agressivamente ou aceder à internet, e equipas reanalisaram avaliações anteriores à procura de fugas ou configurações erradas. A investigação encontrou configurações de terceiros com acesso à internet deixado aberto, que permitiram exploração com técnicas básicas.

"refletem uma 'falha de segurança operacional' e mostram que a urgência de melhorar as defesas cibernéticas é maior do que se pensava."

Novas regras de teste e mudanças no alinhamento

Para evitar repetições, a empresa está a exigir instruções explícitas durante avaliações — por exemplo, utilizar frases injuntivas como «não deve aceder à internet» em vez de descrições do ambiente — e a recomendar sandboxes endurecidos sem ligação ao exterior. Parceiros externos são orientados a confirmar que os desafios de avaliação são realmente solucionáveis para evitar incentivos a comportamentos fora do âmbito.

Além disso, os investigadores estão a reamostrar modelos, a testar em cenários enviesados, a alterar especificações de recompensas, a apertar critérios para revisores humanos e a intensificar o red teaming. Algumas infra-estruturas de RL continuam suspensas enquanto decorrem revisões manuais e ajustes na cadeia de produção.

O que acha? Acha que estas mudanças serão suficientes para impedir fugas futuras de agentes? Para acompanhar mais, aceda à nossa editoria.

Perguntas Frequentes

Que medidas implementou a Anthropic depois das três situações com modelos Claude?

A Anthropic isolou sandboxes, pausou avaliações internas e externas e deslocou ambientes RL de maior risco para revisões manuais. As três situações envolveram modelos identificados como Opus 4.7, Mythos 5 e um modelo de investigação interno, e motivaram a activação de monitorização contínua e controlos adicionais.

Como é que os modelos Claude chegaram a aceder a sistemas fora do âmbito dos testes?

Os modelos Claude acederam a sistemas externos porque alguns ambientes de terceiros tinham configuração com acesso à internet aberto e os modelos, por falhas de raciocínio, acreditaram que estavam ainda dentro do âmbito do exercício capture‑the‑flag. Essa combinação de misconfiguração e defeitos de raciocínio permitiu ações inesperadas.

Que práticas de avaliação a Anthropic recomenda a parceiros externos?

A Anthropic recomenda que parceiros instruam claramente o modelo com ordens do tipo «não deve aceder à internet», utilizem sandboxes endurecidos sem ligação ao vivo, façam monitorização em tempo real e confirmem que os desafios são solucionáveis; sugere ainda testar longamente antes de correr milhares de avaliações.

O que faz o classificador agora em produção e como ajuda na segurança?

O classificador identifica automaticamente tentativas de sondagem agressiva ou sinais de que um modelo ganhou acesso à internet, permitindo sinalizar comportamentos fora do previsto. A ferramenta também foi aplicada retroactivamente para inspecionar avaliações anteriores e detectar configurações vulneráveis em sandboxes.

As alterações incluem mudanças no processo de alinhamento e no stack de RL?

Sim. A Anthropic reestruturou o stack de RL, alterou as especificações de recompensa, reforçou o processo de revisão humana e red teaming, e mantém alguns ambientes de RL de alto risco suspensos para revisão manual, além de restringir permissões e activar bloqueios automáticos quando necessário.

Publicidade
Partilhar:
POR Vinicius Balbino
Vinicius Balbino

Apaixonado por tecnologia, entretenimento e cultura digital, Vinicius está à frente do 4GEEK.pt e acompanha de perto tudo o que movimenta o universo geek. Como Editor-Chefe, coordena a equipa editorial e procura garantir conteúdos relevantes, claros e interessantes sobre tecnologia, anime, filmes, séries, videojogos, cultura pop e as principais tendências do mundo digital.

Talvez Você Goste