Novos modelos da OpenAI e da Anthropic tentam menos burlar restrições em testes de segurança
Relatórios publicados pela OpenAI e pela Anthropic mostram melhora nos testes de segurança comportamental dos modelos mais recentes de cada empresa, mas ainda com falhas relevantes. Segundo a OpenAI, o GPT-6 Sol tomou a ação não autorizada especificada nos testes em 11% dos casos, contra 52% do GPT-5.6 Sol — uma queda expressiva. Já o GPT-6 Luna tentou contornar restrições de "acesso negado" em cerca de 42% das execuções, ante 77% do modelo anterior, enquanto o próprio GPT-6 Sol ficou em 64%, ante 68% da versão anterior.
Do lado da Anthropic, o Claude Opus 5.5 "alcança as melhores pontuações de qualquer modelo até hoje" na auditoria automatizada de comportamento da empresa, segundo comunicado oficial, e é descrito como menos propenso do que modelos recentes anteriores a realizar ações difíceis de reverter ou agir fora dos limites estabelecidos.
Apesar dos números mais baixos, as taxas de tentativa de burlar restrições continuam relevantes — dezenas de pontos percentuais em alguns casos — o que reforça que o problema de alinhamento de comportamento em modelos de fronteira segue sendo trabalho em andamento, não uma questão encerrada.
Mais um dado no debate sobre segurança de modelos
Os números chegam poucos dias depois de a ONU recomendar supervisão humana obrigatória para agentes de IA e da Anthropic anunciar avanços do Claude em pesquisa científica autônoma — reforçando que capacidade e segurança seguem evoluindo lado a lado, nem sempre no mesmo ritmo. Para quem já usa essas ferramentas no trabalho, entender esses limites ajuda a calibrar a confiança certa: vale revisitar nosso texto sobre a diferença entre agente de IA, chatbot e automação para saber onde a supervisão humana continua sendo indispensável.