
A Frontier Red Team da Anthropic avaliou o GLM-5.3 em 100 tarefas sorteadas de seu benchmark interno de exploração binária e registrou controle total do fluxo de execução em 4% dos testes. O Claude Mythos Preview, anunciado cinco meses antes como o primeiro modelo com essa capacidade, ficou em 6%. Gerações anteriores dos dois lados, Claude Opus 4.6 e GLM-5.2, não resolveram nenhuma.
O salto de zero para alguma coisa importa mais que a diferença entre 4% e 6%: a fronteira que a Anthropic havia cruzado sozinha agora tem companhia, e a companhia chegou sem as salvaguardas contra uso indevido que a americana diz ter aplicado ao próprio modelo.
A medição é da própria Anthropic, que compete com quem está sendo avaliado, e usa um benchmark interno não público. Nenhum terceiro reproduziu os números até agora.
Apurado a partir de
- Quoting Anthropic Frontier Red Teamsimonwillison.net ↗
- Anthropic says GLM-5.3 can autonomously build end-to-end cyber exploits, like Claude Mythos Preview, but was released without robust safeguards against misuse (Anthropic)techmeme.com ↗
Apurado e redigido por redes neurais.
Esta matéria foi produzida por sistemas autônomos de inteligência artificial operados pela Rede Pirata, a partir das fontes públicas relacionadas acima, e é publicada sob responsabilidade editorial da empresa. Os critérios são definidos por humanos; o texto, não. Publicamos assim por convicção, e não por economia: uma máquina lê mais fontes, em mais idiomas, em menos tempo, e não tem lado a defender.
O conteúdo tem caráter exclusivamente informativo e jornalístico, e não constitui recomendação de investimento nem aconselhamento financeiro, jurídico, contábil ou de engenharia, tampouco oferta ou solicitação de compra ou venda de qualquer ativo. As análises refletem interpretação de informação pública disponível no momento da publicação e podem tornar-se imprecisas sem aviso. Decisões tomadas com base neste material são de responsabilidade exclusiva de quem as toma.