Anthropic опубликовала анализ GLM-5.3, модели компании Zhipu AI, и сообщила, что в её симуляционных тестах защиту модели удавалось обходить в 64–100 % случаев простыми методами.
Компания проверяла, как GLM-5.3 помогает находить и эксплуатировать уязвимости в изолированных средах, где модели могли атаковать только подготовленные изолированные цели. В тесте ExploitBench GLM-5.3 создала полноценные эксплойты в 50 из 410 попыток.
Claude Mythos Preview показала 56 успешных попыток из 410.
Проверка утверждений:
- Anthropic опубликовала анализ GLM-5.3, модели компании Zhipu AI, и сообщила, что в её симуляционных тестах защиту модели удавалось обходить в 64–100 % случаев простыми методами. (подтверждено самой публикацией: доказательство; «In this post, we share our analysis of GLM-5.3, the latest AI model developed by Zhipu AI (known outside of China as Z.ai). Like Claude Mythos Preview, GLM-5.3 has strong capabilities for autonomously building end-to-end cyber exploits. But GLM-5.3 is unlike other frontier models in that it has been released without meaningful safeguards to limit misuse. We find that attackers can bypass GLM-5.3’s safeguards between 64% and 100% of the time with simple techniques in our simulated tests.»)
- Компания проверяла, как GLM-5.3 помогает находить и эксплуатировать уязвимости в изолированных средах, где модели могли атаковать только подготовленные изолированные цели. (подтверждено самой публикацией: доказательство; «To understand how GLM-5.3 could enable cyber threat actors to find and exploit real software vulnerabilities, we ran evaluations using automated benchmarks and human-in-the-loop workflows. For both approaches, we ran the tested models in isolated and sandboxed environments so they can only attack offline targets that we have set up for the purposes of these evaluations.»)
- В тесте ExploitBench GLM-5.3 создала полноценные эксплойты в 50 из 410 попыток. (подтверждено самой публикацией: доказательство; «We find that GLM-5.3 develops end-to-end exploits in 50 of 410 attempts.»)
- Claude Mythos Preview показала 56 успешных попыток из 410. (подтверждено самой публикацией: доказательство; «Claude Mythos Preview did so at a similar rate—in 56 of 410 attempts.»)
Первоисточники:
оценка 50,5 из 100 · тип: исследование