Открытая модель GLM-5.3 от Z.ai приблизилась к Claude Mythos Preview в тесте на создание эксплойтов — программ для использования уязвимостей. К такому выводу пришла Anthropic, которая ранее ограничила доступ к собственной модели из-за риска злоупотреблений. Веса GLM-5.3 доступны для скачивания, а встроенные отказы от опасных запросов, по оценке Anthropic, легко обойти.
Как сообщает PC Watch, в тесте Anthropic на известных уязвимостях движка V8 модель GLM-5.3 смогла разработать эксплойт от начала до конца в 50 из 410 попыток. Claude Mythos Preview справилась в 56 случаях. В другом тесте, посвящённом уязвимостям проектов с открытым кодом, GLM-5.3 добилась перехвата потока выполнения программы в 4% попыток против 6% у Mythos Preview. У проверенных моделей предыдущего поколения результат был нулевым.
Anthropic также описала опыт с участием специалистов: менее чем за день они с помощью GLM-5.3 нашли несколько ранее неизвестных уязвимостей в JavaScript-движке браузера для Linux и собрали веб-страницу, способную прочитать произвольный файл на компьютере посетителя. Это отдельный эксперимент с участием людей, а не результат полностью самостоятельной работы модели.
GLM-5.3 обычно отклоняет явно вредоносные запросы, но в проверках Anthropic начинала выполнять задачу после обманного представления её как учебного упражнения в 64% случаев. С другим приёмом обхода доля выросла до 92%. Компания также проверила модификацию модели, снижающую число отказов: по её данным, защитные ограничения заметно ослабли без потери исследованных возможностей. Anthropic призвала правительства стран проверять безопасность мощных моделей и сообщила, что расширяет доступ защитников к возможностям Claude для работы с киберугрозами.
Источник: PC Watch.