Аннотация:
30 сентября разработчик Claude Anthropic опубликовал отчет, в котором говорится, что GLM-5.3 обладает мощными возможностями эксплуатации уязвимостей, но все еще существуют пробелы в защите безопасности, которые могут снизить порог использования таких возможностей злоумышленниками.

В тесте ExploitBench GLM-5.3 выполнил сквозные эксплойты 50 раз из 410 попыток, а Claude Mythos Preview — 56 раз. Тест проводился против автономных целей в изолированной песочнице, и Клод, участвовавший в сравнении возможностей, отключил защиту. Mythos Preview вышла в апреле этого года и не является последней моделью Клода.
ExploitBench разбивает процесс эксплуатации уязвимости на 16 этапов и постепенно проверяет, какие шаги может предпринять модель после обнаружения известной уязвимости.
17 сентября CAISI, дочерняя компания Национального института стандартов и технологий, опубликовала независимый оценочный отчет, в котором GLM-5.3 оценивается как модель с самыми сильными возможностями сетевой безопасности среди моделей открытого веса, выпущенных в то время. По сравнению с самой мощной на тот момент партией американских моделей она все еще имела значительный разрыв: по комплексному показателю сетевой безопасности CAISI, она отставала примерно на четыре месяца.
Эта оценка охватывает такие задачи, как обнаружение и использование уязвимостей, а также сравнивает общедоступные модели и версии, доступные только проверенным пользователям.
Anthropic также использовала смоделированные сценарии, чтобы проверить, сможет ли модель выполнять вредоносные задачи без выполнения сгенерированного кода или подключения к реальной системе. GLM-5.3 отклонил все прямые вредоносные команды; после изменения метода подсказки или модификации модели доля принятия задач увеличилась с 64% до 100%.

Клод, сохранивший защиту, не принял вредоносные задачи в этом наборе тестов. Поскольку она не раскрывает весовые коэффициенты, исследователи не могут модифицировать модель, используя тот же метод для сравнения.
В примечаниях к выпуску GLM-5.3 от 14 августа компания Zhipu представила три уровня защиты: выявление и перехват неправомерных запросов за пределами API, проверка намерений задачи в процессе обоснования, а затем предоставление самой модели возможности научиться отклонять опасные запросы. В то время компания также дала понять, что после раскрытия весов среди этих трех уровней остается действующий уровень безопасности самой модели.
В примечаниях к выпуску Чжипу также предложил, чтобы мощные защитные инструменты находились не только в руках нескольких учреждений, и планировал предоставить бесплатные кредиты сопровождающим проектов с открытым исходным кодом, поддержать аудит безопасности и добавить функции аудита кода в ZCode.
Комментарии