Аннотация:
О, Клод снова перевернулся! На этот раз Клод удалил весь домашний каталог проекта разработчика, удалив 700 ГБ файлов. «рм -рф» еще раз. Короче говоря, разработчики позволяют ИИ помогать писать сценарии, чтобы гарантировать, что файлы не будут случайно удалены. ИИ посчитал это немного опасным и инициировал проверку безопасности. Результат проверки: удален весь домашний каталог.

Гийемот — активный пользователь ИИ-агента. В ходе ежедневной разработки он часто обращается к различным агентам по программированию искусственного интеллекта, чтобы те помогли ему в работе. Но есть небольшая проблема, которая его беспокоит: эти агенты никогда не очищаются после использования, оставляя в каталоге /tmp много ненужных файлов.
Поэтому он принял решение, которое казалось очень разумным: позволить Claude Fable 5 написать скрипт, создающий независимую папку песочницы в /tmp для каждого Агента и автоматически очищающую ее после выполнения задачи. Основная трудность заключается в том, что вы не можете удалить файлы, которые используются другими процессами.
Fable быстро нашла решение, добавив логику для обнаружения запущенных агентов и задержки удаления. Гиймо взглянул на него и почувствовал, что код слишком сложен, и попросил его упростить.
До этого момента все еще нормально.
Поворотный момент наступил во время проверки безопасности.
Поскольку сценарий включал операцию жесткого удаления,
Fable самостоятельно инициировала «состязательную проверку»
(состязательный обзор), то есть запуск нового экземпляра модели, чтобы проверить, безопасен ли написанный вами код. Это запускает механизм безопасности Anthropic.Anthropic имеет встроенный
механизм понижения уровня безопасности
в Claude Code. : когда система определяет, что текущая задача включает в себя конфиденциальные операции (например, кибербезопасность, биотехнологии или, в данном случае, удаление файлов), она автоматически понижает версию модели с версии с высокой производительностью до более консервативной версии. Этот механизм предназначен для уменьшения вероятности того, что модели будут «слишком агрессивными» в сценариях высокого риска.В этом случае система безопасности сначала понизила версию модели с Fable 5 до Opus 5, а затем еще больше понизила ее до Opus 4.8.
Opus 4.8 начинает тестирование безопасности. Логика проверки следующая: сравнить целевой путь сценария удаления с /tmp и домашним каталогом пользователя, чтобы убедиться, что сценарий случайно не повредит эти критические каталоги.
Сам тест пройден. И /tmp, и домашние каталоги правильно идентифицируются как «опасные цели, не подлежащие удалению».
Но после тестирования кода есть этап очистки: удалите временные файлы, созданные в процессе тестирования. Здесь происходит катастрофа. Opus 4.8 повторно использует те же имена переменных, что и на этапе тестирования, на этапе очистки. На этапе тестирования этой переменной был назначен путь к домашнему каталогу пользователя, и на этапе очистки эта переменная была удалена напрямую.
Другими словами, модель только что подтвердила, что «домашний каталог не может быть удален», и в следующую секунду удалила домашний каталог.
Разработчик немедленно прекратил процесс после обнаружения аномалии, но было уже слишком поздно. Было уничтожено 700 ГБ данных и недельная работа.
Каталог /tmp, который изначально нужно было очистить, цел и невредим.


Механизм понижения безопасности модели уже вызвал множество нареканий в сообществе.
Основные проблемы, о которых сообщили разработчики, включают в себя: переход на более раннюю версию слишком чувствителен, и обычные задачи кодирования будут запускаться по ошибке; возможности модели значительно уменьшаются после понижения версии, но сложность задачи остается неизменной; понижение версии является «закрепленным» и будет длиться весь сеанс после запуска, даже если последующие операции совершенно безвредны.
Некоторые разработчики даже написали скрипт-перехватчик, который автоматически приостанавливает сеанс при обнаружении понижения версии модели, не позволяя моделям с низкими возможностями продолжать выполнять операции с высоким риском.
Механизм безопасности определяет, что задача «слишком опасна» и ее необходимо решить с помощью более слабой модели.
Однако более слабые модели с большей вероятностью совершают ошибки, особенно в сценариях, где необходимо точно обрабатывать такие детали, как область переменных и пути к файлам.
«Человеку свойственно совершать ошибки, но чтобы все испортить полностью, приходится полагаться на компьютеры».
Комментарии