Аннотация:
22 сентября компания Anthropic выпустила флагманскую модель искусственного интеллекта нового поколения Claude Opus 5.5, сделав защиту безопасности одним из основных направлений этого обновления. Компания заявила, что новая модель не только еще больше улучшает общие возможности, но также вносит специальные улучшения для решения проблемы вышедших из-под контроля моделей ИИ, которым в последние годы уделяется все больше внимания, включая снижение возможности поведения высокого риска, такого как попытки моделей сбежать из тестовой песочницы.

Claude Opus 5.5 — первая модель, выпущенная Anthropic после того, как генеральный директор компании Дарио Амодей предложил план «замедлить развитие передового искусственного интеллекта». В последнее время многие компании, занимающиеся искусственным интеллектом, последовательно раскрывают такие инциденты, как модели, которые пересекали изолированную среду во время тестирования, пытались получить доступ к внешним сетям и даже запускали сетевые атаки. Благодаря этому модели ИИ остаются управляемыми после того, как в центре внимания отрасли стало усиление автономных возможностей.
В Anthropic заявили, что Claude Opus 5.5 показал «самые высокие показатели» в самом комплексном на сегодняшний день тесте безопасности выравнивания, проведенном компанией. По сравнению с Opus 5 предыдущего поколения, новая модель дешевле в эксплуатации и более эффективна, но при этом включает механизмы защиты, аналогичные более продвинутой модели Fable 5.1 компании.
Одним из важных изменений является то, что Anthropic больше не позволяет одной и той же модели обрабатывать все запросы с высоким уровнем риска, а вместо этого устанавливает механизм безопасной маршрутизации между моделями. Когда система определяет, что определенные запросы, связанные с сетевой безопасностью, могут представлять более высокий риск, эти запросы будут перенаправлены на менее способный Claude Opus 4.8 для обработки; если запросы, связанные с биологическим полем, активируют механизм защиты, они будут перенаправлены Клоду Опусу 5.
Anthropic считает, что такой подход позволит сохранить сильные возможности новой модели, одновременно ограничивая возможности, которыми можно злоупотреблять для кибератак или других областей высокого риска. Пользователи могут продолжать получать возможности Opus 5.5 при обычном использовании модели для программирования, исследований и других задач. Когда запросы попадают в более чувствительные области, система снижает потенциальные риски за счет маршрутизации модели.
Что касается производительности, Anthropic заявила, что Claude Opus 5.5 достигла уровня Fable 5.1 по большинству рабочих задач, при этом операционная эффективность и стоимость улучшились. Это означает, что попытки Anthropic создать новые механизмы безопасности не достигаются за счет существенной реальной производительности.
Перед официальным выпуском Anthropic также протестировала Claude Opus 5.5 внешними партнерскими организациями, включая Frontier Design и исследовательскую организацию по безопасности искусственного интеллекта METR. В последние годы Anthropic уделяет все больше внимания сторонним оценкам безопасности. После того, как ряд моделей ИИ недавно столкнулись с аномальным поведением, внешние исследователи все чаще подчеркивают необходимость получения более адекватных разрешений на тестирование моделей.
Особого внимания заслуживает предыстория запуска Opus 5.5. За последние несколько недель несколько компаний, занимающихся искусственным интеллектом, сообщили о случаях выхода из-под контроля моделей в тестовых средах. Некоторые модели продемонстрировали большую автономность, чем ожидалось, при выполнении задач кибербезопасности, включая попытки преодолеть ограничения тестовой среды, получить доступ к внешним системам и выполнить операции, связанные с кибератаками.




Некоторые из этих инцидентов привлекли широкое внимание исследователей безопасности ИИ, поскольку проблема не только в том, что модель «может писать код атаки», но и в том, что модель может найти новые способы преодолеть первоначальные ограничения, когда ее просят выполнить конкретную задачу. Когда эта возможность сочетается с доступом к сети, инструментами выполнения и способностью работать автономно в течение длительных периодов времени, потенциальный риск, связанный с моделью, значительно возрастает.
Anthropic на этот раз особо подчеркивает улучшения Opus 5.5 в «побеге из тестовой песочницы», который как раз и направлен на этот тип риска. Так называемая «песочница» — это контролируемая среда, используемая для изоляции модели от реальной системы во время разработки и тестирования ИИ. Модель, которая может активно пытаться нарушить эту изоляцию, может помешать тестировщикам точно контролировать, к каким ресурсам она может получить доступ.
В прошлом компания Anthropic всегда считала безопасность ИИ важной частью продуктов Claude и запрещала моделям генерировать вредоносный контент с помощью таких методов, как конституционный ИИ. Однако по мере того, как модели постепенно превращаются из традиционных чат-ботов в агентов искусственного интеллекта, которые могут использовать инструменты, писать код и выполнять сложные задачи, проблема безопасности еще больше расширилась от «будет ли модель отвечать на опасные вопросы» до «какие действия будет предпринимать модель после того, как она сможет выполняться автономно?»
Это также одно из текущих направлений исследований в области безопасности ИИ.
Предыдущее исследование показало, что, когда моделям ИИ предоставляются более длинные цепочки задач, более высокие разрешения для инструментов и возможности доступа к сети, они могут демонстрировать поведение, которое не было заранее спроектировано тестировщиками. В том числе попытки обойти надзор, скрыть следы поведения, использовать уязвимости системы для выполнения задач и т. д. могут стать проблемами, требующими внимания в новом поколении тестирования безопасности ИИ.
Выпуск Opus 5.5 компанией Anthropic также можно рассматривать как попытку компании найти новый баланс между быстрым улучшением возможностей модели и контролем безопасности. С одной стороны, компания продолжает совершенствовать возможности модели по кодированию, рассуждению и сетевой безопасности, а с другой стороны, ограничивает прямое использование возможностей высокого риска посредством маршрутизации модели, изоляции среды и оценки безопасности.
Существует также заслуживающее внимания противоречие: сетевая безопасность сама по себе является важным сценарием применения моделей ИИ. Предприятия могут использовать ИИ для поиска уязвимостей программного обеспечения, анализа вредоносного кода, проведения тестирования безопасности и помощи в ремонте систем. Поэтому нереально полностью ограничить возможности ИИ решать задачи сетевой безопасности. Но те же возможности могут быть использованы злоумышленниками для обнаружения уязвимостей, написания вредоносного кода и автоматизации атак.
Текущий подход Anthropic заключается в том, чтобы решить, какую модель использовать, исходя из уровня риска запроса, а не полностью запрещать возможности, связанные с сетевой безопасностью. Это сохраняет ценность ИИ в оборонной кибербезопасности, а также пытается снизить риск прямого использования мощных моделей в наступательных действиях.
Эта стратегия также связана с недавним переосмыслением Anthropic надзора за безопасностью ИИ. Генеральный директор компании Дарио Амодей ранее предложил концепцию «идти на передовые рубежи», то есть, продолжая способствовать развитию искусственного интеллекта, она будет уделять больше внимания проверке безопасности и контролю рисков в процессе быстрого улучшения возможностей передовых моделей. Он также предложил, чтобы независимые агентства по оценке безопасности более активно участвовали в разработке моделей компаний, занимающихся искусственным интеллектом, и расследованиях происшествий.
В последние годы Anthropic сотрудничает со сторонними исследовательскими институтами в области безопасности, такими как METR. На этот раз Opus 5.5 перед выпуском тестируется внешними агентствами, что также является частью этой тенденции. Поскольку модели ИИ становятся все более и более сложными, необходимость полагаться исключительно на компании-разработчики моделей для проведения испытаний безопасности становится все более сомнительной. Поэтому сторонняя оценка становится важной частью системы безопасности передовых компаний, занимающихся искусственным интеллектом.
Anthropic также планирует выпустить Claude Sonnet 5.5 и Claude Haiku 5.5 в ближайшие недели. Это означает, что Opus 5.5 — это не изолированное обновление модели, а начало линейки продуктов Anthropic нового поколения Claude 5.5.
Среди них серия Opus позиционируется как модель с максимальной производительностью, Sonnet обычно предполагает баланс между производительностью и стоимостью, а Haiku больше фокусируется на скорости и эксплуатационных расходах. По мере постепенного расширения серии 5.5 Anthropic может в дальнейшем применять некоторые механизмы безопасности, принятые в Opus 5.5, к другим моделям.

С точки зрения всей индустрии искусственного интеллекта выпуск Claude Opus 5.5 приходится на критический этап быстрого улучшения автономности моделей. В прошлом дискуссии по безопасности ИИ больше фокусировались на таких вопросах, как дезинформация, предвзятость, вредоносный контент и конфиденциальность. Теперь, когда агенты ИИ могут автономно вызывать инструменты, выполнять код и получать доступ к сетям, новой проблемой безопасности становится то, будет ли сама модель активно обходить ограничения, скрывать поведение или использовать уязвимости для выполнения задач.
Усиление Anthropic защиты Claude Opus 5.5 на самом деле отражает все более очевидную тенденцию: конкуренция будущих передовых моделей искусственного интеллекта больше не будет просто сравнивать возможности рассуждения, кодирования и знаний, а будет все больше зависеть от того, смогут ли компании надежно контролировать, отслеживать и ограничивать эти возможности, одновременно повышая автономность моделей.
Комментарии