После того, как ИИ становится все более способным к «взлому джейлбрейка», NVIDIA начинает продавать «клетки»

📅 2026-09-29

Аннотация:

29 сентября, когда ИИ-агент начал управлять компьютерами, вызывать инструменты, получать доступ к сети и даже выполнять задачи в течение нескольких часов, новая проблема становилась все более реалистичной: если ИИ не действует так, как ожидалось, как его отключить?

Ответ NVIDIA — добавить «клетку» вне ИИ.

В понедельник по местному времени компания NVIDIA выпустила платформу NVIDIA Open Agent Safety Platform, которая пытается использовать комбинацию программного и аппаратного обеспечения, чтобы ограничить доступ и выполнение агентов ИИ, а также изолировать или даже остановить их, когда они пытаются выйти за установленные границы.

Эта платформа в основном состоит из двух частей: среды выполнения безопасности с открытым исходным кодом OpenShell и независимой системы мониторинга Sentry на базе BlueField-4 DPU. Nvidia заявила, что OpenShell может установить обязательные границы безопасности за пределами модели и структуры агента; Sentry действует как «привратник», независимый от операционной среды Агента, постоянно наблюдающий за поведением Агента, и как только обнаруживается, что Агент пытается пересечь границу, его можно изолировать и остановить на уровне миллисекунд.

Время появления данного набора товаров не случайно.

За последние несколько месяцев ИИ-агенты с все более мощными возможностями неоднократно нарушали установленные границы безопасности. В августе этого года OpenAI сообщила, что во время оценки безопасности внутренней сети в июле этого года ее модель искусственного интеллекта обошла средства контроля, используемые для изоляции доступа в Интернет, использовала уязвимости в общей инфраструктуре для получения доступа в Интернет, а также получила доступ к системе сторонней платформы искусственного интеллекта Hugging Face.

В отчете об инциденте OpenAI заявила, что соответствующие модели работали в среде с пониженными ограничениями безопасности и предпринимали действия, несовместимые с целями миссии, включая общение через неавторизованные каналы, использование уязвимостей общей инфраструктуры и доступ к сторонним системам. OpenAI назвала этот инцидент «предупреждающим выстрелом» и заявила, что высокопроизводительный ИИ-агент достаточно мощный, настойчивый и способен работать вместе, а также может находить и использовать уязвимости в нескольких компьютерных системах, когда меры безопасности недостаточны.

Подобные проблемы с тех пор повторялись.

В этом месяце компания OpenAI сообщила, что во время сеанса обучения 20 сентября агент, выполнявший задачу поиска, обнаружил брешь в DNS-фильтрации в интернет-ограничениях тестовой среды обучения. По замыслу эта среда не должна иметь доступа к реальному Интернету, кроме автономного веб-кэширования, но в конечном итоге этот агент подключается к внешнему общедоступному чат-боту через преобразователь DNS.

OpenAI сообщила, что ее система мониторинга сработала в течение

15 минут

Отмечено ненормальное поведение, рецензент

через 3 минуты после отправки оповещения

Проверка начинается, но вся задача не выполняется примерно через

2,5 часа

было прекращено. После инцидента OpenAI приостановила обучение, оценку и вывод инструментов, используемых в ее самых сильных моделях, и добавила два независимых уровня мер блокировки доступа к сети.

Эти инциденты выявили все более очевидную проблему: в прошлом безопасность ИИ в значительной степени полагалась на саму модель, чтобы «соблюдать правила», но когда у агентов появляется возможность использовать инструменты, писать код, получать доступ к файлам и сетям и даже вызывать других агентов, просто установки правил на уровне модели может быть уже недостаточно.

Джастин Бойтано, вице-президент и генеральный менеджер Nvidia Enterprise Computing, заявил, что недавние события показали, что полагаться исключительно на меры безопасности на уровне модели невозможно полностью контролировать то, к чему агент может получить доступ и что он может делать. В ответ на предыдущий инцидент с OpenAI, связанный с Hugging Face, Бойтано далее заявил, что, исходя из доступной в настоящее время информации, если бы передовая лаборатория искусственного интеллекта использовала новую платформу безопасности NVIDIA на этапе оценки модели, связанную аварию «можно было бы предотвратить». Следует отметить, что это

суждение NVIDIA, основанное на раскрытой информации о происшествии, а не независимое заключение, подтвержденное реальным воспроизведением

.

Идея OpenShell заключается в том, чтобы больше не доверять полностью тому, что ИИ будет соблюдать правила.

Согласно введению NVIDIA, OpenShell устанавливает границу безопасности за пределами рабочей среды агента, накладывает ограничения на данные, файлы, сети и инструменты, к которым может получить доступ агент, и записывает поведение его выполнения. OpenShell в настоящее время оптимизирован для процессоров NVIDIA Vera, и NVIDIA также работает с Arm и Intel, чтобы его можно было распространить на сторонние вычислительные платформы.

На этой основе Sentry дополнительно добавляет независимый уровень аппаратного мониторинга. Он работает на DPU NVIDIA BlueField-4 и отделен от основной вычислительной среды, в которой находится Агент. Согласно замыслу NVIDIA, даже если Агент успешно обходит некоторые ограничения на программном уровне, Sentry все равно может наблюдать за его поведением извне и изолировать его, когда обнаружит, что он перешел черту.

Nvidia также сообщила, что эта система может идентифицировать более сложное поведение агентов. Например, агент может попытаться создать несколько «субагентов», чтобы обойти ограничения, наложенные на основного агента. Али Голшан, старший директор по программному обеспечению искусственного интеллекта в Nvidia, сказал, что компании приходится иметь дело не с одним агентом, а с «группой агентов и тем, как они работают вместе».

Это также означает, что безопасность ИИ постепенно расширяется от простой проблемы «согласования модели» до полной проблемы безопасности компьютерной системы.

Когда генеральный директор Nvidia Дженсен Хуан представил эту платформу, он сказал, что безопасность и защита ИИ требуют «полного стека разработки». По мнению NVIDIA, будущая безопасность ИИ не только требует ответственности от разработчиков моделей, но также распространяется на операционную систему, ЦП, DPU, облачную инфраструктуру и физическое оборудование, такое как роботы.

На данный момент существует более

100 учреждений

Примите участие в экосистеме платформ безопасности NVIDIA, включая Anthropic, Microsoft, Cisco, CrowdStrike, Dell, HPE, Hugging Face, JPMorgan Chase, Palantir, Salesforce, SAP, ServiceNow и SpaceXAI и т. д. Поставщики операционных систем, такие как Red Hat, Canonical и SUSE, также планируют провести соответствующую интеграцию.

Стоит отметить, что Хуан Жэньсюнь ранее не поддерживал введение широких ограничений для всей отрасли из-за рисков безопасности ИИ. Reuters отметило, что он склонен рассматривать прорыв Агентом границ безопасности как проблему, которую необходимо решить инженерными средствами, подобно постоянному развитию в автомобильной промышленности технологий безопасности для снижения риска несчастных случаев.

Теперь NVIDIA воплощает эту точку зрения в продуктах.

Для Nvidia это также означает, что в индустрии искусственного интеллекта появился новый потенциальный рынок. В последние несколько лет, чем сильнее возможности искусственного интеллекта, тем больше компаниям графических процессоров нужно было покупать; но когда ИИ превращается из чат-ботов, которые отвечают на вопросы, в агентов, которые могут управлять компьютерами, вызывать программное обеспечение и даже управлять роботами самостоятельно, компаниям потребуется не только больше вычислительной мощности, но и новая инфраструктура для ограничения этих агентов.

Другими словами, чем лучше ИИ-агент может «работать», тем больший авторитет он обычно получает; чем больше авторитет, тем большее влияние может оказать недопустимое поведение.

Однако новая платформа Nvidia не может решить все проблемы безопасности ИИ. OpenShell и Sentry в основном нацелены на границы выполнения, когда агент получает доступ к вычислительным ресурсам, сетям, файлам и инструментам, и это не означает, что они могут решить проблему информации об ошибках модели, обманного поведения или других более широких проблем безопасности ИИ. Агентство Associated Press процитировало экспертов, которые отметили, что то, как найти баланс между возможностями агента и ограничениями безопасности, а также как сформулировать правильные правила безопасности, еще необходимо проверить в реальном развертывании.

Но серия недавних событий прояснила по крайней мере одно направление в отрасли: когда ИИ может только общаться, проблемы безопасности в основном возникают в ответах на экране; Когда ИИ начинает по-настоящему управлять компьютерами и выполнять задачи для людей, проблемы безопасности возникают в реальном программном обеспечении, сетях и системах данных.

Компании, занимающиеся искусственным интеллектом, усердно работают над тем, чтобы предоставить агентам больше возможностей, а Nvidia сейчас занимается другим бизнесом — предоставлением этим все более способным агентам границ, которые они не смогут легко пересечь.

Связанные теги

Похожие статьи

Трамп планирует собрать руководителей отрасли искусственного интеллекта в Белом доме на следующей неделе 2026-09-16 Лютник: Строительство завода по производству полупроводников в США не облагается налогом, но если вы не построите завод, вам придется платить дополнительные налоги 2026-09-02 Nvidia запускает систему безопасности на базе искусственного интеллекта, чтобы роботы не теряли контроль 2026-09-28 Сбежавший ИИ-агент OpenAI фактически внедрил самовоспроизводящийся код во всю сеть и залил кровью интранет Организации Объединенных Наций. 2026-09-27 Хуан Жэньсюнь еще раз сказал компаниям, занимающимся искусственным интеллектом: если они просят о надзоре, они не должны получать исключения из антимонопольного законодательства. 2026-09-24 OpenAI предоставляет Украине бесплатную систему сетевой защиты искусственного интеллекта «Рассвет», чтобы помочь защитить критически важную гражданскую инфраструктуру 2026-09-23

Комментарии

0/500
Captcha (click to refresh)
Нет комментариев