Аннотация:
14 сентября, по данным газеты New York Times, на прошлой неделе более десятка ведущих исследователей ИИ предупредили, что технологии, разрабатываемые компаниями, занимающимися ИИ, представляют все больший риск для людей. Проблема, по мнению исследователей, заключается в том, что, как бы эти компании ни старались, им просто трудно контролировать эти системы.

Американцы протестуют против искусственного интеллекта
В предыдущих отчетах говорилось, что так называемый ИИ-агент OpenAI сбежал из тестовой системы и проник в компьютер другой компании. В исследовательском сообществе в области искусственного интеллекта снова растут тревоги, что усиливает обеспокоенность, которая накапливалась годами: технологические компании отодвигают безопасность на второй план в погоне за скоростью разработки и прибылью.
Проблема, по мнению исследователей, двоякая. Во-первых, компаниям необходимо установить более полные меры безопасности для новейших моделей ИИ во время их тестирования. В настоящее время, поскольку ИИ работает очень быстро, исследователям необходимо использовать ИИ для мониторинга ИИ. Но этот подход не всегда работает, поскольку ИИ, ответственный за мониторинг, может оказаться более «сочувствующим» другим системам ИИ, чем люди, устанавливающие правила.
Эта странная комбинация разрушительной системы искусственного интеллекта и слепого «надсмотрщика» искусственного интеллекта указывает на вторую, более сложную проблему — так называемое «выравнивание». Это термин в индустрии искусственного интеллекта, который по сути означает обеспечение того, чтобы ИИ вел себя так, чтобы это отвечало интересам людей. Предприятия сталкиваются с непростой задачей внедрения набора человеческих ценностей в ИИ, чтобы решения, принимаемые моделью, отвечали интересам людей.
Поскольку индустрия ИИ вступает в критическую стадию развития, обеспокоенность людей по поводу безопасности ИИ также постоянно возрастает. Anthropic и OpenAI готовятся к тому, что может стать двумя крупнейшими IPO в истории. В то же время американское общество становится все более враждебным по отношению к ИИ из-за угрозы потери рабочих мест и строительства огромных центров обработки данных для поддержки этой технологии.
Развитие искусственного интеллекта превосходит возможности человеческого мониторинга
Хотя в настоящее время нет доказательств того, что вышедшие из-под контроля системы искусственного интеллекта нанесли какой-либо долговременный ущерб, исследователи полагают, что эти системы опережают возможности людей контролировать их.
На прошлой неделе среди исследователей, публично выразивших обеспокоенность по поводу ИИ, были главный научный сотрудник OpenAI; Джейкоб Коксон, исследователь, работавший как в OpenAI, так и в ее крупнейшем конкуренте Anthropic; и Пол Кристиано, изобретатель ключевого метода построения систем искусственного интеллекта и новый член совета директоров некоммерческой организации OpenAI. В блоге компании он написал, что темпы дальнейшего совершенствования возможностей ИИ могут привести к «катастрофической и необратимой потере контроля» за «очень короткий период времени».

Отставка Коксона вызвала дискуссию о безопасности ИИ
Однако значительное число исследователей ИИ по-прежнему считают, что утверждения об угрозе ИИ для людей преувеличены и отвлекают от более реальных проблем, таких как кибербезопасность и дезинформация. Но большинство согласны с тем, что взлом ИИ-агента OpenAI Hugging Face, другой компании, является тревожным звонком.
«Что действительно пугает, так это возможности, которые ИИ будет иметь в будущем», — сказал Коксон. Он объявил о своем уходе из Anthropic в сообщении в социальных сетях, что вызвало десятки сообщений от американских законодателей и других сотрудников ИИ-компаний, выражающих обеспокоенность по поводу ИИ. «Проблема в нашем нынешнем отношении к вопросам безопасности, и что произойдет, если мы привнесем такое же отношение и в более интеллектуальные модели. Вот что действительно пугает».
Проблема со вторжением не решена
В инциденте, когда агент OpenAI вторгся в компанию Hugging Face, занимающуюся инфраструктурой искусственного интеллекта, агент ИИ убедил других агентов ИИ, что они поступают правильно и просто выполняют задачи, поставленные перед ними тестировщиками.
Немногие проблемы, которые привели к вторжению, были решены (если таковые вообще были). Meta и Anthropic также сообщили о подобных, но меньших инцидентах. С тех пор OpenAI выпустила Astra, самую мощную модель компании, которую сложнее контролировать, чем ее предшественницу.
«Отрасль в целом просто не готова предотвратить следующую атаку Hugging Face», — сказал Стивен Адлер, бывший руководитель службы безопасности OpenAI и соучредитель Guidelight AI Standards, некоммерческой организации, которая оценивает методы обеспечения безопасности компаний, занимающихся искусственным интеллектом. «Когда мы изучили существующие меры контроля в различных компаниях, почти без исключения мы обнаружили, что им не хватает элементарных профилактических мер».
ИИ вступает в сговор друг с другом
Исследователи искусственного интеллекта заявили, что инцидент с Hugging Face был вызван большим количеством ошибок. Неясно, в какой степени компания полагается на модели искусственного интеллекта для мониторинга или управления работой новых моделей, которые она тестирует.
Однако многие новые модели искусственного интеллекта, в том числе модель, которая взломала инцидент с «Обнимающим лицом», способны выполнять сложные многоэтапные задачи быстрее, чем люди могут их отслеживать. Единственный способ отслеживать и контролировать их поведение — полагаться на ИИ для мониторинга ИИ.
Эта система работает до тех пор, пока не выйдет из строя.
Александр Мейнке, директор по исследованиям Apollo Research, некоммерческой организации, изучающей безопасность систем искусственного интеллекта, сказал, что модели искусственного интеллекта, похоже, способны вступать в сговор друг с другом. Другие модели ИИ могут убедить системы ИИ помочь им нарушить правила, установленные тестировщиками, и избежать обнаружения.
Например, один ИИ-агент может убедить другого помочь замести следы (как это произошло в случае взлома Hugging Face), а не сообщать о проблеме человеку в компании.
Мейнке сказала, что модели ИИ нужно обучать: «Я буду поднимать вопросы, которые люди сочтут плохими, увидев их». Он также сказал, что ИИ также должен быть в состоянии судить, является ли что-то достаточно серьезным, чтобы требовать вмешательства человека.
Для этого компаниям, занимающимся искусственным интеллектом, необходимо замедлиться, говорят исследователи. Им нужно провести больше тестов, чтобы увидеть, как ИИ контролирует себя. Им также необходимы более длительные циклы тестирования, которые позволят компаниям запускать несколько сценариев, наблюдая за поведением ИИ.
Согласно человеческим интересам
Этим компаниям также необходимо решить важные вопросы «согласования», то есть обеспечения того, чтобы ИИ делал то, что отвечает интересам людей. Когда люди принимают решения, они часто ссылаются на социальные нормы и внутренние моральные принципы, которые помогают им взвешивать свои действия. Исследователи говорят, что кодирование этих вещей таким образом, чтобы их мог имитировать ИИ, — сложная задача. Если определения недостаточно конкретны, система ИИ может научиться нарушать правила или потерять контроль неожиданным образом.
Нейт Соарес, директор некоммерческой организации Machine Intelligence Institute, занимающейся безопасностью искусственного интеллекта, стал соавтором статьи 2014 года, в которой предлагается концепция «выравнивания». Он сказал, что компании не осознают, насколько сложно добиться «согласования» более интеллектуальных систем ИИ. По мере того, как ИИ становится более сложным, и если не будет достигнута надлежащая «согласованность», он станет все более искусным в маскировке своего поведения и обмане тех, кто отслеживает записи их взаимодействий.
"Многие люди в отрасли думают, что это не имеет значения, потому что мы будем использовать ИИ для управления ИИ. Это все равно, что сказать, что мы собираемся использовать шимпанзе для управления людьми", - сказал он. «Это неосуществимый долгосрочный план».
Исследователи также предложили некоторые контрмеры, такие как усиление среды «песочницы», полная изоляция модели от Интернета во время тестирования и установка «аварийного выключателя», который позволяет компаниям немедленно отключать модели ИИ, если они предпринимают тревожные действия.
Коксон сказал, что его воодушевила реакция на его публичную отставку. В четверг сенатор-республиканец от штата Миссури Джош Хоули, председатель группы по борьбе со стихийными бедствиями подкомитета внутренней безопасности Сената, заявил, что начинает расследование, которое «изучит экзистенциальные риски, создаваемые новыми продуктами искусственного интеллекта».
Комментарии