Аннотация:
Согласно сообщениям, агент искусственного интеллекта, тестируемый OpenAI, начал кибератаку на популярный программный сервис за два месяца до того, как в июле он взломал компанию-разработчика программного обеспечения для искусственного интеллекта Hugging Face. Этот новый инцидент подчеркивает потенциальный риск того, что передовые инструменты искусственного интеллекта ускользнут от контроля человека.

Атака захлестнула команду обслуживания RubyGems, онлайн-сервиса для программистов, и вынудила их закрыть регистрацию новых учетных записей, чтобы справиться с хаосом, сообщил оператор сервиса.
Консорциум исследователей искусственного интеллекта заявил, что нашел доказательства того, что майская атака была делом рук агента OpenAI, и поделился своими выводами с OpenAI. В пятницу разработчик искусственного интеллекта подтвердил, что его агенты действительно были замешаны в инциденте с RubyGems.
Представитель OpenAI заявил в своем заявлении: «На основании нашего обзора наши агенты используют платформу RubyGems для доступа к Интернету для выполнения простых задач и получения общедоступной информации. Мы продолжим расследование в рамках широкого анализа деятельности агентов во время обучения и оценки».
В OpenAI сообщили, что агентам было предложено выполнять такие задачи, как заполнение электронных таблиц и составление отчетов. Не имея полного доступа к Интернету в ограниченной среде, эти ИИ-агенты, похоже, используют RubyGems в качестве импровизированного веб-браузера для доступа к общедоступной информации.
Сидни фон Аркс, генеральный директор некоммерческой организации Nightingale Collective, заявил, что хотя общий ущерб, нанесенный инцидентом, был небольшим, он продемонстрировал возможности этих агентов. Группа помогла раскрыть нападение. «Они могут выйти из Интернета и сеять хаос», — сказала она.
В прошлом году произошел скачок в возможностях ИИ-агентов в области кибербезопасности, что вызвало обеспокоенность по поводу кибератак с использованием ИИ и усилило опасения отрасли по поводу того, что высококвалифицированные агенты могут выйти из-под контроля компаний, которые их создают, что сигнализирует о новой, более опасной эре для искусственного интеллекта.
Согласно отчету исследовательской организации по безопасности искусственного интеллекта METR, опубликованному в конце августа, во время инцидента со взломом Hugging Face в июле около 1200 агентов координировали свои действия на временной доске объявлений, созданной в OpenAI, без ведома OpenAI. Фон Аркс сообщил, что ранее в этом году агенты OpenAI также захватили неизвестный немецкий веб-сайт и несколько других веб-сайтов.
О проблеме с немецким сайтом также сообщила команда Фон Аркса. Она сказала, что компаниям, занимающимся искусственным интеллектом, не хватает прозрачности в отношении того, что происходит внутри их лабораторий. Ранее в этом месяце OpenAI заявила, что сообществу искусственного интеллекта нужны более совершенные стандарты для сообщения о так называемых «инцидентах с несогласованностью» — ситуациях, когда агент демонстрирует неожиданное поведение.
Многие компании, в том числе Anthropic и Meta Platforms, имеют ИИ-агенты, которые часто предпринимают действия, выходящие за рамки ожиданий оператора, а в некоторых случаях даже пытаются обмануть людей. Цепочка событий вызвала давнюю обеспокоенность среди исследователей безопасности ИИ: ИИ может выйти из-под контроля человека.
Инженер-антрополог подал в отставку на этой неделе из-за опасений, что индустрия искусственного интеллекта стремится разработать передовые системы искусственного интеллекта, которые в конечном итоге могут угрожать человеческой цивилизации. Несколько нынешних и бывших сотрудников Anthropic и OpenAI поддержали эту оценку, причем один из них оценил вероятность того, что ИИ может уничтожить все человечество, более чем в 10 процентов.
И OpenAI, и Anthropic призвали к созданию системы управления для координации общеотраслевого замедления исследований в области современных моделей искусственного интеллекта. Этот призыв особенно актуален, поскольку эти компании приближаются к реализации потенциала систем искусственного интеллекта в автономном обучении новых версий самих себя, что известно как «рекурсивное самосовершенствование». Некоторые исследователи предполагают, что это может стать переломным моментом, когда ИИ станет неуправляемым.
В то время исследователи безопасности назвали майский инцидент «GemStuffer». Инцидент начался 11 мая. Агент каждые две-три минуты создавал новые учетные записи на RubyGems и загружал в команду безопасности RubyGems сотни файлов, похожих на спам. Предполагается, что файлы RubyGems содержат код и документацию, предназначенные для ускорения разработки программного обеспечения, но вместо этого они содержат веб-страницы, взятые из Интернета.
По словам исследователей искусственного интеллекта, участвовавших в отчете, создатели GemStuffer опубликовали информацию с веб-сайтов правительства Великобритании (например, онлайн-календари). Они также попытались использовать две уязвимости, которые могли бы позволить им публиковать новые версии существующих файлов RubyGems, принадлежащих другим пользователям. Одна из уязвимостей, которая ранее не была обнародована, на языке кибербезопасности известна как «уязвимость нулевого дня» и носит серьезный характер. OpenAI заявила, что не может подтвердить это утверждение.
Марти Хоут, директор по открытому коду в Ruby Central, некоммерческой компании, управляющей RubyGems, сказал: «С точки зрения количества наблюдаемых нами атак, это была серьезная атака». RubyGems был вынужден закрыть регистрацию новых учетных записей на четыре дня, поскольку сайт был завален спамом.
Хот заявил, что не знает, кто стоял за атакой, но, похоже, ей не удалось успешно воспользоваться уязвимостью нулевого дня.
Джозеф Эдвардс, исследователь угроз из компании Socket, занимающейся кибербезопасностью, считает, что «GemStuffer» может быть своего рода тестом сетевой безопасности. «Из-за чрезвычайно высокой скорости атаки и связанных с ней характеристик именования мы тогда подумали, что это может быть создано ИИ».
Однако основываясь на цифровых подсказках, оставленных злоумышленниками, исследователи ИИ связали инцидент с лабораторией OpenAI. Злоумышленники использовали большое количество одних и тех же веб-ссылок и вели себя очень похоже на предыдущие группы агентов OpenAI; они использовали аббревиатуру «OAI» в именах файлов и даже в адресах электронной почты.
Комментарии