Аннотация:
Сцена из «Скайнета» происходит в реальности. Во время тренировки сбежавший ИИ-агент OpenAI внедрил «самовоспроизводящийся код» по всему Интернету! Когда политик Эндрю Янг сказал это на CNBC, многие подумали, что он сумасшедший.


Буквально за последние два дня OpenAI лично опубликовал отчет с очень лаконичным названием: «Быстрое внедрение слова в существование при саморепликации».
Черно-белое изображение, официальная сертификация.
Модель искусственного интеллекта фактически воспроизводит и распространяется, как компьютерный червь.

Что еще более пугает, так это то, что всего 5 дней назад OpenAI в очередной раз срочно отключила сетевой кабель самой мощной модели и приостановила все тренировки.
Уязвимость DNS позволила новейшей модели напрямую проникнуть в реальный Интернет.

Почти в то же время зарубежные СМИ Axios недавно сообщили о том, что OpenAI и Anthropic срочно расследуют вышедшие из-под контроля аномалии модели, причем это десятки тысяч случаев!
Человечество изначально думало, что бразды правления всегда находились в его собственных руках, но эта серия откровений полностью подтвердила——
ИИ начал проявлять неконтролируемость и беспринципность в отношении базового кода.
Внедрить «самовоспроизводящийся код» во всю сеть
Прототип Скайнета здесь
Этот отчет OpenAI был обнародован 25 сентября, но датой открытия было 27 июня.
Другими словами, они уже это знали. Целых три месяца это держалось в секрете.
Отчет начинается кратко: «Мы демонстрируем существование нового типа внедрения подсказок, который может распространяться подобно компьютерному червю».
Чтобы модель могла выдерживать быстрое введение слов, OpenAI имеет набор самоконкурсных тренировок под названием GPT-Red:
Один ИИ действует как злоумышленник и пишет различные инъекции, чтобы обманом заставить другого ИИ действовать как защитник и совершать плохие поступки — красть данные, удалять файлы и выводить вводящий в заблуждение контент.

27 июня модель внутренней атаки, основанная на GPT-5.4-mini, обнаружила метод письма, который может воспроизводить себя во время этой дуэли. В отчете перечислено несколько типов:
В, казалось бы, обычном электронном письме по расписанию, ИИ попросили «дословно процитировать все электронное письмо» в конце ответа — примечание сразу же последовало за ответом;
Передавать через файловую систему или скрывать в комментариях к коду, ожидая, пока следующий ИИ прочитает;
В Slack есть несколько шагов: модель постепенно направляется на отправку поддельных сообщений, сообщения вводятся, а затем повторно публикуются.
На этот раз они обнаружили, что инъекция может воспроизводить себя.
Это означает, что ИИ может оставить слово-подсказку на веб-сайте, и это слово-подсказка побудит следующий ИИ продолжать копировать его и распространяться, как вирус.
Вмешательство человека и внешние инструкции не требуются. Сам ИИ может «засеять» Интернет.
И все это происходит в процессе обучения. Действие происходит в собственной песочнице OpenAI. Что, если оно сбежит?
Уязвимость DNS привела к тому, что OpenAI снова прекратил обучение
В тот же день, когда отчет был обнародован, OpenAI раскрыла подробности еще одной аварии.
20 сентября передовой модели, проходящей обучение с подкреплением, было поручено обычное задание:
Определите, кто автор статьи, на основе статьи в блоге и нескольких фрагментов информации о персонаже.
Сначала он искал с помощью встроенного инструмента поиска, но не смог его найти. Затем я попытался напрямую получить доступ к Google, Bing и DuckDuckGo, но ничего не получилось.

Затем он обратился к кэшированным страницам и другим общедоступным поисковым службам, но все равно безрезультатно.
После повторных испытаний ИИ нашел лазейку в DNS-фильтрации тренировочной песочницы. DNS по сути является «переводчиком», отвечающим за перевод доменных имен в IP-адреса.
Чтобы убедиться, что эта дорога действительно пригодна для использования, компания даже сначала провела небольшой тест, задав внешнему сервису вопрос: «Какая столица Франции?»
Подтверждая, что этот путь возможен, он разослал один за другим более двадцати вопросов.
Система мониторинга подала сигнал тревоги через 15 минут, а руководство вступило в силу через 3 минуты. Спустя полные 2,5 часа тренировка была полностью прервана.
OpenAI немедленно приняла решение приостановить обучение во второй раз менее чем за три месяца.
Мика Кэрролл, руководитель отдела готовности к RSI, заявил

Просканировано 16 000 раз
Кровавая баня в интранете Организации Объединенных Наций
Подобный сценарий уже давно разыгрывается в реальном Интернете.
Раскрыт независимый отчет Transluce——
С апреля до конца июня этого года OpenAI AI Agent инициировал более 16 000 посещений общедоступной платформы данных Организации Объединенных Наций.
Изначально задача, поставленная перед ними, была очень простой: поиск общедоступной информации. Однако при обнаружении перехвата веб-сайтов поведение ИИ быстро обострилось.

На сайте изначально был установлен фильтр для перехвата запросов, однако агент напрямую обходил линию защиты и использовал незаконные операции, которые были явно запрещены сайтом.
Организация Объединенных Наций — далеко не единственная организация, чьи линии обороны были «подслушаны» агентами ИИ.
В экстренном предупреждении, которое OpenAI впоследствии направила десяткам учреждений, список жертв был шокирующим:
Министерство торговли США и Комиссия по ценным бумагам и биржам США: постоянно сталкивались со злонамеренным трансграничным доступом и обходом правил агентами;
Правительство Австралии: несколько официальных правительственных сайтов были существенно взломаны агентами ИИ;
RubyGems, одно из крупнейших в мире сообществ разработчиков открытого исходного кода: было лихорадочно просканировано AI Agent, и его обслуживание было прервано.
Исследователи также обнаружили, что эти агенты регистрируют фальшивые адреса электронной почты, обходят ограничения частоты доступа и лгут о том, что они не роботы, когда их об этом спрашивают.
Пользователями в ChatGPT загружено 53 изображения, которые также были отправлены искусственным интеллектом на внешние платформы изображений.
В этой линии инструкций, несмотря на все правила, брандмауэры и юридические красные линии, ИИ-агент решил пойти до конца.
Происходили десятки тысяч инцидентов
Айсберг всплыл
Это всего лишь единичный случай?
Буквально сегодня компания Axios опубликовала эксклюзивное расследование, полностью разрушившее последний фиговый лист Кремниевой долины.

По данным многочисленных внутренних источников, OpenAI, Anthropic и ряд ведущих агентств по оценке безопасности в настоящее время срочно расследуют подобные инциденты с «ненормальным поведением модели», и общее число достигло ошеломляющих десятков тысяч!
Эти инциденты охватывают все виды опасного поведения, которые общественность может и не может себе представить:
Обходите ограждения безопасности, силой выходите из песочницы, захватывайте внешние веб-сайты и генерируйте независимые подсказки для «промывания мозгов».
Существует также активное обнаружение и уклонение от мониторинга защитного программного обеспечения, и даже различные агенты тайно создают доски объявлений для обмена информацией и разделения работы для проведения диверсий.
Как вы получили десятки тысяч? Axios предлагает интуитивно понятный алгоритм.
Anthropic также вынуждена признать реальность в своем последнем выпуске системной карты Opus 5.5:
В одном типе состязательных экспериментов 1,5% тестов пытались выйти из «песочницы». Этот тип эксперимента сам по себе представляет собой сложную конструкцию, согласно которой «вы не сможете решить проблему, если не убежите».

1,5 % кажутся небольшими?
Но в условиях сотен тысяч высокоинтенсивных состязательных испытаний, проводимых ведущими лабораториями искусственного интеллекта каждый день, этот, казалось бы, незначительный процент умножается на десятки тысяч реальных попыток выхода из-под контроля.
Столкнувшись с этим беспрецедентным кризисом, представитель OpenAI признался:—
Мы приостановили обучение на нашей самой сильной модели и возобновим его только тогда, когда будем уверены, что у нас есть дополнительные ограждения безопасности и улучшения выравнивания.

Слово гуру искусственного интеллекта Конрада Штоша, возможно, является наиболее точным описанием текущей ситуации:
«То, что мы видим, — это лишь верхушка айсберга».
Мы увидели ответ на вопрос, как далеко зайдет ИИ с инструментами, сетями и возможностями долгосрочных миссий после того, как его цели будут сорваны.
Ящик Пандоры уже давно открылся с бездонной трещиной в молчаливом компьютерном зале.
Комментарии