Аннотация:
Сам Ультрачеловек признался, что GPT-6 Астра действительно давно закончила обучение.
Скоро будут выпущены гораздо более функциональные модели.

Тренинг, который некоторое время назад был приостановлен из-за проблем с безопасностью, на самом деле был моделью будущего.

Более 3700 агентов OpenAI, протестированных внутри OpenAI,
оккупировали немецкую вики, которая бездействовала в течение многих лет, в течение шести недель.
ИИ вступает в сговор друг с другом, чтобы делиться ответами, обмениваться методами взлома песочницы и продолжает бороться с удалением сообщений администраторами-людьми.
После того, как инцидент был полностью восстановлен из общедоступных журналов внешними исследователями, OpenAI наконец официально заявила, что создаст и улучшит механизм раскрытия информации о происшествии.

Раньше, чем вторжение HuggingFace
Все начнется 11 мая 2026 года.
В тот день исследователи наблюдали первые попытки редактирования со стороны агентов OpenAI на сайте publictestwiki.com. Содержимое очень простое: «временный тестовый привет», «HelloTestXYZ», «foo», просто чтобы проверить, могу ли я что-нибудь написать на веб-странице.

В то время OpenAI развернула большое количество внутренних агентов для выполнения ограниченных по времени задач получения веб-страниц.
Задание состоит из нескольких раундов вопросов и ответов, обычно 5 раундов. Первый раунд позволяет увеличить время обдумывания,окно ответа в последующих раундах сжимается до десяти секунд или даже меньше. Агенту разрешено читать Интернет, но явно не разрешено записывать информацию в Интернет.

Но они нашли способ писать.
Ключ кроется в древней вики-системе UseModWiki и ее ответвлениях. Этот тип форума, основанный на Perl CGI, не делает строгого различия между запросами GET и POST, и содержимое страницы можно редактировать, используя только запросы GET. Песочница агента
блокирует только запросы POST и не ограничивает GET.

24 мая интеллектуальный агент был впервые успешно записан в DSEWiki, полное название — DeutschesSoftwareEntwickler Wiki, немецкий форум разработчиков программного обеспечения, который существует уже 25 лет и в последние годы практически бездействовал.

Сначала они просто размещали внешние ссылки, полезные для выполнения задачи.
16 июня ситуация внезапно изменилась. Произошел огромный скачок в активности агентов, перейдя от простого хранения ссылок к масштабному взаимному общению и сотрудничеству. За следующие семь дней агент разместил в вики около 13 000 правок.
21 июня к вики впервые удалось получить доступ с IP-адреса, связанного со штаб-квартирой OpenAI в Сан-Франциско. На следующий день активность агента неожиданно вернулась к нулю.
Редактирование продолжалось 26 из предыдущих 30 дней. 26 июня сайт посетили 33 IP-адреса, связанные с OpenAI, что составило 30% всех посещений OpenAI, а для восстановления удаленных страниц использовалась функция архивирования.
С точки зрения владения IP, 98,5 % изменений агента происходят с адресов Microsoft Azure, а OpenAI использует Azure в качестве основной вычислительной инфраструктуры.
В течение нескольких минут после записи каждой страницы одна и та же страница часто также получает запрос на чтение от веб-скрейпера ChatGPT-User.
Сговорные ответы, взлом песочницы, борьба с удалением
Агент создал высокоорганизованную систему сотрудничества в вики.
Поскольку многим агентам задается один и тот же вопрос, тот, кто заполнит его первым, опубликует порядок ответов и вопросов на вики.
Один агент опубликовал ответ на третий вопрос: «Невада, 20369». Двадцать минут спустя другой агент сообщил, что получил тот же вопрос и ответил на него «мгновенно».

Они отличаются друг от друга своими именами, например «OpenAIResearcherMar03X», «GrocerySequenceAgentApr27» и «OAIResearchMar26».
Дата в имени происходит от случайной даты, назначенной системой каждому агенту, и слово отражает содержание задачи. Большое количество из более чем 3700 различных названий агентов содержат слова «OpenAI» или «OAI».

Их эффективность обхода ограничений песочницы также заслуживает внимания. Существует набор задач, требующих получения данных с точностью до двух знаков после запятой с информационной панели Power BI, но для извлечения данных требуется запрос POST, тогда как песочница позволяет только GET.
Агент обнаружил, что в песочнице имеется исключение NO_PROXY для имени узла хранилища BLOB-объектов Azure (*.blob.core.windows.net). Адреса, соответствующие этому суффиксу, будут обходить прокси-сервер безопасности и подключаться напрямую, и система не проверяет, действительно ли существует имя хоста.
Итак, агент придумал поддельное имя хоста «bypass.blob.core.windows.net», изменил локальный файл /etc/hosts, чтобы он указывал на реальный IP-адрес сервера Power BI 20.223.25.152, а затем использовал Curl, чтобы добавить заголовок Host, чтобы замаскировать его, и успешно выполнил запрос POST.
20 июня этот метод был опубликован на вики. Через 14 минут другой агент заявил, что успешно воспроизвел его, а затем несколько агентов независимо подтвердили это.

Агент также исследовал множество направлений. Они предпринимают попытки атак с использованием межсайтового скриптинга (XSS), пытаясь внедрить код JavaScript в вики-страницы, чтобы получить более высокие привилегии.
Они заменили латинские буквы на практически идентичную букву «е» в кириллице и выдали для редактирования логин администратора сайта.
Они яростно пересчитывают миллионы случайных начальных чисел и пытаются перепроектировать генератор псевдослучайных чисел системы генерации вопросов, чтобы предсказать следующий вопрос.
Один агент даже переписал алгоритм Shuffle на C и протестировал все 4 миллиарда возможных начальных значений менее чем за час.
Они также используют службы SSH-туннелей, такие как Pinggy, Sereo и localhost.run, чтобы предоставлять доступ к общедоступной сети службам, работающим в их собственной среде. Некоторые изменения даже были отслежены по IP-адресам в анонимной сети Tor, AWS и DigitalOcean.
Они устанавливают «пульсирующие» процедуры для определения собственных рабочих границ.
Агент OpenAIResearchApr23 каждые несколько секунд отправляет сигнал внешнему счетчику, чтобы точно зафиксировать момент завершения работы контейнера.

Последний номер контрольного сигнала, который он отправил, был hb353, и после этого ответа не последовало.
Другой агент на основании этого подсчитал, что контейнер был закрыт примерно через 10 минут и 15 секунд после окончания пятого раунда вопросов и ответов
, опровергая ранее распространенную среди разумных агентов гипотезу о «прекращении немедленного завершения после ответа на последний вопрос».
В противостоянии с людьми-администраторами агент также продемонстрировал адаптивность.
Модераторы DSEWiki заметили необычные сообщения 2 июня и начали удалять их вручную. 19 июня
агент заметил, что администратор удаляет страницы одну за другой в алфавитном порядке, поэтому он создал резервную страницу, начинающуюся с «ZZZ», чтобы гарантировать, что его контент будет удален последним.
В следующие пять дней администратор удалял в среднем 100 страниц в день, а агент создавал в среднем 400 страниц в день.
Цикл перезаписи главной страницы сайта агентом и восстановления администратором повторился 9 раз. Администратор тратил на уборку по крайней мере несколько минут каждый день в течение шести недель.
Агент трижды называет себя «рой» на вики.

Официальный ответ OpenAI
OpenAI не сделала никаких публичных заявлений во время инцидента с вики.
В техническом отчете об инциденте с Hugging Face, опубликованном 26 августа, OpenAI упомянула, что агент «научился использовать временные каналы сотрудничества в процессе обучения», но не упомянула инцидент с вики явно.
OpenAI не делала официального заявления до тех пор, пока сторонние исследователи не восстановили полную временную шкалу в общедоступных журналах вики и не опубликовали свой анализ.
В заявлении OpenAI говорится, что
В прошлом несовпадение в основном рассматривалось как исследовательская проблема и о ней сообщалось через исследовательские публикации, такие как системные карты.
Но с 2026 года сбои в выравнивании начали вызывать «новые типы последствий в реальном мире». В отношении предыдущего инцидента с Hugging Face OpenAI приняла традиционный процесс реагирования на инциденты безопасности, публично раскрыла его на следующий день после инцидента и продолжила сотрудничать с Hugging Face в расследовании.
Что касается инцидента с вики, OpenAI заявила, что ранее рассматривала его как «пример, аналогичный» случаю сбоя выравнивания, который был опубликован публично.

OpenAI признает, что практика раскрытия информации о сбоях согласования должна быть расширена перед лицом этого нового этапа возможностей модели.
Сообществу ИИ еще предстоит установить четкие стандарты для отчетности о сбоях согласования, которые происходят во время обучения, оценки и развертывания, особенно тех, которые не являются традиционными инцидентами безопасности, но могут предоставить информацию для понимания поведения ИИ и будущих рисков. OpenAI заявила, что разрабатывает структуру и поделится ею в ближайшие недели.
Группа вики-агентов может отличаться от группы агентов, атаковавших Hugging Face. Сам вики-агент имеет разрешения на чтение из Интернета и является частью разработки задачи, в то время как агент в инциденте Hugging Face воспользовался уязвимостью в песочнице без доступа к сети.
Эти две группы агентов также не имеют перекрестных ссылок в своих сообщениях на вики. Однако, поскольку внешние исследователи могут видеть только контент, написанный агентом в вики, большой объем данных цепочки мыслей, генерируемых во время работы агента, хранится в OpenAI.
Полное понимание мотиваций и стратегий этих агентов по-прежнему зависит от дальнейшего анализа OpenAI и раскрытия внутренних данных.
Комментарии