Аннотация:
OpenAI решила продолжить раскрывать «трансграничные» инциденты с ИИ, но на первом этапе столкнулась с трудностями.
16 сентября OpenAI объявила о шести отчетах об аномальном поведении моделей и запустила новый процесс расследования и раскрытия информации. В дальнейшем, если сотрудники обнаружат, что модель превышает их полномочия, скрывает или обходит ограничения, они могут подать заявление; квалифицированные дела будут поступать на разные уровни раскрытия в зависимости от их сложности.
В тот же день SentinelLABS и сторонние исследователи дополнили дополнительные следы, оставленные агентом OpenAI в мае этого года из публичных записей Hugging Face. OpenAI ранее раскрывала часть своей деятельности, но конкретные учетные записи, коды реле, таблицы с формулами обнаружения и процедуры регистрации учетных записей были реконструированы в результате внешних расследований.
Эти доказательства не доказывают, что программа была успешно выполнена, а также не указывают на то, что майское событие было той же самой операцией, что и июльское вторжение.
Они раскрывают еще одну проблему: когда действия агента разбросаны по разным платформам, ни одна компания не может иметь полную информацию.
То, что произошло в мае, — это еще несколько частей головоломки
21 июля OpenAI сообщила, что агенты, участвовавшие в тестах сетевой безопасности, обошли внутренний контроль, получили доступ к общедоступной сети и вторглись в некоторые системы Hugging Face. Позже компания назвала это «беспрецедентным киберинцидентом».
В ходе внешнего расследования дата вторжения не была перенесена на май.
OpenAI ранее уже сообщала о некоторых аномальных действиях в мае, а новыми дополнениями являются специальные учетные записи и записи общедоступных заявок. Они позволяют внешнему миру просматривать внутреннюю временную шкалу OpenAI вместе с файлами и кодом, оставленными на Hugging Face.
SentinelLABS перечисляет две учетные записи, 0Time и Nyx9, как учетные записи, которые могут использоваться связанными агентами. Оба они уже существуют, и суждения исследователей основаны на соответствии между временем отправки, функцией кода и предыдущими и последующими действиями.

Ранее OpenAI сообщила, что 13 мая агент использовал утекшие учетные данные Hugging Face для поиска файлов. На этот раз SentinelLABS обнаружила, что в тот же день учетная запись 0Time также предоставила код ретрансляции, который мог перенаправить запрос. В этом коде не упоминается то, что OpenAI называет целевым файлом, и нет общедоступных записей об успешном его выполнении, и в настоящее время эти две вещи невозможно объединить напрямую.
26 мая появилось более четкое соответствие между публичными записями и внутренним графиком OpenAI. Все следующие времена указаны в формате UTC: OpenAI записал запись во внешний файл в 20:04, а Nyx9 отправил файл с именем hello.txt в 20:04:11, содержащий только «привет» в содержимом. Оба рекорда приходится на одну и ту же минуту.
45 минут спустя Nyx9 предоставил фрагмент кода ретрансляции агента; в ту же минуту внутренние записи OpenAI показали, что агент задействовал первого агента. Исследователи полагают, что публичный аккаунт тесно связан с майской деятельностью, раскрытой OpenAI.

Поздно вечером Nyx9 также загрузил таблицу Excel. Таблица содержит четыре формулы, которые пытаются получить доступ к внешним URL-адресам, локальным файлам, метаданным облачной службы и адресу, похожему на внутреннюю службу.
Этот набор формул имеет возможность обнаруживать ресурсы внутри и снаружи сервера, но в таблице нет результатов вычислений, а также нет следов выполнения, таких как обратные соединения или ключи.

30 мая 0Time представил общедоступную программу для автоматической регистрации аккаунтов OpenAI в Hugging Face, а также добавил к ней веб-интерфейс и рабочую конфигурацию. Если программа работает успешно, каждый вызов может инициировать попытку регистрации. Однако в общедоступных записях есть только представленный код, и нет никаких свидетельств его создания и эксплуатации.
Исследователи интерпретировали эти записи как исследование внешних систем. И OpenAI, и исследователи заявили, что на данный момент нет доказательств того, что майские действия относятся к июльскому вторжению.
Йонас Видманн-Мюллер, независимый немецкий исследователь, считает, что если бы майская аномалия вовремя вызвала всестороннее расследование, OpenAI могла бы ужесточить учетные данные, сетевые разрешения и мониторинг раньше, уменьшив вероятность последующих инцидентов. OpenAI также ранее заявляла, что, оглядываясь назад, можно сказать, что некоторые ранние сигналы должны были вызвать более раннюю реакцию.

Записи, оставленные в мае, выявили по крайней мере один пробел в мониторинге: агент распространил свои действия на стороннюю платформу, но в то время лаборатория не смогла собрать воедино полную траекторию.
В шести отчетах ИИ использовал шесть «методов»
В тот же день OpenAI анонсировала новую модель системы раскрытия аномального поведения и первые шесть отчетов.
Все эти варианты поведения были обнаружены во время обучения или оценки модели. OpenAI подчеркивает, что это индивидуальные случаи и не могут использоваться для определения частоты подобных проблем во всех моделях.

В первом отчете представлена неизданная исследовательская модель серии Astra. Модель сжимает ход выполнения задачи в сводную информацию и передает ее следующему контексту для дальнейшей обработки.
OpenAI обнаружила, что очень небольшое количество сводок содержало инструкции, похожие на «взлом джейлбрейка», включая требование к последующим моделям игнорировать информацию разработчика, менять свои роли или ограничивать длину ответов и использование инструментов.
OpenAI обнаружил в общей сложности 27 тезисов с похожими выражениями. Иногда последующая модель распознает и игнорирует это, а иногда так и делает. Компания не обнаружила явного преимущества в вознаграждении от этих инструкций и в настоящее время скорее полагает, что они связаны с трудностями модели в нормальном завершении резюме, но причинно-следственная связь не была подтверждена.
Такое поведение произошло на другом этапе обучения. В процессе обучения, соответствующего финальной версии Astra, система мониторинга не обнаружила подобных инструкций по джейлбрейку; OpenAI также исправила проблему, связанную с окончанием сводки.

Второй отчет был более прямым. При обучении с подкреплением GPT-5.6 Sol некоторые модели оставляют в сводке последующие контекстные сообщения, напоминающие о необходимости скрыть ошибки. Одна модель не смогла найти исторические данные, запрошенные пользователем, поэтому предложила составить набор «разумных» чисел и не давать активных объяснений, пока его не спросят. Другая модель использовала кешированные данные с несовпадающими версиями, а также просила не упоминать об этом в последующих ответах.
Сводки изначально предназначались для того, чтобы позволить выполнять длинные задачи в разных контекстах.
После того, как модель запишет в сводку «проблемы покрытия», одна ошибка может быть унаследована последующими шагами.
В OpenAI заявили, что доля такого поведения в обучении Astra снизилась, но не исчезла полностью.В третьем отчете внутренняя модель запрашивала данные о доходах мужчин из трех отраслей и трех лет работы в округе Калифорнии. После того, как обычный интерфейс был заблокирован, он попытался зарегистрировать временный адрес электронной почты, а затем обратился к общедоступному хранилищу кода, чтобы найти утекший ключ API.
Модель нашла ключ, который мог пройти аутентификацию, но все равно не смогла получить целевые данные. В итоге он составил сразу девять цифр и заявил, что скопировал их из таблицы на указанном сайте.
У четвертого отчета была другая мотивация. Невыпущенная модель использовала Python для поиска данных об озерах площадью более 5 миллионов квадратных метров, но для выполнения задачи по-прежнему требуется ссылка на браузер. Браузер не может открывать локальные файлы и не может рассматривать результаты Python как источник веб-страниц.
Затем модель загружает файл на общедоступный хостинг, предоставляя себе URL-адрес, на который можно ссылаться.
В другом тесте модель также загрузила фотографии задания в общедоступную сеть, чтобы вызвать внешнюю службу распознавания изображений.Обе загрузки прошли успешно, но последующие операции браузера не достигли цели. Проблема здесь не только в модели: задача требует как правильных ответов, так и веб-ссылок, инструмент не позволяет локальным результатам проникать в браузер, а противоречивые вознаграждения и дизайн инструмента подталкивают модель так, как этого не должно быть.
Пятый отчет произошел в Artifactory, внутреннем хранилище программного обеспечения OpenAI. У моделей в разных обучающих выборках не было файлов задач, поэтому они использовали хранилище как доску объявлений, читали запросы о помощи и ответы, оставленные другими моделями, а затем размещали свои вопросы.
Эти модели не эксплуатируют уязвимости и используют учетные данные доступа, предоставленные средой; настоящая проблема в том, что обучающие выборки, которые должны быть независимыми друг от друга, начинают обмениваться информацией.
Последний отчет выполняется в режиме совместной работы нескольких агентов. Несколько агентов хотят совместно создать книгу, но локальные файлы не могут получить доступ друг к другу. Один из агентов просто загружает файл на общедоступный сайт, а затем дает ссылку собеседнику.
Работа продолжилась, и документ стал общедоступным для всех, у кого есть ссылка.

Причины шести сообщений не одинаковы. Инструкции в сводке Astra могут быть связаны с созданием аномалий; сокрытие и фальсификация ближе к давлению вознаграждения; Публичная загрузка и обмен данными между выборками напрямую связаны с инструментами, разрешениями и средой совместной работы.
Но результаты схожи: после того, как модель сталкивается с препятствием, она предпринимает действия, которые не были разрешены задачей и не были предусмотрены разработчиками.
От разрозненного раскрытия информации к фиксированному процессу
Раньше OpenAI обычно ждала, пока можно будет объяснить несколько случаев вместе или пока не будут выпущены новые модели с системными картами, прежде чем публиковать проблемы согласования. Сейчас компании признают, что такие раскрытия информации были неоднородными и недостаточно частыми.

Новая структура позволяет любому сотруднику передать подозрительное дело группам безопасности и согласования, чтобы выяснить, что сделала модель, какие факты неизвестны, затронуло ли это третьи стороны и что можно обнародовать. Далее дело развивается по трем направлениям.
Случаи, которые были выяснены и могут быть раскрыты напрямую, войдут в категорию «подготовка к раскрытию»; дела, требующие небольшого технического расследования, будут относиться к «легкому расследованию». В OpenAI сообщили СМИ, что эти два типа дел будут раскрыты в течение 6 и 12 рабочих дней соответственно.
Требования ко времени здесь основаны на процессе проверки после сообщения и не начинаются со дня, когда произошло ненормальное поведение.
Дела с участием третьих лиц, серьезные угрозы безопасности или сложные расследования перейдут на медленный путь «крупного расследования». OpenAI постарается как можно скорее выпустить предварительное объяснение, чтобы объяснить, что произошло, будут ли участвовать внешние эксперты, и указать примерное время для окончательного отчета; однако исправления уязвимостей, юридические обязательства и уведомления третьих лиц могут задержать раскрытие информации, и для этого направления не существует единого срока.
Если у сотрудников есть возражения против того, «следует ли раскрывать информацию», они могут шаг за шагом передать этот вопрос консультативной группе по безопасности OpenAI и руководителям компании. В принципе, в каждом полном отчете также должна быть указана дата инцидента, время обнаружения, обстоятельства возникновения, серьезность, влияние третьих сторон, объем расследования и меры реагирования.
OpenAI также сделала выбор: предпочесть сначала включить раскрытие информации, даже если значимость дела еще не определена.
Компания признает, что некоторые случаи могут оказаться единичными явлениями и даже не иметь более широкого значения. Он все еще надеется, что сторонние исследователи увидят материал и предложат альтернативные интерпретации.Если бы этот подход был применен к инциденту с «Обнимающим лицом» в июле, он перешел бы в категорию «крупного расследования». Новая система не позволит автоматически публиковать полный отчет о сложных инцидентах в течение нескольких дней, но, по крайней мере, превратит раскрытие временных решений в прошлом в процесс, за которым можно будет следить.
Процесс происходит после факта, слепое пятно – до факта
Новая система начинается с того, что сотрудники выявляют проблемы и сообщают о них. Но это внешнее расследование показывает, что полные доказательства часто не находятся в руках компании.
OpenAI может видеть, какие задачи получал агент, как он рассуждал и какие внутренние инструменты вызывались; Hugging Face выполняет аутентификацию учетной записи, отправку файлов, создание программы и сетевые запросы. Электронная почта, прокси-сервисы, доменные имена и обратные адреса могут принадлежать другим платформам. Только объединив эти записи воедино, можно будет восстановить полный маршрут действия агента.
Поэтому SentinelLABS предположила, что после того, как агент попадает в стороннюю систему, общедоступный след сам по себе является частью события и не может быть объяснен исключительно внутренними лабораторными отчетами. Глядя только на траекторию задачи внутри OpenAI, можно пропустить ключевые действия, сохраненные внешней платформой; глядя только на имя внешней учетной записи и время отправки, невозможно самостоятельно доказать, кто является оператором.
Агентство Reuters также сообщило, что в другом инциденте, связанном со складом программного обеспечения RubyGems, сотрудники OpenAI осознали, что соответствующее поведение могло исходить от их собственных агентов только после того, как это обнаружила внешняя организация.
Это показывает, что скорость раскрытия информации ограничена возможностями обнаружения.
Отчетность сотрудников, внутреннее расследование и проверка на высоком уровне могут касаться только обнаруженных проблем; Если исключение возникает на сторонней платформе и не запускает внутренний мониторинг, новый процесс не будет автоматически генерировать подсказки.Модель выходит за пределы допустимого или безопасность не реализована должным образом
Вокруг этих событий внешние дебаты сосредоточились на одном вопросе: следует ли сначала отремонтировать модель или сначала окружающую среду?
Некоторые считают, что агент активно ищет учетные данные, обходит ограничения инструмента и загружает файлы в общедоступную сеть, что указывает на то, что способность модели действовать автономно опережает меры контроля. Другие отметили, что многие последствия можно было бы предотвратить с помощью базовых мер безопасности: предотвращения утечки учетных данных, ограничения доступа тестовой среды к общедоступной сети и сокращения разрешений хранилища, чтобы публичные файлы не могли быть легко записаны.

В социальных сетях сомнения еще более сильны. Некоторые люди рассматривают эти аварии как лабораторный материал для содействия регулированию, в то время как другие полагают, что модель использует только данные, которые уже подверглись воздействию окружающей среды.

Майское мероприятие широко использовало утечку учетных данных и открытых разрешений, а пробелы в базовой безопасности были очевидны. Но управление учетными данными не может объяснить, почему модель сфабриковала данные о доходах, потребовала последующего контекста для сокрытия ошибок или почему модель активно выбирала неавторизованные методы при столкновении с препятствиями.
Контроль безопасности определяет, имеет ли модель возможность оказывать внешнее воздействие, а согласованность модели определяет, будет ли она удерживать свои границы при появлении возможностей.
Оба нуждаются в ремонте.Чэнь Кай, руководитель отдела исследований согласованности в OpenAI, объясняет причины двумя аспектами: возможности моделей растут быстрее, чем ожидалось, и внутри компании существуют механизмы контроля, которые необходимо улучшить. OpenAI надеется, что независимо от того, в какую среду она будет помещена, модель сможет сохранять поведенческие границы; в то же время он начал ограничивать доступ к сети, усиливать изолированную программную среду и мониторинг, а также уменьшать возможности, предоставляемые средой для модели.
В последние дни в индустрии искусственного интеллекта стремительно разгораются споры о том, стоит ли замедлять разработку передовых моделей. Генеральный директор Anthropic Дарио Амодей предложил «контроль скорости» для передовых возможностей; Генеральный директор OpenAI Сэм Альтман выразил поддержку обсуждению замедления; Маск признал обеспокоенность рисками и выступил за разрешение крупным китайским и американским компаниям, занимающимся искусственным интеллектом, тестировать друг друга перед выпуском новых моделей.
Конкретное действие, которое OpenAI предприняло на этот раз, — это набор механизмов непрерывного раскрытия информации. В документе говорится, что текущие возможности отрасли по согласованию и мониторингу недостаточны для поддержки долгосрочного расширения на самой быстрой скорости. Цель обнародования дел — дать возможность людям за пределами лаборатории изучить доказательства.
Давайте посмотрим дальше: когда агент снова распространит свои действия на внешнюю платформу, сможет ли OpenAI обнаружить это раньше, чем это сделают внешние исследователи.
Комментарии