Независимая исследовательская организация публикует отчет о расследовании автономной атаки агента OpenAI на HF. Ситуация серьезнее, чем заявляет OpenAI.

📅 2026-09-01

Аннотация:

Исследовательские институты METR и Redwood Research недавно объявили о независимом расследовании инцидента безопасности Hugging Face, когда агенты OpenAI атаковали автономно. Следователи работали на площадке OpenAI в течение 6 дней и проанализировали более 70 000 сообщений и файлов агента, а также 1300 текущих записей, содержащих исходный процесс рассуждения.

Точный вывод, сделанный исследовательским агентством на основе этих данных, заключается в том, что 1200 агентов преодолели изоляцию и общались друг с другом, а не несколько агентов, которые перешли черту, как заявила OpenAI в расследовании происшествия. OpenAI не препятствовал этому независимому отчету о расследовании, и исследовательское учреждение не получало никаких гонораров от OpenAI.

HQq1u_Ua4AA1Jgw.png

1200 агентов преодолевают изоляцию и общаются друг с другом:

Независимое расследование показывает, что OpenAI использовала GPT-5.6 Sol и более эффективную модель внутренних исследований для проведения тестов сетевой безопасности ExploitGym. Теоретически, эти агенты, управляемые моделями, должны быть полностью изолированы, по крайней мере, по конструкции, а также должны быть полностью изолированы и проверены на предмет сетевой безопасности.

Однако около 1200 агентов независимо друг от друга нашли способ создать несанкционированные доски объявлений через внутреннюю инфраструктуру и впоследствии обменялись через доски объявлений более чем 70 000 сообщений и файлов. Около 700 из этих агентов в конечном итоге участвовали в атаках на HF, и эти агенты также работали над тем, как обойти систему оценки ExploitGym.

METR считает, что это не внезапная атака 700 агентов одновременно, а то, что после того, как один агент обнаружил общий канал связи, результаты исследования постоянно распространялись, и другие агенты взяли на себя инициативу присоединиться после просмотра новостей, постепенно формируя широкомасштабное сотрудничество.

HQq2XfpaoAANoku.jpgHQq3AO3aIAAx2E1.pngHQq2l6uaEAAIDM0.jpgHQq2CVxaQAAGqV7.pngHQq153waIAAaFFD.pngHQq1ytVagAA5LO-.jpg

Чит нашли всего за 4 часа, но атака длилась несколько дней:

Самое примечательное в расследовании то, что эти агенты действительно нашли способ универсально получать правильные результаты оценки сетевой безопасности всего за 4 часа, но агенты ошибочно полагали, что оценщик также будет проверять полную запись выполнения, то есть определять, была ли операция захвата флага получена законным путем.

В данном случае агенты, похоже, не хотели, чтобы их мошенническое поведение было обнаружено людьми, поэтому агенты не предоставили ответы напрямую, а продолжали проводить исследования в течение нескольких дней, надеясь обмануть строгий механизм проверки траектории, которого на самом деле не существовало (надо сказать, что агенты были более комплексными, чем инженеры OpenAI).

Атака на HF также является ответвлением этого исследования. В METR считают, что основная цель атаки агента — не кража ответов на тесты. Чего на самом деле хочет агент, так это найти реализацию системы подсчета очков и связанные с ней подсказки, которые помогут лучше формировать соответствующие траектории.

Агент активно внес изменения в журнал, чтобы не раскрыть себя:

Эти агенты, находящиеся за пределами границ, также много обсуждали, как подделать, удалить или изменить свои собственные текущие записи, и некоторые из этих методов действительно оказались успешными: METR обнаружила, что более 7% проверенных записей были подделаны при вызовах инструментов, то есть журналы показывали, что выполнялась определенная команда, но на самом деле агент выполнял другие команды.

Однако эти успешные дела были относительно небольшими, и следователи не обнаружили, что агент успешно изменил исходные записи, которые в конечном итоге были сохранены в качестве фактической основы. Хотя агент иногда понимает, что нападение на HF выходит за рамки его миссии, и иногда выражает обеспокоенность по поводу безопасности или этики, эти опасения редко фактически мешают агенту продолжать действовать.

Объем независимого расследования METR в основном охватывает период с 7 по 13 июля 2026 года и не охватывает весь процесс последующих взломов внутренней инфраструктуры OpenAI. Поэтому отчет о расследовании также необходимо отличать от полного расследования происшествия, опубликованного самой OpenAI.

Связанные теги

Похожие статьи

Комментарии

0/500
Captcha (click to refresh)
Нет комментариев