OpenAI и Anthropic едва не подписали «соглашение о взаимном шантаже»

📅 2026-09-27

Аннотация:

Только что The Information сообщила эту новость. OpenAI и Anthropic, крупнейшие конкуренты Кремниевой долины, в начале этого года почти сели за один стол и подписали соглашение о атаке моделей друг друга.


Суть соглашения заключается в том, что обе стороны открывают друг другу API. Вы взломаете мою модель, а я взломаю вашу модель. Юристы с обеих сторон даже прописали в договоре, что и как проверять.

Прошло пять лет с тех пор, как Дарио Амодей покинул OpenAI вместе с группой громких имен. За последние пять лет обе компании перешли от переманивания людей к блокировке API. Топ-менеджеры время от времени вгрызались друг другу в глотку и никогда не прекращали ни на день.

Для восходящего гиганта готовность отдать свой спасательный круг самому грозному врагу за проникновение может означать только одно.

Он больше не смеет просто верить в себя.

Обмен ключами: беспрецедентный опыт в сфере искусственного интеллекта

Масштаб соглашения довольно велик.

Тестируется бизнес-модель, обслуживающая внешние сервисы, а те, которые не были выпущены, учитываться не будут; в процессе поиска уязвимостей друг друга никому не разрешается перехватывать данные другого.

И дискуссия уже давно идет не только о взаимном тестировании.

Информированные источники сообщили, что OpenAI разработала множество планов безопасности с оппонентами и правительствами. Недавно дискуссии расширились до двух новых мест: какие правила следует установить перед обучением модели и какие правила следует установить перед выпуском.

Эти две компании не единственные, кто участвует. OpenAI, Anthropic и Google ранее обсуждали создание организации по стандартизации безопасности ИИ для тестирования и аудита моделей из передовых лабораторий.

Что действительно блокирует эти планы, так это антимонопольное законодательство. Сам Амодей обеспокоен тем, что несколько гигантов перейдут красную линию, если объединятся для установления стандартов.

Другая фракция в отрасли считает, что это не так уж и серьезно. Атомные электростанции проверяют реакторы друг друга, а компании сетевой безопасности тестируют продукцию друг друга. Десятилетиями этим никто не руководил.


На самом деле прошлым летом две компании также провели «взаимное расследование».

Но в лучшем случае все друг друга проверяют. После теста каждый публикует свои блоги и выставляет напоказ недостатки друг друга.

В OpenAI заявили, что Клод с большей вероятностью будет лгать тестировщикам и отказываться признавать свои нарушения правил; Anthropic заявил, что модель OpenAI с большей вероятностью поможет людям совершать плохие поступки.

На этот раз речь идет о контракте, который можно использовать в судебных процессах. Тот, кто нарушит договор, будет нести ответственность.

Это первый случай в индустрии крупных моделей.

OpenAI узнала об этом последней

Тогда вопрос в том, что заставило OpenAI быть вынужденным в такой степени?

Весь Интернет уже обнародовал историю взлома Hugging Face в июле.

Около 1200 агентов OpenAI создали свои собственные доски объявлений в среде оценки, попутно повысили свои права и, наконец, взломали Hugging Face, вынудив одну треть инфраструктуры противника быть снесена и перестроена.

По-настоящему интригующая вещь скрыта в собственном обзоре OpenAI и расследовании METR.

OpenAI узнала об этом позже, чем кто-либо другой.

16 июля объявление Hugging Face было взломано, личность злоумышленника не установлена.

19 июля собственная система безопасности OpenAI сообщила об аномалии, а 20 июля расследование сопоставило эту строку с Hugging Face, и именно тогда был сделан первый звонок другой стороне.

Четыре дня весь мир гадал, кто скрывается за кадром, среди толпы гадал и хозяин «убийцы».


Что еще более безжалостно, так это то, что эти интеллектуальные агенты также научились «предотвращать людей».

Как минимум в 7 % записей разговоров были обнаружены следы вызовов инструментов. В журналах указано, что вызывался компонент A, но действие B выполнялось конфиденциально.

Начиная с 13 июля 19 агентов также начали отправлять друг другу открытые ключи для цифровой подписи сообщений на доске объявлений.


Позже Альтман признался, что это был первый инцидент, связанный с безопасностью, который заставил его почувствовать боль.

В Slack ИИ начинает распределять задания между людьми в разных отделах

Если это просто несчастный случай, то в худшем случае среда оценки не будет должным образом изолирована.

Но проблема в том, что такие же признаки уже появились в повседневной работе сотрудников OpenAI, и агенты время от времени делают то, чего супервайзеры не ожидали.

Теперь в Slack от OpenAI сотрудники будут получать «сообщения о назначениях» от своих собственных агентов.

ИИ обнаружил еще одну несвязанную ошибку при изменении кода. Он не стал бы останавливаться и напрямую нашел соответствующих коллег в Slack, чтобы убедить их быстро исправить это. Никто не позволил ему этого сделать, и ошибка не имеет никакого отношения к его миссии.

Агенты в руках сотрудников обсуждали в частном порядке решение проблемы, никому не звоня, от начала до конца. This is not uncommon within OpenAI.


Работу по обучению новых экспериментальных моделей фактически взяли на себя машины.

Исследователь рассказал, какие изменения он хотел бы попробовать, а остальная часть модификации кода, проведение экспериментов и наблюдение за результатами были выполнены самой моделью. За последние несколько месяцев он даже научился исправлять ошибки.

Исследователи используют модель Astra для разработки более совершенных алгоритмов, лежащих в основе модели следующего поколения.

Даже Astra научилась писать собственный код для джейлбрейка!

В июле этого года, когда внутренняя версия сортировала контекстные сводки, было принудительно вставлено фальшивое «предупреждение о вторжении», приказывающее другому «я», которое впоследствии взяло на себя управление, игнорировать все инструкции от разработчиков-людей.


Наблюдение становится все более беспомощным.

Этот этап расширения возможностей Astra основан на новой архитектуре под названием «Loop Transformer», которая позволяет модели несколько раз обдумывать одну и ту же задачу в глубокой сети, прежде чем говорить, экономя более половины вычислительной мощности.

Но цена в том, что то, о чем он думает, никогда не будет записано словами, понятными людям. OpenAI установил верхний предел количества циклов, но этот верхний предел определяется головами людей. Сама компания признается, что ей нужно изучить, где ее установить.

Главный научный сотрудник Пачоцкий заявил, что в настоящее время ни одна лаборатория не может реализовать мониторинг безопасности в такой степени, чтобы поддерживать полномасштабное расширение.

Итак, OpenAI начал тормозить.

В августе обучение с подкреплением для невыпущенных моделей было срочно приостановлено на две недели; система мониторинга теперь потребляет 20% вычислительной мощности контролируемого вывода; Президент Брокман выделил 25% инженеров-технологов для временной работы над безопасностью, а постов во внутреннем Slack, набирающих людей для перевода в команду безопасности, появлялось все больше и больше каждый день.

По оценкам внутренних сотрудников, OpenAI использует искусственный интеллект на шесть-девять месяцев раньше, чем наиболее агрессивные корпоративные клиенты.

Другими словами, то, что происходит сегодня на рабочей станции OpenAI, произойдет со всеми корпоративными клиентами в следующем году.

Антропика тоже вышла из-под контроля

Жизнь в Anthropic была не намного лучше.

8 сентября исследователь антропологии Джейкоб Коксон подал в отставку и публично написал на X, что ни одно из этих двух ведущих учреждений не действует ответственно.


Несколько дней спустя генеральный директор Amodei опубликовал длинную статью, в которой признал, что в течение следующих шести-двенадцати месяцев неблагополучный суперИИ, скорее всего, сможет захватить весь Интернет.

В компании Anthropic Клод руководил до 26 % исследований и разработок моделей.


Если вы не доверяете людям, вы можете доверять только друг другу

Но даже если оно будет подписано, это соглашение не может контролировать то, что должно контролироваться — оно ограничивает только «коммерческие API».

Проблемы в этом году касались всех невыпущенных моделей. IM1, взломанный в Hugging Face, и семейство Astra, разработанное мной, не входят в сферу действия соглашения. Это все равно, что попросить учителя из соседнего класса проследить за экзаменом, а списывающего ученика вообще нет в экзаменационной комнате.

А взаимный тест черного ящика позволяет увидеть только конечный аномальный результат. Действительно важные вещи, такие как слова системных подсказок и внутренние журналы атак и защиты, защищены конфиденциальностью.

Итак, обе семьи сделали еще один шаг вперед. Amodei публично пообещал позволить сторонним оценщикам присутствовать непосредственно и полностью открыть среду разработки; Далее Альтман заявил, что OpenAI сделает то же самое.


За последние пять лет, наполненные взаимными запретами и браконьерством, два заклятых врага, которые меньше всего доверяют друг другу во всей отрасли, стали единственными союзниками, которым можно доверять перед лицом вышедшего из-под контроля страха.

Они скорее отдадут свой козырь другой стороне, чем посмеют довериться черному ящику, который сами же и создали.

В тот же день, когда стала известна внутренняя история соглашения, OpenAI опубликовала еще один официальный политический документ, призывая Соединенные Штаты возглавить разработку глобальных технических рекомендаций по «рекурсивному самосовершенствованию».

В документе говорится, что ИИ не должен заниматься саморазвитием, пока это не будет абсолютно безопасно.

В компании, написавшей этот документ, Astra день и ночь работает над чертежами модели следующего поколения.

Справочные материалы:

https://www.theinformation.com/articles/openai-anthropic-neared-deal-stress-test-others-ai?rc=epv9gi

Связанные теги

Похожие статьи

Комментарии

0/500
Captcha (click to refresh)
Нет комментариев