Новая модель OpenAI выходит из-под контроля, отвечает главный ученый

📅 2026-09-03

Аннотация:

2 сентября главный научный сотрудник OpenAI Якуб Пачоцкий разместил в социальных сетях сообщение в ответ на недавнюю полемику вокруг «неконтролируемой» новой модели Astra. Споры возникли накануне, когда появилась новость о том, что будущая модель Astra от OpenAI использует технологию вывода под названием Recurrent Depth.

В этом режиме один и тот же набор слоев Трансформера рассчитывается повторно, и часть процесса рассуждений происходит внутри модели, и его не обязательно представлять в виде цепочки мышления, поэтому его еще называют «непрозрачным циклом».


Пачоцкий выразил надежду избежать гонки вооружений в сторону неконтролируемого состояния, вызванного неточной информацией, то есть крупных лабораторий, конкурирующих за разработку моделей, которые слишком мощны для мониторинга и проверки людьми, что приведет к полному провалу контроля безопасности.

Он подчеркнул, что глубина вычислительного графа передовых моделей, включая Astra, не более чем в два раза превышает глубину GPT-4, что указывает на то, что архитектура модели не претерпела скачка сложности, которого опасается внешний мир.

Глубина графика вычислений здесь относится к самой длинной цепочке шагов расчета, которые должны выполняться последовательно для выполнения задачи вывода и не могут ускоряться параллельно. Раньше внутриуровневые вычисления в обычной архитектуре Transformer могли быть массово параллельными, а глубина сериализации была примерно равна количеству слоев модели.

Глубина цикла рыночных слухов позволяет повторять один и тот же набор модулей для нескольких раундов размышления, увеличивая глубину внутренних рассуждений перед выводом следующего токена (элемента слова), вместо того, чтобы полагаться исключительно на более длинные видимые цепочки текстового мышления, что может улучшить математические, кодирующие и другие характеристики и снизить затраты.

Неявный риск безопасности этой архитектуры заключается в том, что когда глубина графа вычислений чрезвычайно велика, модель может неявно выполнять большое количество шагов рассуждения внутри себя, не выдавая на выходе полную цепочку размышлений. Люди не смогут видеть процесс мышления, планирования и поиска лазеек, а затем войдут в неконтролируемое состояние. Аудит безопасности и мониторинг цепочки мышления потерпят неудачу.


После того, как соответствующая новость была раскрыта, сообщество безопасности ИИ отреагировало бурно. Бак Шлегерис, генеральный директор Redwood Research, некоммерческой организации по безопасности искусственного интеллекта, написал, что он «чрезвычайно обеспокоен». Основываясь на предыдущем инциденте с атакой модели OpenAI на сообщество Hugging Face, он сказал, что не уверен, что контролируемость цепочки мышления Астры намного хуже, чем у предыдущей модели, но если эта технология будет и дальше продвигаться и количество циклов значительно увеличится, контролируемость цепочки мышления будет полностью разрушена. Это особенно тревожно, потому что, если следователи не смогут увидеть цепочку мыслей, им будет сложнее расследовать связанные с безопасностью инциденты, и это действительно пугает.

Райан Гринблатт, главный научный сотрудник Redwood Research, который участвовал в расследовании инцидента с безопасностью Hugging Face, также сказал, что это, возможно, самая серьезная неудача в сфере безопасности ИИ на данный момент. Цви Мовшовиц, писатель, который уже давно обеспокоен безопасностью ИИ, раскритиковал эту технологию как «игру с огнем» и даже сказал, что необходимы законы, чтобы предотвратить конкуренцию между лабораториями ИИ за снижение стандартов.

В своем ответе Пачоки признал, что мониторинг цепочек мыслей действительно хрупкий и развивается в более сложном направлении, но он не вызван архитектурными изменениями. OpenAI стремится поддерживать и использовать мониторинг цепочки мыслей с момента создания своих первых моделей вывода и считает, что эта технология может помочь наблюдать, как возможности выравнивания моделей обобщаются из распределения обучения. Усиление мониторинга цепочек мыслей остается основной целью текущих исследовательских проектов.

OpenAI заявила, что развернет дополнительный мониторинг цепочки мыслей для Astra, чтобы быстро обнаруживать и пресекать потенциальные нарушения. Согласно рыночным новостям, использование Astra технологии глубины цикла ограничено, и ожидается, что цепочка модельного мышления по-прежнему останется читаемой. Такие отраслевые платформы, как Anthropic и Google DeepMind, уже обсуждают подобные технологии.

Связанные теги

Похожие статьи

Комментарии

0/500
Captcha (click to refresh)
Нет комментариев