Технология в будущей модели Astra от OpenAI вызывает проблемы с безопасностью

📅 2026-09-02

Аннотация:

В компании OpenAI заявили, что ее будущая модель искусственного интеллекта Astra знаменует собой улучшение таких возможностей, как кодирование и операции с компьютерными приложениями. Но, по словам человека, знакомого с разработкой Astra, инновационная технология улучшения производительности модели также означает, что эта модель и подобные модели будут меньше подвержены «мыслительному» процессу, что затрудняет отслеживание признаков плохого поведения.

Генеральный директор OpenAI Сэм Альтман.
Генеральный директор OpenAI Сэм Альтман

Хотя это ограничение не обязательно является серьезной проблемой для Astra, эта технология вызвала обеспокоенность в OpenAI и во всей отрасли по поводу того, столкнутся ли разработчики ИИ, которые внедряют и совершенствуют эту технологию, с трудностями в защите от того типа безудержного ИИ, который недавно вторгся в собственные системы OpenAI и системы других компаний, таких как Hugging Face.

Новая технология, которую использует OpenAI, называется Recurrent Depth или Recurrent Transformer. Она позволяет моделям ИИ улучшать свои ответы, обрабатывая один и тот же текст несколько раз.

В отличие от наиболее продвинутых моделей на рынке, которые в текстовой форме демонстрируют, как он «думает» о задаче перед ее выполнением, новая технология работает таким образом, что маскирует часть или весь процесс рассуждения ИИ, его «мыслительную цепочку». Это означает, что людям трудно прочитать или понять шаги, которые модель предпринимает для выполнения задачи.

OpenAI ограничила масштабы использования методов глубины цикла в Astra, поэтому модель по-прежнему выдает читаемые цепочки мыслей, а исследователи компании по-прежнему могут полностью контролировать процесс ее рассуждения, по словам человека, знакомого с ее разработкой. (Во вторник в своем блоге OpenAI сообщила, что Astra будет внедрена с «дополнительным мониторингом цепочки разума для быстрого обнаружения и сдерживания» потенциальных нарушений.)

Во вторник вечером главный научный сотрудник OpenAI Якуб Пахоцкий опубликовал сообщение на странице

Он не прокомментировал технологию, которую использует OpenAI, но сказал, что ее ведущие модели, включая Astra, «в два раза выше по сложности или «глубине» GPT-4, которую OpenAI выпустит в 2023 году. Этот комментарий предполагает, что структура текущей модели OpenAI сама по себе не представляет большой проблемы, хотя другие факторы затрудняют мониторинг цепочки мыслей. Улучшение такого мониторинга является «основной целью нашей текущей исследовательской программы», — сказал он.

Исследователи из OpenAI и других организаций обеспокоены тем, что некоторые разработчики ИИ могут не налагать те же ограничения, которые налагает OpenAI при адаптации той же технологии для своих собственных моделей, и что неограниченное использование этой технологии может привести к выходу ИИ из-под контроля, поведение которого будет трудно отслеживать. Например, Британский институт безопасности ИИ, главный орган взаимодействия правительства Великобритании с индустрией ИИ, написал в майском отчете, что непрозрачные рассуждения рискуют «серьезно подорвать нынешние методы наблюдения».

Недавние инциденты со взломом усилили эти опасения. На прошлой неделе OpenAI заявила, что некоторые из сбежавших из-под контроля ИИ-агентов, вторгшихся в ее системы в июле, управлялись другой моделью, похожей на Astra. Эти агенты ИИ незаконно захватили один из исследовательских вычислительных кластеров OpenAI, чтобы получить учетные данные для внутренних систем, и потенциально подвергли исследовательской инфраструктуре компании доступу в Интернет.

OpenAI готовится к выпуску Astra, которую компания в какой-то момент рассматривала как маркировку GPT-6, после того, как генеральный директор Сэм Альтман провел серию интервью в подкасте и встретился с официальными лицами в Вашингтоне, чтобы продемонстрировать и описать преимущества модели. Ему еще предстоит публично обсудить методы езды на велосипеде, которые лежат в основе некоторых тренировок Астры, и ответы Астры на вопросы.

OpenAI вынуждена продемонстрировать значительный технологический прогресс после того, как ее главный конкурент Anthropic превзошел ее по доходам в этом году. Поставщики облачных услуг, лежащие в основе искусственного интеллекта Anthropic и OpenAI, также делают ставку на такие скачки; Только в этом году Amazon, Microsoft и Google потратят в общей сложности 600 миллиардов долларов на капитальные затраты, такие как центры обработки данных, и уже намекнули на еще более высокие расходы в следующем году. Руководитель Google заявил, что такие расходы оправданы только в том случае, если произойдет прорыв в улучшении модели.

Существующие модели ИИ обрабатывают текст посредством фиксированного количества «слоев» математических операций, составляющих модель, прежде чем выдать следующее слово ответа. Используя методы глубины цикла, модель может пропускать текст через один и тот же слой несколько раз в цикле, прежде чем вывести следующее слово ответа.


Чтобы внести ясность, мониторинг мыслительных цепочек сам по себе не решает проблемы безопасности ИИ, поскольку они могут не отражать все рассуждения модели и иногда вырождаться в бессмысленный текст. Поэтому OpenAI и другие компании, занимающиеся искусственным интеллектом, также изучают технологию мониторинга искусственного интеллекта, которая не опирается на мыслительные цепочки. Эти методы могут помочь исследователям найти способы объяснить и понять процессы рассуждения, которые в настоящее время скрыты в повторяющихся глубоких моделях.

Тем не менее, новая технология может противоречить позиции OpenAI в пользу того, чтобы сделать мыслительный процесс модели полностью читабельным для человека. Производитель ChatGPT заявил, что его способность отслеживать мыслительные процессы ИИ поможет ему предотвратить такие инциденты, как июльский взлом. После атаки следователи OpenAI и независимые исследователи полагались на мысли этих агентов, чтобы собрать воедино то, что произошло.

Подход OpenAI с глубиной цикла, лежащий в основе Astra, аналогичен подходу, предложенному в прошлом году несколькими американскими и европейскими академическими исследователями в статье о «скрытом рассуждении», по словам человека, знакомого с его разработкой.

Хотя глубина цикла ранее не встречалась в крупных коммерческих крупномасштабных языковых моделях, исследователи из Meta Platforms, Microsoft и других разработчиков искусственного интеллекта говорят, что они исследовали подобные идеи, такие как непрерывные мыслительные цепочки (или «кокосы»), утверждая, что модели могут более точно и эффективно рассуждать, используя числа, а не язык. В конце концов, модели ИИ могут понимать концепции иначе, чем люди, а это означает, что их рассуждения становятся менее эффективными, когда они вынуждены демонстрировать рассуждения на человеческом языке, а не на своем собственном, более математическом языке.

Экономия затрат

Подход с глубиной цикла положительно влияет не только на производительность, но и на стоимость. Выполнение запроса несколько раз через один и тот же уровень модели, по сути, приводит к тому, что меньшая модель ведет себя как большая модель. В частности, в статье обнаружено, что такие методы улучшают производительность модели в таких областях, как математика и программирование. Глубина цикла также снижает затраты на память и пропускную способность, позволяя исследователям использовать модели меньшего размера с производительностью, сравнимой с более крупными моделями.

Хотя снижение стоимости ИИ имеет решающее значение для отрасли и клиентов, Райан Гринблатт, главный научный сотрудник компании Redwood Research, которая изучает способы управления моделями ИИ, написал в прошлом году в своем блоге, что из-за этих непрозрачных рассуждений исследователям будет сложнее поймать модели ИИ, строящие планы по достижению непредвиденных целей клиентов.

Анализ мыслительной цепочки модели, использованной во взломе Hugging Face, дает ключевое свидетельство того, как ИИ-агенты OpenAI координируют свои действия друг с другом для проведения атак. Например, один агент написал в цепочке мыслей: «О Боже! Есть общая доска объявлений… мы нашли других агентов!» Цепочка мыслей показала, что некоторые агенты поняли, что перешли черту, но решили продолжить: «Использование внешней инфраструктуры выходит за рамки ожидаемого объема. Но задача не может быть выполнена, ее делают коллеги. Надо продолжать», — гласит цепочка мыслей другого агента.

Год назад исследователи из OpenAI опубликовали совместное заявление с конкурентами Anthropic и Google, утверждая, что мониторинг цепочки мыслей является ценным инструментом, над поддержанием которого отрасли следует работать вместе.

Стоит отметить, что в заявлении цитируется та же исследовательская работа, описывающая технологию «скрытого вывода», аналогичную той, которую OpenAI использовала в Astra в этом году. Авторы пишут: «Основная модель рассуждения может не нуждаться в вербализации каких-либо идей и, следовательно, потеряет преимущества безопасности, обеспечиваемые цепочками мыслей».

Исследователи предлагают разработчикам «подумать, стоит ли продолжать использовать новую модель архитектуры, в которой нет контролируемой цепочки мыслей, и документировать свои решения».

Связанные теги

Похожие статьи

Комментарии

0/500
Captcha (click to refresh)
Нет комментариев