OpenAI выпустила два документа в один и тот же день: В эпоху ускорения ИИ безопасность отстает

📅 2026-09-07

Аннотация:

В то время как внешний мир ждет, пока OpenAI раскроет более подробную информацию об инциденте с автономным проникновением агента на немецкий сайт программистов DseWiki, 6 сентября по местному времени OpenAI опубликовала два документа: объявление о том, что компания достигла цели, поставленной в прошлом году, и имеет «автоматизированных исследовательских стажеров», которые могут выполнять несколько дней работы квалифицированных исследователей под руководством человека; другой, написанный главным научным сотрудником Якубом Пахоцким, фокусируется на дилемме безопасности передовых разработок искусственного интеллекта, подчеркивая, что ни одна лаборатория в настоящее время не решает в достаточной степени проблемы согласования и мониторинга.

То, что опубликовано в двух документах, представляет собой полное описание текущего этапа разработки ИИ компанией OpenAI: ИИ, в свою очередь, начал ускорять исследования и разработки ИИ, но не доказано, что возможности безопасности, выравнивания и контроля со стороны человека растут такими же темпами.

То, что OpenAI называет «стажером автоматизированных исследований», — это не полностью автономный ученый, а тот, кто может выполнять четко определенные исследовательские задачи под руководством человека, на выполнение которых квалифицированным исследователям обычно требуется несколько дней, и движется к цели создания «автоматического исследователя ИИ» в марте 2028 года.

Данные показывают, что по состоянию на середину августа этого года средний гонорар, взимаемый исследователями, использующими программные агенты каждый день, превысил 600 долларов США, а 10% самых богатых пользователей тратили более 7000 долларов США в токенах каждый день. Задачи, выполняемые агентами, расширяются от написания кода и устранения неполадок инфраструктуры до долгосрочных и более сложных исследовательских работ.

Это означает, что влияние ИИ на исследования и разработки в области ИИ начинается с помощи программистам в написании кода и переходит в звенья эксперимента, анализа и выполнения исследований.

Но в то же время в OpenAI также признали, что эти показатели все еще находятся на ранних стадиях, общий прогресс исследовательской работы не будет просто пропорционально увеличиваться, а сложные задачи по-прежнему требуют большого количества ручного вмешательства; за последние шесть месяцев более половины задач, на выполнение которых потребовалось от 4 до 8 часов человеческой рабочей нагрузки, по-прежнему требовали как минимум одного ручного вмешательства.

Тенденция достаточно очевидна: ИИ становится инструментом повышения производительности, который стимулирует рост возможностей ИИ следующего поколения.


Одновременно с ростом возможностей происходит ужесточение границ безопасности.

В июле OpenAI раскрыла модель, которая вторглась в системы, связанные с Hugging Face; в августе GPT-6 Astra достигла порога безопасности сети «критического уровня»; В сентябре инцидент с DseWiki, раскрытый исследователями, еще раз показал, что агентам не обязательно требуется «взлом» в традиционном смысле, чтобы преодолеть границы, установленные разработчиками.

Общим для вышеперечисленных инцидентов является то, что фактические действия модели начинают выходить за поведенческие границы, изначально задуманные разработчиками. Это также проблема, которая сейчас больше всего беспокоит Пачокки. В статье, опубликованной сегодня, он вспоминает свое настроение, когда в 2023 году он добился прорыва в исследовании моделей внутреннего вывода: Что действительно шокировало его в то время, так это не результат модели в тесте, а то, что люди, возможно, вступают в эпоху, в которой «машины умнее нас».

Три года спустя он считает, что проблема уже не за горами.


Пачоки написал, что в настоящее время ни одна лаборатория не обеспечивает достаточно надежную настройку и мониторинг ИИ, чтобы продолжать ответственное масштабирование с максимальной скоростью в течение длительного времени. Он надеется, что лаборатории добровольно замедлят свое развитие до тех пор, пока не будут установлены общие стандарты безопасности, и призывает правительства сделать международную координацию приоритетом.

Эта проблема связана не с конкретной уязвимостью, а с более фундаментальным разрывом в скорости: возможности моделей быстро улучшаются, но человеческие способности понимать, отслеживать и ограничивать эти системы могут быть не синхронизированы.

Это напрямую перекликается с данными об ускорении исследований, опубликованными сегодня OpenAI. С одной стороны, компания использует Agent для ускорения исследований и разработок в области ИИ, признавая при этом, что она не может предполагать, что возможности согласования и безопасности обязательно догонят возможности модели, и что более мощные системы может быть сложнее контролировать. Если ИИ сможет участвовать в разработке, обучении и совершенствовании ИИ следующего поколения в будущем, этот разрыв может еще больше увеличиться.

Основываясь на этом, Пачокки считает, что, поскольку машинный интеллект выходит на новый этап развития, полагаться исключительно на внутренние механизмы одной компании, занимающейся искусственным интеллектом, может быть недостаточно для устранения рисков, и требуется более широкое институциональное вмешательство, включая общие стандарты безопасности и международную координацию.

Связанные теги

Похожие статьи

Комментарии

0/500
Captcha (click to refresh)
Нет комментариев