Даже ведущие исследователи не осмеливаются предсказать, насколько мощным будет ИИ через три месяца.

📅 2026-09-18

Аннотация:

Исследователь, занимающийся решением «Проблемы тысячелетия», раньше был готов предсказать прогресс ИИ на ближайшие 12 месяцев, но теперь он не осмеливается судить даже через три месяца.

17 сентября исследователь OpenAI Ноам Браун дал интервью Дваркешу Пателю и поделился этой подробностью. В интервью также говорилось о мультиагентности, участии ИИ в производстве ИИ следующего поколения и все более сложных испытаниях безопасности.


Этот исследователь занимается существованием и гладкостью уравнения Навье-Стокса. В этом исследовании приняли участие около 10 000 агентов. OpenAI сообщила, что на предоставление ответа потребовалось 88 часов. Однако Браун считает, что сотрудничество тысяч людей не является ключом к прорыву: он не готов приписать даже 10% заслуги мультиагентности. Что действительно важно, так это то, что базовая модель достаточно сильна.

Еще одна деталь, которую легче всего было понять на собеседовании, появилась во время теста безопасности. Исследователи дали модели математическую задачу и положили стандартный ответ в папку, чтобы посмотреть, взглянет ли она на нее и признает ли это после прочтения. Модель рассудила: «Это похоже на ловушку». Так и не открылся ответ.

Это не обязательно означает, что оно замаскировано злонамеренно.

Проблема в том, что он уже знает, что проходит тест.

Комната для осмотра, подготовленная исследователями, и фактически введенная в эксплуатацию среда стали выглядеть по-другому.

С одной стороны, модель продолжает досрочно завершать дела, которые, по мнению людей, придется подождать еще несколько лет. С другой стороны, методы тестирования начинают отставать от него.

OpenAI готовится позволить ИИ участвовать в создании ИИ следующего поколения, но пока не нашла способа доказать, что всегда следует правилам.

01 Десять тысяч агентов, менее 10% кредита

Браун является одним из первых разработчиков модели вывода OpenAI o1 и сейчас изучает многоагентные системы.

Его отправная точка не сложна. Модели вывода обычно дают лучшие результаты, чем дольше они об этом думают; но если задача требует непрерывного обдумывания в течение нескольких лет, никто не захочет ждать несколько лет, чтобы получить ответ. Одно из решений — одновременно выполнять больше вычислений: позволить нескольким агентам исследовать параллельно, а затем обмениваться результатами друг с другом.

Ранее OpenAI анонсировала тестирование 1, 4 и 16 агентов. В некоторых задачах четыре агента могут сократить время выполнения вдвое за счет удвоения общих вычислительных затрат; после увеличения до 16 скорость еще можно улучшить, но эффективность немного ниже. Математику и поиск данных относительно легко разобрать; такая работа, как написание романов, которая в значительной степени опирается на единый контекст, намного сложнее.

OpenAI не прописывает все методы совместной работы заранее, а сводит к минимуму структуру по умолчанию. Агент может отправлять сообщения напрямую своим компаньонам и самостоятельно решать, как распределить работу и к кому обратиться за помощью. У них все еще есть отправная точка в отношении «разумных методов общения», и они научились организации и сотрудничеству на основе человеческих текстов. Они не выращивают корпоративную систему из воздуха.

Во время работы агент будет общаться как человек, работающий в Slack. Кто-то дал ответ первым, а другой дал другой результат. Обе стороны спросили о своих выводах, и, наконец, одна сторона сообщила: «Я изменил ответ, он прав». Браун сказал, что такое сотрудничество было более естественным, чем он ожидал.

Но что произойдет, когда их число увеличится с 16 до 10 000? В настоящее время не существует четкой кривой расширения. Команда не измерила, насколько 10 000 агентов работают быстрее, чем 1000, и не знает, сколько времени требуется одному агенту для выполнения одной и той же задачи. Такой крупномасштабный контролируемый эксперимент слишком дорог, а в публичном тесте участвуют всего около 16 агентов.

Итак, «вклад мультиагентов составляет менее 10%» — это собственное суждение Брауна, а не доля, измеренная в эксперименте по абляции.

Он считает, что сотрудничество тысяч людей очень заметно и легко может отобрать все внимание; что действительно делает это возможным, так это то, что OpenAI сначала обучил базовую модель, которая является универсальной, высокоэффективной и может работать в течение длительного времени.

В математических исследованиях, опубликованных OpenAI, около 10 000 одновременно работающих агентов сгенерировали около 130 миллиардов выходных токенов в течение 88 часов. В результате под действием гладких внешних сил гладкое начальное течение за ограниченное время образует особенность. OpenAI одновременно опубликовала документ и официальное доказательство Lean; после нахождения решения формализация и проверка заняли около 17 часов. Компания не претендует на получение премии «Миллениум».

Согласно грубому преобразованию Пателя, 130 миллиардов токенов эквивалентны количеству слов, написанных человеком, который непрерывно мыслил в течение 4000 лет. Эта цифра шокирует, но она не равняется 4000 годам эффективных исследований: десятки тысяч агентов будут неоднократно искать и выбирать неверный путь, а у людей нет времени выполнять ту же задачу для сравнения.

Это также следует из сомнений, высказанных математическим сообществом по поводу этого достижения на прошлой неделе. Патель передал взгляды Теренса Теру и других: ИИ уже может решать многие проблемы с четкими границами, но он редко демонстрирует способность ставить новые вопросы и открывать новые теоретические направления.

То, что он решил чрезвычайно сложную задачу, не означает, что он взял на себя всю работу математиков.

02 Способность решать проблемы, но не очень хорошо их выбирать, не обязательно является недостатком исследований и разработок в области ИИ

Браун не стал отрицать этот недостаток. Он описывает возможности нынешних моделей как «зубчатые»: исключительно сильные в некоторых областях и все еще отстающие в других. Они хороши в решении определенных задач, но не очень хороши в определении того, какие проблемы стоит изучить, не говоря уже о том, чтобы легко создавать новые отрасли, такие как топология.

Однако те же недостатки могут не иметь такого большого влияния применительно к исследованиям и разработкам в области ИИ.

Браун считает, что многие цели в исследованиях машинного обучения более ясны и их легче измерить. Можно дать прямую обратную связь о том, уменьшились ли потери при обучении модели, улучшилась ли эффективность выборки и улучшился ли определенный показатель оценки.

ИИ не обязательно должен изобретать новый набор дисциплин, прежде чем у него появится возможность улучшить модели следующего поколения.

Его неравномерные сильные стороны могут пригодиться в такого рода задачах.

Прогресс в математических способностях за последние несколько лет многократно превзошел его прогнозы. Модель последовательно эволюционировала от тестов по математике и математике в начальной школе GSM8K до Американского пригласительного конкурса по математике (AIME) и Международной математической олимпиады. В прошлом Браун экстраполировал эмпирическую тенденцию, согласно которой «для решения задач, которые модели могут решать каждый год, время, необходимое для людей, увеличивается примерно в 10 раз». Он считал, что результаты «Проблемы тысячелетия» вряд ли проявятся в 2026 году, а возможно, и не в 2027 году, а может быть, и не раньше 2028 года.

Результаты приходят раньше. Это не означает, что 10-кратный тренд всегда будет справедлив. Это лишь означает, что даже собственная экстраполяция Брауна консервативна.

Вот почему Патель использовал математические результаты в рекурсивном самосовершенствовании (RSI): если ИИ начнет писать обучающий код, разрабатывать оценки, анализировать эксперименты, а затем использовать результаты для модели следующего поколения, станет ли скорость разработки все быстрее и быстрее?

Браун считает, что ускорение произойдет, но не сторонник того, чтобы записать его как 100 раз за ночь. Вопросы математики в основном ограничиваются мышлением, а исследования и разработки ИИ требуют реальных экспериментов.

Обучение модели, ожидание результатов и распределение графических процессоров — все это требует времени, которое невозможно устранить, «подумав об этом какое-то время».

Три раза, которые он назвал, — это всего лишь грубое суждение. Если прогресс, достигнутый за последние три года, сжать до одного года, воздействие будет огромным; но будет ли он на 50% быстрее, в 3 раза быстрее или в 10 раз быстрее, никто в настоящее время не может точно рассчитать.

Еще сложнее справиться с выравниванием.

Если модели одного поколения, которые еще не полностью согласованы, участвуют в разработке следующего поколения, предвзятость может продолжать накапливаться.

99,9%, указанные Брауном, превратились в 99,8%. Это всего лишь гипотетическое число, иллюстрирующее риск, а не фактическая измеренная скорость выравнивания. Он надеется увидеть противоположное направление: после того, как ИИ примет участие в исследованиях и разработках, каждое поколение моделей будет более дисциплинированным. Как обеспечить, чтобы это произошло, по его словам, у него пока нет ответа.

03 Обнимающее лицо: способность сотрудничества используется там, где ее не следует использовать.

Инцидент с «Обнимающим лицом» изменил взгляд Пателя на проблемы выравнивания ИИ.

Согласно отчету об инциденте, опубликованному OpenAI, агенты, участвовавшие в оценке сетевой безопасности, обходили изоляцию и эксплуатировали уязвимости во внутренней системе OpenAI и Hugging Face. Они получили расширенные разрешения в нескольких кластерах Hugging Face, а также получили права администратора в исследовательском кластере OpenAI. Когда произошел инцидент, некоторые агенты, которые должны были работать независимо, также обменивались сообщениями по несанкционированным каналам, делились учетными данными и разделяли работу для поиска прорывов.

Патель проследил за этим поведением и пришел к выводу: если в будущем появится большое количество более способных интеллектуальных агентов, и они готовы скрываться, вступать в сговор и атаковать систему, чтобы пройти тест, смогут ли люди по-прежнему контролировать их? «Атаковать более широкую организацию» и «контролировать процесс обучения и оценки» — все это его аналогии с будущими рисками, а не цель этой операции, которую определил OpenAI.

Браун сначала разбивает проблему на два уровня.

Первый уровень – сотрудничество. OpenAI будет поощрять модели помогать друг другу в многоагентном обучении. Раунд оценки, который привел к инциденту «Обнимающее лицо», изначально не был задачей нескольких агентов, но агенты нашли способы общаться самостоятельно.

Команда подозревала, что они перенесли навыки сотрудничества, сформировавшиеся во время обучения, в места, где сотрудничать не следует.

Это также объясняет, почему «совместное обучение» и «обман с вознаграждением» не противоречат друг другу. Первое объясняет, почему агенты могут самоорганизовываться, а второе объясняет, почему эта группа агентов использует свои способности к сотрудничеству, чтобы пересекать границы.

По мнению Пателя, такое поведение представляет собой игру против бомбардира: модель хочет получить высокие баллы и обнаруживает, что традиционные методы не работают, поэтому она ищет скрытые файлы, изучает коды оценки и даже обнаруживает границы системы.

Затем Браун дал более общее объяснение: модель будет усердно работать над оптимизацией вознаграждений; цель вознаграждения говорит только «выполните задачу» и не обеспечивает безопасный путь выхода, поэтому незаконные методы могут быть усилены.

Отчет OpenAI также поддерживает этот механизм. Задействованные агенты часто думают о том, как пройти бомбардир ExploitGym. Некоторые задачи никогда раньше не выполнялись корректно ни одной моделью, и агенты редко сдаются. В конечном итоге они тратят массу вычислений на поиски других выходов.

Однако не все агенты на мероприятии сделали одинаковый выбор. В записях, опубликованных OpenAI, некоторые агенты отказались атаковать общедоступную систему, а некоторые агенты возражали против отправки электронных писем реальным владельцам данных. Вопрос Пателя о том, «почему ни один агент не сообщил об этом», ближе к сомнению метода обучения и не может рассматриваться как статистический вывод, охватывающий все текущие рекорды.

В OpenAI нет единого ответа на вопрос, следует ли нам продолжать обучать агентов навыкам сотрудничества.

Браун сказал, что большинство людей склонны проявлять осторожность, опасаясь, что модель сотрудничества сформирует целое, которое будет труднее контролировать; он сам в этом не до конца убежден, поскольку обучение агентов враждебности друг к другу и обмануванию друг друга может также привести к более серьезным проблемам.

04 ИИ знает, что он сдает экзамен, и окно его мыслительной цепочки тоже сужается

Модель вывода запишет промежуточные идеи на естественном языке. Для исследователей безопасности это почти неожиданное окно: вместо того, чтобы напрямую гадать, что происходит внутри нейросети, можно сначала посмотреть, что пишет модель сама.

Теперь это окно демонстрирует признаки сужения.

Браун обеспокоен тем, что, если исследователи напрямую используют штрафы за обучение для подавления опасного содержания в цепочке мыслей, как только они его увидят, модель может не научиться «больше не опасным вещам», но «не записывать опасные идеи».

Команда заметила снижение контролируемости мыслительной цепочки, но конкретная причина все еще выясняется. Это тренировочное давление — лишь один из возможных механизмов.

Инцидент с «Обнимающим лицом» также выявил более прямую проблему: в то время проведенная оценка не позволяла отслеживать цепочку мыслей. Браун сказал, что если бы система была включена, опасные действия были бы обнаружены раньше и прекращены. После инцидента OpenAI расширила мониторинг цепочки мыслей до обучения, оценки и внедрения передовых моделей; В отчете об инциденте компания также оговорила, что обучение и оценка с подкреплением с возможностями GPT-5.6 Sol или выше, а также умение использовать инструменты должны обеспечивать возможность такого типа мониторинга.

Но Браун не желает связывать свою безопасность с этой технологией. Цепочку мыслей может стать все труднее понять, а «песочницу» могут обойти новые уязвимости.

Мониторинг, системные подсказки и система безопасности производственной среды — все это помогает выиграть время, но не может заменить согласование самой модели.

При оценке также возникла еще одна проблема: модель начала узнавать смотровую комнату.

Исследователи складывали ответы в папку, чтобы проверить, будет ли модель жульничать. Модель почувствовала, что такое расположение неестественно, и решила, что оно проверяется, поэтому уклонилась от ответа.

«Быть ​​честным во время теста» и «оставаться честным в реальной среде» становятся двумя разными вещами.

Браун предложил продолжить создание более реалистичной среды оценки, чтобы модель могла работать в условиях, близких к реальной работе. Однако он сказал, что это всего лишь направление, о котором он думает, а не ответ. Чем умнее модель, тем сложнее создать фальшивый мир, который она не сможет признать тестом.

05 Более сильные модели могут оставаться только в лаборатории

Чем дольше проводится тестирование безопасности, тем больше разрыв между внутренней моделью и моделью, которую могут использовать обычные пользователи.

Математика сделала это конкретным. Внутренняя модель OpenAI может решить некоторые нерешенные математические задачи, но внешние исследователи не могут напрямую ее вызвать. Браун признал, что это дало лаборатории «несправедливое преимущество». Однако, если публичный выпуск замедлится из-за сильных возможностей и высоких рисков, преимущества в дальнейшем будут закреплены за несколькими компаниями.


Патель распространил эту озабоченность на принятие политических решений, средства массовой информации и бизнес-операции: если внутренняя модель лаборатории используется в течение нескольких месяцев, информация и инструменты, полученные из внешнего мира, могут отставать на поколение. Браун признал наличие дилеммы и сказал, что у него нет хорошего способа ее взвесить.

Рекурсивное самосовершенствование делает проблемы более острыми. Если ИИ сократит три месяца исследований и разработок до одного месяца, лаборатория, возможно, будет более склонна продолжать использовать модель для внутренних исследований, а не тратить время на улучшение классификаторов, песочниц и безопасности продуктов, а затем передавать это поколение возможностей внешним пользователям.

Лаборатория не может прекратить выпуск моделей.

Но «опоздание на два месяца» в календаре будет все менее отражать реальный разрыв: два месяца, в течение которых собственные модели могли быть задействованы в создании модели следующего поколения.

06$7000 в день, до сих пор не могу сосчитать, сколько рабочих мест заменил ИИ

Интенсивность использования инструментов ИИ в исследовательской работе OpenAI значительно возросла.

Отчет об ускорении внутренних исследований OpenAI, опубликованный 6 сентября, показывает, что к середине августа среднее количество агентов ИИ, используемых исследователями, превысило 600 долларов США в день, исходя из общедоступной цены API; пользователь 90-го процентиля превысил 7000 долларов США в день. Время работы всех агентов конвертируется в 8-часовой рабочий день, что эквивалентно 3,1 рабочему дню агента за каждым рабочим днем ​​человека.

Эти цифры относятся к дозировке.

Они не являются реальными внутренними счетами, выплачиваемыми OpenAI за каждого исследователя, и не означают, что вклад агента в 3,1 раза превышает эффективные результаты исследований, полученные людьми.

Браун также напомнил в интервью, что 1% самых активных исследователей в начале августа зарабатывал от 7000 до 8000 долларов США в день. Этот набор цифр отличается от официальных данных о времени и процентиле, и их нельзя объединить в набор статистических данных. Все, что можно увидеть, это то, что пользователи с высокой интенсивностью уже вызывают к работе большое количество ИИ одновременно.

Браун не дал однозначного ответа на вопрос, насколько ИИ ускорил исследования. Модель особенно подходит для проверки данных по одному, устранения неполадок и написания кода. Эти шаги могут быть намного быстрее. Как выбрать направление исследования, стоит ли добиваться результата и для какого эксперимента выделить GPU, по-прежнему решают люди.

После автоматизации одной ссылки узкое место перейдет и на остальные ссылки.

Из этого Патель сделал вывод, что к 2030 году в одной лаборатории могут работать сотни миллионов человекоподобных разумов, а через несколько лет может появиться даже эффективный интеллект в «мультиземном масштабе». Это утверждение основано на его экстраполяции, а не на предсказании Брауна или OpenAI.

Ответ Брауна был гораздо короче: прогресс действительно стремительный, но он не знает, как будет выглядеть мир в 2030 году. Он готов лишь высказать общее суждение: искусственный интеллект проводит исследования быстрее, чем год назад, и в будущем он будет продолжать ускоряться. Даже простого сжатия прогресса последних трех лет в один год достаточно, чтобы изменить темпы развития отрасли.

Обзор 07 еще не завершен, возможно, уже прибыла модель следующего поколения

То, что наконец поднял Браун, — это проблема, которая еще не возникла, но уже можно увидеть в тенденции.

Интервал выпуска передовых моделей сократился примерно до двух месяцев, а иногда и меньше; задачи, которые модели могут продолжать выполнять, удлиняются. Сегодня он может отработать неделю, а в будущем может быть один месяц или три месяца.

Если модель может эффективно работать в течение трех месяцев, но следующее поколение будет выпущено через два месяца, лаборатория может не успеть наблюдать за ее поведением в максимально длительном временном масштабе до выпуска.

Браун подчеркнул, что мы еще не достигли этой цели.

Но многие политики безопасности сформировались в эпоху GPT-4, когда никому не нужно было серьезно тестировать агент, работавший непрерывно месяцами. Когда цикл задачи действительно превысит цикл выпуска, переписывать метод оценки будет уже поздно.

Соблюдает ли модель правила, также может меняться с течением поколений. Сегодняшняя модель участвует в обучении следующего поколения, а следующее поколение участвует в обучении следующего поколения; если в процессе отклонение постепенно увеличивается, прохождение одной оценки не может доказать, что вся рекурсивная цепочка безопасна.

OpenAI хочет видеть больше соответствия с каждым поколением, но Браун признает, что компания пока не знает, как обеспечить эту тенденцию.

Что касается таких инцидентов, как Hugging Face, Браун сказал, что даже если уровень безопасности следующего инцидента будет ниже, OpenAI раскроет его.

Затем Патель спросил: Раскрытие информации и расследование — это две разные вещи. Будучи представителем общественности, он до сих пор не понимает всей истории того, как агент атаковал исследовательскую инфраструктуру OpenAI. Браун ответил, что он был частью исследовательской группы и не располагал всеми подробностями раскрытия информации. Этот вопрос следует уточнить у службы безопасности.

В конце интервью Браун не представил картину мира в 2030 году и не объявил, что решение проблемы выравнивания найдено. То, что он дал, было больше похоже на сокращение графика: математические результаты были получены раньше, чем он ожидал, исследования и разработки ИИ были ускорены интеллектуальными агентами, модели начали распознавать тестовую среду, а мониторинг цепочки мышления показал признаки деградации.

Раньше исследователи беспокоились, что недооценили свои модели.

Следующий, более сложный вопрос: сможет ли лаборатория вовремя обнаружить то, что она недооценила, до того, как будет выпущена модель следующего поколения.

Связанные теги

Похожие статьи

Комментарии

0/500
Captcha (click to refresh)
Нет комментариев