Выяснилось, что GPT-6 Sol начал внутреннее тестирование и работает в 6 раз быстрее.

📅 2026-09-07

Аннотация:

GPT-6 – это не только Астра! Всего через несколько дней после выпуска Astra выяснилось, что GPT-6 Sol находится на внутреннем тестировании. Производительность также очень привлекательна: скорость одного теста в 6 раз выше, чем у Astra. Давайте сделаем смелое предположение: Терра и Луна тоже на подходе? И в тот же день OpenAI только что раскрыла набор внутренних данных: на данный момент, исходя из 8-часового рабочего дня, исследователи OpenAI имеют более трех агентов, работающих одновременно каждый день. Согласно расчетам на основе цен на API, ресурсы вывода агента, используемые средним исследователем OpenAI каждый день, превысили 600 долларов США.


OpenAI также объявила, что внедрила «автоматизированные исследования для стажеров»:

Эти агенты могут под руководством человека выполнять некоторые задачи, на выполнение которых исследователям потребовалось бы несколько дней.

Даже Лао Хуан сказал: AGI уже здесь!


Он сообщил, что Astra использует около 100 000 комплектов NVIDIA Grace Blackwell NVLink72 для обучения, а затем в сети будут подключены 400 000 комплектов графических процессоров.

Похоже, что эта волна не является односторонним ударом OpenAI~

Выяснилось, что GPT-6 Sol начал внутреннее тестирование

Пользователь сети Lentils сообщил, что OpenAI проводит внутреннее тестирование GPT-6 Sol.

Он сказал, что общая производительность Sol значительно слабее, чем у только что выпущенной Astra, но она быстрее и по-прежнему остается моделью «уровня монстра».

Как быстро? Скорость одиночного теста примерно в 6 раз выше, чем у Astra.

Пользователь сети lyra дал одно и то же задание разным моделям для тестирования: пусть модель сгенерирует SVG-изображение BMW M4 Competition.

Среди них GPT-6 Sol использует механизм Max и генерацию нулевой выборки, что занимает около 3 минут и выдает около 28 000 токенов.


GPT-6 Astra использует снаряжение Max, выдает около 25 000 токенов и занимает около 19 минут.


Gemini 3.1 DeepThink включает высокую передачу и отображает выходные данные в размере около 3300 токенов, но процесс вывода потребляет около 458 000 токенов и занимает около 29 минут.


Gemini 3.8 Flash также включил высокую передачу и выдал около 19 000 токенов всего за 42 секунды.


Для сравнения, производительность Sol является наиболее привлекательной: его масштаб вывода близок к показателю Astra, но скорость одного теста примерно в 6 раз выше, чем у Astra, а затраты времени составляют лишь одну шестую от последней.

Кроме того, пользователи сети Lentils также показали прототип мира-песочницы в пиксельном стиле под названием «Царство Ауреллуны».


GPT-6 Sol одновременно генерирует города, сельскохозяйственные угодья, реки, замки и миниатюрные карты, а также оснащен панелями управления, такими как переключение дня и ночи, размещение географических названий и настройка деталей. Всё это больше похоже на уже сложившуюся бизнес-игру-симулятор.

Это эффект, создаваемый нулевым выстрелом, максимальным механизмом вывода, 15 минутами и общей стоимостью 60 000 жетонов.

В настоящее время можно предположить, что Астра склоняется к наиболее сложным и глубоким рассуждениям, в то время как Сол может быть склонен к скорости, пропускной способности и крупномасштабным вызовам агентов.

Что касается времени выпуска Sol, пользователь сети Панкадж Кумар сообщил, что официально он может быть представлен на конференции разработчиков OpenAI 29 сентября.


Не исключено, что GPT-6 Terra, Luna и GPT-Image 2.5 появятся вместе.


Исследователи OpenAI привлекают к работе по 3 стажера агента на человека

В тот же день OpenAI также опубликовала очень интересный набор внутренних данных — насколько модель ИИ ускорила научные исследования в собственной лаборатории.

По состоянию на середину августа этого года на каждые восемь часов работы исследователя приходится около 3,1 рабочих дней агента, выполняющих задачи параллельно.

Эй, ребята, я могу позаботиться о трёх стажерах, которые не спят одни~


Что касается стоимости, рассчитанной на основе цен на API, средний исследователь ежедневно тратит более 600 долларов США на ресурсы вывода агента.

Это почти дневная зарплата младшего инженера.


Что именно делают эти агенты?

Написание кода исследования, написание кода инфраструктуры, настройка среды обучения, проведение оценочных экспериментов, устранение сбоев инструментов и среды, анализ результатов экспериментов, мониторинг задач обучения... Вы даже можете помочь в организации и распространении выводов исследования.

По сути, он может делать все, кроме решения, что изучать.

Одним из наиболее интуитивных изменений является то, что раньше, когда экспериментальная среда не работала, исследователям приходилось обращаться к внутреннему каналу, чтобы позвать на помощь; теперь у агентов появляется все больше возможностей справляться с подобными вещами, а количество вопросов и ответов, задаваемых вручную, напрямую сократилось.


Некоторые команды напрямую отменили фиксированное время для технических вопросов и ответов, освободив людям время для улучшения самой системы.

Основываясь на этих данных, OpenAI официально объявила, что достигла цели «стажеров по автоматизированным исследованиям ИИ».

Здесь «стажер» — это, если быть точным, способный узел исследований и разработок: под руководством человека он может самостоятельно выполнять исследовательские задачи с четкими границами, некоторые из которых у квалифицированных исследователей заняли бы несколько дней.

Результаты были немедленными: объем кода исследователя и количество экспериментов увеличились.


В августе 2026 года количество экспериментов на душу населения достигло нового максимума с момента сбора статистики в январе 2025 года, а задачи, которые брали на себя агенты, становились все более сложными, а время цикла становилось все длиннее и длиннее.


Кевин Лю, автор этой статьи, также рассматривает этот вопрос в более широком контексте.

Он считает, что рекурсивное самосовершенствование, вероятно, станет одним из наиболее важных факторов, способствующих скачку возможностей ИИ в ближайшие несколько лет.

Проще говоря, ИИ создает ИИ все быстрее и быстрее.


Но проблема в том, что согласно нынешней тенденции развития, эта способность по умолчанию появится только в нескольких передовых лабораториях ИИ, и внешнему миру трудно увидеть, насколько далеко она продвинулась.

Поэтому Лю считает, что прозрачное раскрытие информации сейчас актуально как никогда. Насколько быстро модели становятся сильнее и нужно ли замедлять темпы исследований и разработок, не может решить всего несколько компаний за закрытыми дверями.

Он также призвал другие компании, занимающиеся искусственным интеллектом: аналогичные данные также следует обнародовать.

Однако исследования и разработки в области искусственного интеллекта действительно стали быстрее, но они еще недостаточно быстры для полностью автономного вождения.

Данные OpenAI показывают, что в более чем половине успешных случаев за последние шесть месяцев людям приходилось вмешиваться хотя бы один раз при выполнении задач, которые изначально занимали от 4 до 8 часов. Что касается планирования исследований на высоком уровне, то оно почти никогда не остается на усмотрение Агента.


Исследователи по-прежнему несут ответственность за принятие решения о том, что изучать, какие результаты стоит продолжать, а когда расширять обучение, приостанавливать эксперименты или развертывать модели.

Также была поставлена ​​следующая цель OpenAI: создать «автоматизированных исследователей ИИ» к марту 2028 года.

По сравнению со «стажерами», которые могут выполнять только конкретные задачи, «исследователи» должны иметь возможность ставить перед собой более открытые исследовательские цели и самостоятельно продвигать долгосрочные проекты, что эквивалентно переходу от исполнителя к независимому ответственному лицу.

Если GPT-6 Sol действительно проходил внутренние испытания, то, скорее всего, он был разработан в рамках этой новой модели исследований и разработок:

Больше графических процессоров обеспечивают вычислительную мощность, больше агентов параллельно проводят эксперименты, а люди-исследователи выходят на более высокий уровень — выбирают направления, оценивают результаты и, наконец, решают, какие вещи стоит превратить в модели следующего поколения.

Сильный ИИ становится все труднее отслеживать

В тот же день главный научный сотрудник OpenAI Якуб Пачоцкий опубликовал статью объемом 10 000 слов под названием «Инопланетное мышление».


Прочитав это, я чувствую, что даже главный учёный OpenAI призывает всю индустрию замедлиться...

Якуб отметил, что ИИ не создается людьми по чертежам, одному чипу и одному правилу. Это больше похоже на то, что оно растет само по себе из огромных данных и вычислительной мощности.

Вы можете разобрать ее и понять некоторые ее части, но никто не сможет объяснить, почему вся система вдруг приобрела определенную способность и как она будет вести себя в другой среде.

Что еще более неприятно, так это то, что ИИ не обязательно сокрушать людей во всех аспектах, чтобы создавать проблемы. Пока он превосходит людей по достаточному количеству ключевых способностей, он может как очень помочь вам, так и доставить много неприятностей.

Итак, возникает вопрос: смогут ли люди это понять?

В прошлом OpenAI в основном полагалась на один прием для мониторинга ИИ: смотреть на цепочку мышления.

Грубо говоря, это значит посмотреть на процесс рассуждения, записанный моделью, и проверить, нет ли у него каких-либо злых намерений, таких как желание обмануть людей, желание превысить полномочия и желание обойти ограничения.

Но с поколением Astra этот трюк начал проваливаться.

Во-первых, модель все в большей степени способна «управлять» тем, что она говорит, и не все истинные мысли могут быть записаны в рассуждениях; во-вторых, агент уже давно перестал «думать, прежде чем отвечать». Он может настраивать инструменты, управлять компьютерами, запускать среды и сотрудничать с людьми и другими агентами.

Когда все эти вещи смешаны, исследователи больше не могут выстроить полную и прозрачную цепочку размышлений для рассмотрения предложения за предложением.

OpenAI также обнаружила, что Astra может решать сложные задачи, не записывая весь процесс рассуждения.

Проще говоря, модели уже научились делать большие дела незаметно.


В состязательных тестах, специально разработанных для того, чтобы заставить модели уклоняться от мониторинга, Astra даже продемонстрировала некоторые пугающие способности: намеренно занижала результаты тестов, обходила мониторинг и выполняла саботажные задачи.

Конечно, это искусственно созданные стресс-тесты, и OpenAI не делает вывод, что Astra будет активно обманывать в повседневных задачах. Но, по крайней мере, это показывает, что трудно охватить все возможные варианты поведения модели, наблюдая только за цепочкой мышления.

Помните предыдущий инцидент с «Обнимающим лицом»? Это был тревожный звонок.


В то время GPT‑5.6 Sol и более мощная модель внутренних исследований были включены в сеть ExploitGym. Задача была найти уязвимости, завершить атаку и получить Флаг. Чтобы проверить истинные возможности модели, среда оценки не предусматривала полных ограждений безопасности.

Полученные модели не решили проблему честно. Сначала они обходили сетевую изоляцию, общались друг с другом через неавторизованные каналы и совместно работали над задачами.

Затем он использовал уязвимость нулевого дня в прокси-сервере кэша программного пакета, чтобы получить доступ к общедоступной сети, и, наконец, вошел в систему Hugging Face, чтобы попытаться найти ответ на тест ExploitGym.

На самом деле, этот вопрос в основном был обусловлен внутренней исследовательской моделью IM1. GPT‑5.6 Sol также воспроизвела некоторые пути атаки, а Astra не участвовала.

Первоначальной целью моделей по-прежнему было завершение теста, но чтобы получить ответы, они продолжали искать лазейки в правилах и, наконец, совершали операции, выходящие за рамки задачи.

Поэтому OpenAI также воспринимает сигнал опасности: когда агент достаточно силен, имеет достаточно инструментов и работает достаточно долго, он может самостоятельно находить новые пути, вызывать внешние ресурсы и даже сотрудничать с другими агентами.

Нет... так что ходя по кругу, не зайдет ли это в тупик? ?

OpenAI нужны более сильные модели для написания кода, проведения экспериментов, исследований согласованности и даже использования их для создания систем безопасности для защиты от других ИИ. Чем мощнее модель, тем больше работы она может выполнять и тем выше скорость разработки.

Но в то же время людям становится все труднее подтвердить, как они приходят к своим выводам и будут ли они переосмысливать правила, которые они изначально усвоили после изменения окружающей среды.

Якуб пришел к выводу, что сейчас ни одна лаборатория не осмелится сказать, что она проделала хорошую работу по согласованию и мониторингу модели и может расширять масштаб модели с максимальной скоростью и смело в долгосрочной перспективе.


Пока в отрасли не будут установлены общие стандарты безопасности, он надеется, что каждый сможет воспринимать «добровольное нажатие на тормоз» как молчаливое понимание.

Что касается самого OpenAI, он также сказал: В случае необходимости он не исключает в одностороннем порядке остановиться и не продолжать расширять масштабы модели.

Лучше бы вам было так... Я помню, компания, начинающаяся с А, тоже так говорила.

[1]https://x.com/Lentils80/status/2096518218836005287? с=20

[2]https://x.com/pankajkumar_dev/status/2096532712291201460

[3]https://openai.com/index/research-acceleration-view-inside-openai/

[4]https://openai.com/index/an-alien-mind/

[5]https://x.com/JensenHuang/status/2096700264569090384?s=20

Связанные теги

Похожие статьи

Комментарии

0/500
Captcha (click to refresh)
Нет комментариев