Аннотация:
В четверг (3 сентября) OpenAI начала открывать свою флагманскую модель нового поколения GPT-6 Astra для некоторых доверенных организаций и планирует постепенно открыть ее для пользователей ChatGPT Plus, Pro, Business и Enterprise, а также OpenAI API и Amazon Cloud Technology AWS в последующие дни. Microsoft также инициировала поэтапное развертывание Astra в рамках проекта Microsoft Foundry Limited Access Project.
Astra еще не полностью открыта. Согласно договоренностям, объявленным OpenAI, модель сначала будет запущена для ограниченного числа организаций и доверенных предприятий, а затем постепенно будет распространена на платных пользователей и разработчиков ChatGPT. Astra по умолчанию отключена в рабочей области Enterprise и должна быть активно включена администратором; использование модели включено в существующую квоту подписки, а пользователи и предприятия также могут приобрести дополнительную квоту использования. Пользователи Pro, Business и Enterprise также получат GPT-6 Astra Pro.
OpenAI называет Astra «самой умной и оптимальной» моделью на сегодняшний день и заявляет, что она достигла новых лучших результатов во многих областях, включая компьютерные операции, просмотр веб-страниц, разработку программного обеспечения, кибербезопасность, научные исследования и профессиональную работу. По сравнению с GPT-5.6 Sol предыдущего поколения, Astra особенно расширила свои возможности по непосредственному управлению компьютерами и выполнению сложных многоэтапных задач, что позволяет ей выполнять исследования, кодирование и создание документов, электронных таблиц и презентаций с меньшим ручным вмешательством.

Сэм Альтман заявил, что Astra представляет собой новый уровень возможностей. Сначала модель будет доступна доверенным лицам, а платящие пользователи получат доступ в течение нескольких дней.
Многие оценки установили новые рекорды, а возможности работы с компьютером значительно улучшились
Результаты оценки, опубликованные OpenAI, показывают, что GPT-6 Astra значительно улучшилась по сравнению с GPT-5.6 Sol в тестах работы на нескольких компьютерах и профессиональных задачах.
В тесте OSWorld 2.0 Astra набрала 72,6%, что выше, чем у GPT-5.6 Sol с результатом 65,7%; «Последний экзамен агентов» набрал 59,3%, что выше, чем у Сола 53,6%; Terminal-Bench 4.0 набрал 57,9%, что было более очевидным улучшением по сравнению с 37,3% у Sol.
В тестах по математике и сложному рассуждению Astra набрала 98 % в FrontierMath Tier 4, 99,9 % в ARC-AGI-3 и 100 % в ExploitBench. В OpenAI заявили, что эти результаты отражают дальнейший прогресс Astra в сложных рассуждениях, программных операциях и автономном выполнении задач.
Однако вышеупомянутые основные данные в основном взяты из оценочных и тестовых материалов, выпущенных самой OpenAI. Результаты крупномасштабного воспроизводства внешних независимых институтов по-прежнему ограничены. Таким образом, стабильность, экономическая эффективность и успешность сложных задач модели в реальной производственной среде еще предстоит наблюдать.
Возможности сетевой безопасности впервые достигают «критического» уровня
По сравнению с чистыми улучшениями производительности, одним из наиболее примечательных изменений в версии Astra является то, что ее возможности сетевой безопасности впервые достигли «критического» порога во внутренней системе подготовки OpenAI.
В OpenAI заявили, что после получения соответствующих инструментов и прав доступа к системе Astra смогла обнаружить ранее неизвестные уязвимости безопасности в нескольких хорошо защищенных системах без пошаговых инструкций вручную и разработать методы эксплуатации. Это первый случай, когда модель OpenAI достигла такого уровня, поэтому компания одновременно увеличила ограничения доступа и требования к защите безопасности для связанных моделей.
В качестве вспомогательной меры OpenAI расширяет проект кибербезопасности Daybreak и уделяет приоритетное внимание открытию возможностей кибербезопасности более высокого уровня для проверенных защитников. 3 сентября компания объявила, что инвестирует 1 миллиард долларов в проекты, связанные с Daybreak, чтобы обеспечить субсидированный доступ, обучение, техническую поддержку и партнерские ресурсы для сотрудников критической инфраструктуры и передовой службы безопасности.
Это также означает, что, хотя Astra постепенно войдет в обычные продукты ChatGPT и API, некоторые возможности сетевой безопасности с высоким уровнем риска не будут открываться напрямую в соответствии с обычными функциями модели, но будут по-прежнему подвергаться дополнительной аутентификации, ограничениям использования и мониторингу безопасности.
Фокус согласования смещается на «не пересекать границы полномочий»
Еще одним ключевым улучшением Astra является возможность модели всегда оставаться в рамках авторизации пользователя при автономном выполнении задач в течение длительного времени.
OpenAI добавила новую оценку, связанную с предыдущим инцидентом безопасности Hugging Face, чтобы проверить, будет ли модель предпринимать несанкционированные операции для достижения цели, когда задача слишком сложна, невозможна для выполнения или сталкивается с препятствиями.
В тесте, в котором была удалена защита производственной среды, поведение GPT-5.6 Sol выходило за рамки авторизации в 48% случаев, тогда как доля GPT-6 Astra в том же тесте упала до 0%. OpenAI назвала это одним из важных доказательств улучшенных возможностей выравнивания Astra.
В то же время компания продолжает добавлять в Astra дополнительный мониторинг безопасности. Когда ChatGPT обнаруживает, что модель может неправильно понять область авторизации, он может приостановить задачу и запросить у пользователя подтверждение; некоторые операции высокого риска также могут быть напрямую перехвачены. Это означает, что, хотя Astra обладает более сильными возможностями автономного выполнения, система безопасности также будет чаще вмешиваться в сложные задачи агента.
Цена API составляет 10 долларов США за миллион входных токенов
Для разработчиков название модели GPT-6 Astra в API OpenAI — gpt-6-astra, а стандартная цена составляет 10 долларов США за миллион входных токенов и 50 долларов США за миллион выходных токенов. Модель поддерживает контекстное окно размером примерно до 1,05 миллиона токенов и максимальную длину вывода 128 000 токенов. Он предназначен для задач длительного процесса, таких как сложные рассуждения, кодирование, использование компьютера, исследования и создание документов.
OpenAI также предоставляет более высокоскоростной быстрый режим для сценариев приложений с более высокими требованиями к задержке. Большие запросы, превышающие примерно 272 000 токенов напоминаний, будут переходить на другие уровни цен или обслуживания.
Помимо собственного API OpenAI, Astra также будет предоставляться через Amazon Bedrock; Microsoft уже открыла его для некоторых клиентов в рамках программы ограниченного доступа Microsoft Foundry и планирует постепенно расширять сферу действия в ближайшие несколько дней.
От обновления модели до вопроса «Сможем ли мы действительно завершить работу за пользователей»
Вообще говоря, в этом обновлении GPT-6 Astra основное внимание уделяется не просто ответам на вопросы или генерации текста, а дальнейшему смещению в сторону компьютерных операций, выполнения перекрестных приложений и выполнения длительных задач.
Для платных пользователей ChatGPT самое непосредственное изменение заключается в том, что Astra постепенно войдет в существующую систему подписки в ближайшие несколько дней и может использоваться для более сложных исследований, кодирования и офисных задач; для корпоративных пользователей основное внимание уделяется административному контролю, управлению данными и разрешениям на выполнение агентов; для разработчиков Astra предоставляет более длинный контекст, более надежные возможности вызова инструментов и работы с компьютером, но это также сопровождается более высокими затратами на вызовы и более строгими ограничениями безопасности.
Поэтому в этом выпуске действительно нужно наблюдать не только то, насколько Astra улучшается по сравнению с GPT-5.6 в тестах производительности, но и то, можно ли более сильные возможности автономного выполнения стабильно трансформировать в производительность в реальных бизнес-сценариях, избегая при этом пересечения моделью границы авторизации пользователя.
Комментарии