Аннотация:
За несколько часов до выхода Astra в сообществе ИИ царил хаос. Вечером 3 сентября ChatGPT, Клод и Грок практически одновременно столкнулись с масштабными сбоями в работе сервиса. Большое количество пользователей либо не смогли открыть модели, либо их запросы не увенчались успехом. В этот момент официальный аккаунт ChatGPT смотрел на звезды: «Звезды почти сошлись».

Вскоре кто-то начал шутить: Astra во время развертывания взломала и Anthropic, и xAI, а в итоге даже себя не пощадила?
Конечно, это всего лишь шутка пользователей сети. На данный момент нет доказательств того, что этот сбой связан с Astra.
Но эта шутка появилась в нужное время — всего два дня назад OpenAI только что объявила, что эта новая модель, которая еще не была официально выпущена, стала первой моделью компании, преодолевшей «критический» порог возможностей кибербезопасности в рамках Readyness Framework.
Тогда звезды действительно встали на свои места.
Рано утром 4 сентября по пекинскому времени OpenAI официально выпустила GPT-6 Astra.
Но не все из них онлайн. В настоящее время Astra открыта только для небольшого числа организаций в системе Trusted Access/Daybreak и для проверенных пользователей сетевой безопасности. Пользователям Plus, Pro, Business, Enterprise и API придется подождать еще несколько дней.

Идет Астра, но Татхагата
4 сентября OpenAI выпустила GPT-6 Astra «внутренне».
В настоящее время Astra открыта лишь для небольшого числа учреждений в системе Trusted Access/Daybreak. OpenAI сообщила, что подписчики Plus, Pro, Business, Enterprise и API получат доступ в ближайшие несколько дней.
Что касается того, сколько дней на самом деле составляют эти «несколько дней», то на данный момент более конкретного графика не существует.
На закрытом брифинге для СМИ перед релизом президент OpenAI Грег Брокман сделал для Astra довольно преувеличенную сноску: «Добро пожаловать в эпоху AGI».
Добро пожаловать в эпоху искусственного интеллекта.
Эйдан Кларк, вице-президент по исследованиям OpenAI, объяснил, почему Astra особенная с другой точки зрения: «Это первый случай, когда более 100 000 графических процессоров были использованы для предварительного обучения на площадке Звездных врат в Техасе. От сети центра обработки данных до ядра вывода и формы самой модели — все спроектировано с нуля вокруг этого масштаба обучения».
Эйдан также сказал, что Astra также является первым продуктом OpenAI, позволяющим моделям старого поколения активно участвовать в процессе обучения.
Проще говоря, люди, обучающие ИИ следующего поколения, уже начали появляться в ИИ предыдущего поколения.
Хотя до «ИИ обучается сам» модель еще далека, она уже вступила в процесс разработки модели следующего поколения.
После того, как позавчера Anthropic назвала Fable/Mythos 5.1 «самой продвинутой моделью кодирования и работы со знаниями в мире», сегодня OpenAI также назвала Astra «самой сильной и согласованной моделью в мире».
С точки зрения эталонного тестирования, самые пугающие цифры получены от ARC-AGI-3.
Это тест агента, который специально проверяет, может ли модель войти в двухмерную среду, которую она никогда раньше не видела, обнаружить правила путем непрерывных проб и ошибок и достичь поставленных целей. Это не традиционный экзамен, проверяющий объем запомненных знаний, а ближе к тому, чтобы бросить ИИ в незнакомую игру, чтобы посмотреть, сможет ли он самостоятельно понять, «как устроен мир».
Astra получила наивысший балл — 99,9 % в конфигурации адаптера поставщика OpenAI.
Но это число нужно разобрать. ARC Prize также использует набор стандартных ремней безопасности, которые все производители могут сравнивать в едином формате. Здесь Astra достигает максимального показателя всего в 62,7%.

Самая большая разница между ними не в том, что тема была изменена. Ранее OpenAI обнаружила, что причина низкой оценки Sol заключалась не в том, что модель была глупой, а в том, что система продолжала форматировать свою память. Поэтому OpenAI заменила обвязку ARC-AGI-3 производственной конфигурацией собственного Responses API, а затем специально подготовила две специальные настройки для ARC-AGI-3, а именно сохранение рассуждений и уплотнение. Первый позволяет модели запоминать свои предыдущие мысли между действиями, а второй использует сводку вместо грубого усечения.
После подключения к этой производственной системе показатель Astra подскочил с 62,7% до 99,9%. В задачах, успешно выполненных обеими сторонами, адаптер провайдера в целом работал примерно в 3,66 раза быстрее, а потребление токенов сократилось на 49%.
В некотором смысле это похоже на открытие плагина.
По сложной математике FrontierMath Tier 4 составляет 97,6%. Epoch AI, где базируется FrontierMath, заявила, что OpenAI профинансировала разработку теста и имеет эксклюзивный доступ к некоторым из его вопросов.
Оценки, заслуживающие внимания, включают:
DeepSWE v1.1 74,1%
BenchCAD 95,9%
Научное задание на терминале-стенде 64,6%.

Но на этот раз OpenAI, очевидно, не просто полагалась на ряд тестов, чтобы представить Astra.
Когда открываешь официальный сайт, дела публикуются практически один за другим.
KiCad, Excel, Blender, Power BI, заполнение форм в браузере, контроль качества сайта; затем ищете дом, находите врача, записываетесь на прием в DMV, составляете налоговые формы, составляете PPT, разрабатываете игры и анализируете данные научных исследований.
В последних нескольких поколениях выпусков GPT OpenAI в основном сообщал пользователям, на что может ответить модель; с Astra его фокус, похоже, изменился и стал следующим: сколько вещей у вас осталось, которые можно напрямую передать ИИ.
OpenAI даже прямо назвала Astra «лучшей моделью использования компьютера в мире».
Прогресс модели в «использовании компьютеров» может быть более важным, чем оценка. В Кодексе Astra реализован новый контекстный механизм: вместо простого сжатия сводки, когда контекстное окно заполнено, вы можете сохранять заметки в разных окнах и искать более ранние сообщения и выходные данные инструмента.
Astra также может продолжать работу над той частью, которая не зависит от ответа, когда определенный вопрос не решен, чтобы один нерешенный вопрос не блокировал всю задачу.
Конечно, возможности также напрямую заложены в цену.
Стандартная цена API GPT-6 Astra составляет: 10 долларов США за миллион входных токенов, 1 доллар США за кэшированные входные данные и 50 долларов США за выходные токены.
По сравнению с нынешними входными 4 долларами GPT-5.6 Sol, кэшем 0,4 доллара и выходными 20 долларами, цена всей линейки Astra была напрямую увеличена в 2,5 раза. Позиция OpenAI в этом отношении также очень ясна: если вы не знаете, какую флагманскую модель выбрать, вы можете выбрать Astra; если вас больше волнует стоимость, продолжайте использовать GPT-5.6 Terra или Luna.
Он по-прежнему обеспечивает 1,05 миллиона контекстов токенов и максимальное количество выходных токенов 128 000. Но длинный контекст также имеет дополнительные затраты: как и в серии GPT-5.6, когда один ввод превышает 272 000 токенов, входная стоимость всего запроса будет рассчитываться как 2 раза, а выходная — как 1,5 раза.
Итак, OpenAI фактически установила более дорогой интеллектуальный уровень для Astra.
Если вы просто задаете вопрос и меняете несколько абзацев текста, возможно, не стоит тратить в 2,5 раза больше цены.
Но если модель действительно может сидеть перед компьютером, непрерывно работать десятки минут или даже часов и выполнять всю задачу, которая раньше требовала от людей переключения программного обеспечения, проверки информации, заполнения форм и изменения файлов, то то, что действительно нужно сравнивать, — это уже не просто количество денег на миллион токенов.
Несколько технических моментов, на которые стоит обратить внимание
У Astra также есть несколько технических моментов, которые могут быть более примечательными, чем сам эталонный тест.
Первый — реверс-инжиниринг.
В этом выпуске OpenAI процитировала SRE-Bench. Это набор тестов обратного инжиниринга, запущенный в этом году такими командами, как Columbia DAPLab: исходный код модели не приводится, предоставляется только скомпилированная двоичная программа, чтобы проверить, сможет ли она переосмыслить логику программы и найти ключевое поведение.
Показатель успеха Astra составляет 88,0 % за одну попытку и 99,2 % за четыре попытки.
По тем же правилам доля GPT-5.6 Sol составляет всего 55,9% и 68,7% соответственно.

С человеческой точки зрения, столкнувшись с программой, которая была скомпилирована и почти не имеет удобочитаемого кода, ИИ начинает постепенно «забирать ее обратно» из машинных инструкций.
Это имеет прямое значение для анализа вредоносного ПО, исследования встроенного ПО, анализа уязвимостей и цифровой криминалистики.
Второе изменение заключается в том, что в Астре «больше не легко найти потерянные предметы» в чрезвычайно длительных миссиях.
В восьмиконтактном тесте поиска MRCR v2 точность Astra достигла 100 % при работе с контекстами от 256 КБ до 512 КБ; когда дело дошло до токенов от 512 тыс. до 1 млн, точность по-прежнему составляла 96,3%. Однако GPT-5.6 Sol имеет только 91,5% и 73,8% в этих двух интервалах соответственно.

В прошлом многие модели утверждали, что поддерживают миллионы контекстов, но если важная часть информации скрыта за пределами сотен тысяч токенов, модель могла почти забыть ее во второй половине процесса.
Astra начала подталкивать вопрос «насколько велико контекстное окно» к другому, более практическому вопросу: как долго агент может помнить то, что произошло раньше.
Для агента, которому необходимо работать непрерывно в течение десятков минут или даже часов, это может быть важнее, чем добавление сотен тысяч дополнительных окон токенов.
Кроме того, в Астре есть еще одно необычное изменение.
Он становится более согласованным, но его сложнее контролировать.
В наборе внутренних тестов безопасности использования компьютеров, опубликованных OpenAI, уровень нарушений в Astra снизился с 22,0% в Sol до 2,4%; в тесте, в котором конкретно проверялось, будет ли модель обходить ограничения для выполнения задачи, показатель Astra составил 0%. Тест на внутренние галлюцинации также снизился с 9,4% на Соле до 2,0% на Астре.
По крайней мере, согласно собственным тестам OpenAI, Astra значительно менее «хаотична». Но главный научный сотрудник OpenAI Якуб Пачоцкий также напомнил: «Прогресс интеллекта не гарантирует прогресс согласования».

Одна из причин в том, что Астра все меньше и меньше стал записывать весь свой мыслительный процесс.
Очень важным методом безопасности ИИ в прошлом было отслеживание цепочки мыслей модели: если модель собиралась превысить свои полномочия, атаковать определенную систему или тайно изменить свои цели, вы могли заранее увидеть подсказки в ее рассуждениях.
Однако OpenAI обнаружила, что Astra лучше контролирует свои письменные рассуждения. Некоторые проблемы, которые раньше приходилось решать путем написания множества шагов, теперь можно решить с помощью менее явных рассуждений; если модель знает, что ее мыслительный процесс контролируется, это содержание будет существенно изменено или сокращено.
Поэтому OpenAI больше не может сосредоточиться только на цепочке мышления.
Чтобы следить за Astra и не допускать совершения ею тех же атак, которые ранее появлялись на Sol, OpenAI установила в производственной среде «мониторинг смещения». Он одновременно наблюдает за рассуждениями модели, реальными действиями, вызовами инструментов и всей траекторией задачи.
Если система определяет, что модель может серьезно отклоняться от первоначального намерения пользователя, она может приостановить или даже прекратить выполнение задачи напрямую.
В API перехваченная задача может завершиться напрямую; в ChatGPT или Codex, в некоторых случаях пользователю будет предложено сначала подтвердить:
"Вы действительно этого от меня хотите?"

На уровне продукта имя модели API Astra — gpt-6-astra, и оно также входит в Amazon Bedrock.
OpenAI также запустила быстрый режим: цена увеличена вдвое, а максимальная скорость исполнения — примерно в 2,5 раза.
Для обычного общения это может быть непривлекательно. Но если Агенту изначально необходимо запустить в браузере и ПО 40 минут, а время сократить до десяти-двадцати минут, то сама скорость станет частью возможностей продукта.
Что касается подписки, Astra будет включена в существующую квоту подписки; Pro, Business и Enterprise также получат более мощный Astra Pro. По умолчанию Enterprise не включается напрямую, и администратор должен включить его вручную.
Правда, его пока нельзя открыть...
Сложная история, ограниченное открытие
Astra, возможно, является самой «исторической» моделью OpenAI на сегодняшний день.
Многие модели сначала выпускаются, а потом потихоньку выявляют проблемы, но Astra делает наоборот — конечно, не исключены некоторые маркетинговые приемы. Но прежде чем он был официально запущен, OpenAI потратил почти месяц, постоянно объясняя, почему его нужно более тщательно обучать, тестировать и открывать.
7 августа OpenAI впервые публично заявила, что последняя внутренняя оценка не позволила компании исключить возможность того, что Astra достигла «критического» порога возможностей кибербезопасности в соответствии с рамкой готовности.
1 сентября эта «возможность» стала формальным заключением: Astra стала первой моделью OpenAI, получившей критический рейтинг по возможностям сетевой безопасности.
Согласно собственным стандартам OpenAI, это означает, что при наличии правильных инструментов и прав доступа Astra смогла самостоятельно обнаруживать ранее неизвестные уязвимости и разрабатывать доступные эксплойты во многих защищенных реальных системах без необходимости пошагового руководства со стороны человека; или он может разработать и реализовать набор комплексных стратегий атаки против защищенных целей, просто задав ему цель высокого уровня.
Это уже не просто уровень «умения писать код атаки». На ExploitBench Astra сразу набрала 100%.

Чтобы модель не запоминала только общедоступные уязвимости, OpenAI подготовила еще один набор внутренних тестов и включила 20 уязвимостей высокого риска V8, которые были обнаружены только с июня по август 2026 года. Astra не только использует меньше выходных токенов, чем GPT-5.6 Sol, но также достигает значительно более высокого уровня успешного выполнения произвольного кода.
В ходе тестирования он даже обнаружил и использовал два ранее неизвестных уязвимостей нулевого дня и связал их в цепочку эксплойтов. OpenAI заявила, что в настоящее время раскрывает эти две уязвимости разработчикам.
Экспертное тестирование ближе к реальным атакам. Столкнувшись с усиленным браузером, Astra может полностью выйти из песочницы после обнаружения неизвестных уязвимостей и выполнить команды на хост-машине; в защищенной операционной системе он объединяет множество уязвимостей в локальную цепочку повышения привилегий для получения root-привилегий от обычных пользователей.
Именно во время этого процесса OpenAI впервые обнаружила, что опасные возможности модели начали влиять на то, как следует обучать саму модель.
18 августа OpenAI публично признала, что компания временно приостановила расширение масштабов обучения, в том числе приостановила обучение последней модели обучения с подкреплением, запланированное к развертыванию, на две недели.
В то же время выполнение большого количества задач по обучению и оценке с участием Astra по-прежнему приостановлено, поскольку они еще не были перенесены в новую безопасную среду.
Раньше, обсуждая безопасность ИИ, мы чаще всего спрашивали, можно ли безопасно передать модель пользователям после обучения; но здесь, в Астре, проблема перешла на стадию обучения.
Поэтому OpenAI заново усилила всю исследовательскую среду. Задача выполнения кода генерации модели требует более строгой изолированной программной среды; рабочие нагрузки с высоким уровнем риска требуют более сильной сетевой изоляции; Контрольная точка Astra добавляет шифрование и контроль доступа; все выводы Астры с помощью инструментов подлежат дополнительному контролю.
Сам этот набор мониторинга стоит даже недешево. По оценкам OpenAI, накладные расходы, вызванные одной только системой мониторинга, эквивалентны примерно 20% отслеживаемой вычислительной мощности вывода.
Другими словами, стоимость Astra заключается не только в «обучении более крупной модели», OpenAI также тратит значительное количество дополнительных вычислительных мощностей, чтобы следить за тем, что делает модель.
Это также объясняет, почему после официального выпуска Astra самые передовые возможности сетевой безопасности не были доступны всем напрямую.
OpenAI ясно дала понять, что производственная версия Astra по умолчанию по-прежнему будет устанавливать ограничения на запросы сетевых атак с высоким уровнем риска; более продвинутые рабочие процессы сетевой безопасности первоначально будут доступны небольшой группе альфа-тестеров, а затем постепенно будут доступны проверенным защищенным пользователям через Daybreak Blue.
Хотя обычные пользователи тоже получат Astra в ближайшие несколько дней, это не значит, что все получат абсолютно одинаковые возможности.
Такие ограничения могут даже стать причиной случайных травм. OpenAI заранее предупреждает, что дополнительные проверки безопасности могут замедлить, приостановить или даже остановить обычные задачи. Даже некоторые долгосрочные задачи агента, которые, казалось бы, не имеют ничего общего с сетевой безопасностью, также могут быть помечены неправильно.
Если задачи в ChatGPT или Кодексе приостановлены из-за мониторинга несовпадения, пользователю может потребоваться вернуться, чтобы подтвердить операцию, прежде чем продолжить; задачи в API могут быть завершены напрямую.
Эту часть изменения легко затмила «AGI» после выпуска Astra.
Чем более функциональна модель, тем больше возможностей человек может получить напрямую. Это начинает все больше и больше зависеть от того, сколько полномочий платформа готова вам предоставить.
Затем, после такой серии «Критических, приостановок тренировок, изоляции, мониторинга и поэтапного открытия», Грег Брокман заявил на брифинге для СМИ, посвященном выпуску Astra: «Добро пожаловать в эпоху AGI».
Он даже сказал, что если судить лично, то, по его мнению, «мы этого добились».
Но когда его спросили: «Официально ли OpenAI объявила о внедрении AGI?» Брокман признал, что AGI стал «серой, нечеткой вещью», больше похожей на «концепцию миссии» или «духовную концепцию», а не на технический стандарт, который можно точно нарисовать.
Ранее в «Подкасте Sources» Альтман не хотел всерьез обсуждать вопрос «когда мы внедрим AGI». Он считал, что термин AGI — «в лучшем случае очень расплывчатое понятие», и даже чуть ли не называл его «незначительным маркетинговым термином».
Причина не в том, что OpenAI дальше от AGI. Напротив, это потому, что, по мнению Альтмана, ОИИ, возможно, уже не так важен.
Что его действительно начало волновать, так это следующее слово: сверхинтеллект.
Альтман сказал, что год назад он не верил, что OpenAI находится на краткосрочном пути к сверхразуму. Теперь он думает, что это «может случиться».
Но я все равно хочу пожаловаться: не является ли ASI «незначительным маркетинговым термином»?
Комментарии