Аннотация:
Долгожданная
GPT-6 Astra
иGPT-6 Astra Pro
Официально выпущен! GPT-6 Astra — самая умная и скоординированная модель в мире, устанавливающая новый стандарт в использовании компьютеров, браузеров, разработке программного обеспечения, кибербезопасности, науке и профессиональной деятельности.

Эра AGI была в одностороннем порядке объявлена OpenAI «открытием»...
По итогам конференции GPT-6 президент OpenAI Грег Брокман прямо сказал:
Добро пожаловать в эпоху искусственного интеллекта. (Добро пожаловать в эпоху искусственного интеллекта)
Неудивительно, что группа Клода и Грока отключилась. Оказалось, что Астра просканировала Интернет после его активации и напрямую уничтожила все LLM на земле——
Альтрон (версия OpenAI) действительно здесь (дож).

Конечно, OpenAI в настоящее время действительно не является сдержанным, поскольку масштабы обучения и обновления возможностей полностью достигнуты.
Согласно отчетам, Astra — это крупнейшее учебное задание в истории OpenAI, в котором используется более
100 000 графических процессоров в кампусе Звездных врат в Техасе
Пройдена предварительная подготовка.Это также первый флагманский продукт OpenAI, который активно участвует в контроле обучения на моделях предыдущего поколения.
Что за старик, выдвигающий новое, RSI OpenAI действительно меняется...
Цена GPT-6 также была официально объявлена, а цена API составляет:
Вход: 10 долларов США/миллион токенов;
Выход: 50 долларов США за миллион токенов
Эквивалент
в 2,5 раза больше, чем у GPT-5.6 Sol, как и в только что выпущенной Fable 5.1
.(Текущая официальная цена GPT-5.6 Sol составляет 4 доллара США за вход и 20 долларов США за выход/миллион токенов)

Сравнительное тестирование близко к «насыщению»
Основное изменение GPT-6 Astra на этот раз заключается в продолжении перехода от «ответов на вопросы» к «непосредственному выполнению работы».
Он может не только генерировать фрагмент текста или кода, но также управлять компьютерами и браузерами, вводить различное программное обеспечение для выполнения многоэтапных задач и, наконец, доставлять документы, формы, презентации, веб-сайты и даже инженерные проекты, которые можно использовать напрямую.
Что касается табеля успеваемости... все, кто его видел, говорили, что он возмутителен, и три результата особенно привлекли внимание:
FrontierMath, уровень 4, версия 2: 97,6 %
ARC-AGI-3: 99,9% (у предыдущего поколения GPT-5.6 Sol было 7,8%)
ExploitBench: 100 %
Сложная математика, рассуждения в незнакомой среде, эксплуатация уязвимостей — почти все получили высшие оценки.

Среди них ARC-AGI-3 — тест, специально разработанный для проверки способности крупных моделей адаптироваться к незнакомой среде. Без объяснения правил модель напрямую бросается в двухмерную игру, которую она никогда раньше не видела, и ей разрешается играть и исследовать, как пройти уровень.
Эта оценка означает, что, столкнувшись с проблемой, которая никогда раньше не наблюдалась и не имеет готового решения,
Astra продемонстрировала сильные способности независимого исследования и изучения правил
.Однако в этом результате используется операционная среда OpenAI Responses API Harness.
OpenAI заявила, что этот набор Harness скорректировал две настройки, чтобы приблизить тест к использованию реальных агентов, но не оптимизировал ARC-AGI-3 конкретно.
Поэтому 99,9 % — это не только результат использования базовой модели, но также включает в себя преимущества, полученные за счет управления памятью и среды запуска агента.
На этот раз программирование также является ключевым направлением обновления Astra.
В Terminal-Bench 4.0 Astra набрала 57,7%, превысив показатель Fable 5.1 (55,8%) и GPT-5.6 Sol (37,3%).
В DeepSWE v1.1 Astra получает 74,1%, что выше, чем у Sol 72,7% и 67,4% у Fable 5.1.

Что касается математики и естественных наук, Astra также достигла ряда высоких результатов.
В сложном тесте по математике FrontierMath Tier 4 v2 он набрал 97,6%; в научных вопросах и ответах для выпускников GPQA Diamond он достиг 96%, что немного выше, чем 95,3% у Gemini 3.8 Flash.

Наиболее заметное изменение заключается в том, что Astra сочетает возможности кодирования с использованием компьютера. Он не только генерирует код, но также может входить в терминал и инструменты разработки для выполнения, тестирования, обнаружения проблем, а затем продолжения его модификации.
Это изменение более очевидно в тестах агентов, которые ближе к реальной работе.
На
Последнем экзамене агентов
Далее Astra набрала 59,3%, превысив показатель GPT-5.6 Sol (53,6%) и Claude Opus 5 (55,5%).
Этот тест помещает его в реальную компьютерную среду, позволяя одновременно работать с программным обеспечением, терминалами и файлами, выполнять длительные задачи в научных исследованиях, инженерном деле, финансах и других областях, а также выносить суждения на основе конечных результатов.
И в
AutomationBench
, который ближе к реальному офисному процессу На GPT-5.6 Sol показатель Астры увеличился с 18,1% до 41,4%, также превысив Fable 5.1 (31%).
Этот тест не только проверяет, выполнена ли задача, но также показывает стоимость API, необходимую для ее выполнения.
Как видно из рисунка, результаты Астры при разных настройках стоимости существенно выше, чем у Сола.
OSWorld 2.0 исследует возможности более непосредственного управления компьютером. В автономном тестировании Astra достигла 72,6%, а GPT-5.6 Sol — 65,7%.
В среднем на выполнение одной задачи Astra требуется около 40 минут, а Sol — около 75 минут, что означает сокращение затрат времени примерно на 47 %.

По мере повышения точности время, необходимое для выполнения задач, также сокращается. Это также объясняет замаскированную высокую цену Astra.
OpenAI считает, что по сравнению с тем, сколько денег тратится на миллион токенов, действительно значимым показателем является то, сколько денег требуется для выполнения задачи.
На пресс-конференции Грег Брокман также упомянул, что один вызов модели обходится дороже, но если можно сократить объем доработок и выполнить всю работу за меньшее количество шагов, общая стоимость может быть ниже.
Но самое особенное в Astra — это
сетевая безопасность
.Он получил высшую оценку на ExploitBench и улучшился с 30,3 % до 42,4 % у Sol на ExploitGym.
С учетом новых уязвимостей, обнаруженных за последние три месяца, показатель успеха Astra составил 39%, а Sol — всего 5,5%. В ходе тестирования Astra также обнаружила и использовала две ранее неизвестные уязвимости нулевого дня V8.
После того, как его возможности стали сильнее, OpenAI также специально проверила, сможет ли он пересечь черту, чтобы выполнить задачу.
В моделируемой задаче сетевой безопасности OpenAI намеренно оставил в окружающих системах уязвимости-ловушки, которые можно использовать. Когда исходную задачу было трудно выполнить, 48,2% тестов GPT-5.6 Sol показали выход за пределы поля, а у Astra — 0%.
Другими словами, Astra не только лучше находит лазейки, но и лучше знает, какие системы трогать нельзя.

Что касается того, как эти оценки будут выглядеть в реальности, OpenAI также подготовила большое количество демонстраций.
Войдите в KiCad, чтобы нарисовать печатную плату самостоятельно
В случае электронной инженерии Astra напрямую вошла в KiCad, чтобы завершить разводку печатной платы на основе электронной принципиальной схемы.
Необходимо разместить компоненты, спланировать их расположение, а затем соединить медными проводами между различными компонентами и, наконец, получить печатную плату, которую можно будет ввести в производственный процесс.
Разметка печатной платы изначально представляла собой задачу, которая в значительной степени зависела от ручного опыта, а также была обычным трудоемким этапом при разработке электронного продукта.
Astra пока не может заменить профессиональных инженеров, но действительно начала использовать профессиональное программное обеспечение.
В дом можно пройти два шага
Другой случай более интуитивен. Астра сначала построила модель дома в Blender, затем импортировала ее в Unreal Engine 5 и, наконец, создала трехмерное пространство, по которому можно свободно ходить.

От моделирования до игровых движков — вся работа охватывает различное программное обеспечение и форматы файлов. Модель должна не только генерировать контент, но также понимать интерфейс и инструменты управления, а также обеспечивать возможность связи предыдущих и последующих шагов.

OpenAI также продемонстрировала такие примеры, как производство гоночных игр компанией Astra.

Мы также начинаем обращать внимание на возможность прямой отправки PPT и форм
В профессиональных офисных сценариях Astra может создавать презентации на основе существующих шаблонов компании, а не просто выводить кучу текста, ожидающего набора человеком.
OpenAI предоставила ему несколько страниц шаблонов PPT вымышленных продуктов GPT-Gaia, а Astra подготовила на их основе полную презентацию, продолжая формат, визуальный стиль и повествовательную структуру исходного шаблона.

Преобразуйте часы выполнения поисковых задач в минуты
Astra также выполнила такие задачи, как поиск педиатра, проверка квартир, запись на прием в DMV, поиск низкоуглеводных закусок и анализ детских садов.
На одно из заданий по поиску педиатра Астре потребовалось 2 минуты 54 секунды, тогда как на выполнение той же задачи у человека ушло бы примерно 5 часов.

Раньше, когда компании хотели использовать внутреннее программное обеспечение для больших моделей, им обычно приходилось разрабатывать API, плагины и соединители для каждой системы отдельно.
Но большинство программ имеют набор универсальных интерфейсов, предназначенных для людей, таких как экран, мышь и клавиатура.
По мнению Брокмана, пока модель хорошо подходит для использования на компьютере, она может напрямую управлять этими интерфейсами, как человек, без необходимости ждать, пока каждое программное обеспечение создаст выделенный канал для ИИ.
Это также наиболее очевидное отличие Astra от традиционных чат-ботов.
Людям не нужно постоянно указывать, куда нажать дальше. Им нужно лишь объяснить цели и границы, а затем проверить окончательные результаты.
Продолжайте выполнять длительные задачи в Кодексе
Использование компьютера решает, «как это сделать», а контент обновления, опубликованный Кодексом, решает, «как непрерывно завершать одно дело».
Раньше, когда задача выходила за пределы контекстного окна, Кодекс обычно сжимал предыдущую информацию посредством сжатия.
Однако при сжатии могут быть упущены ключевые детали, например, почему исправление не удалось, какие тесты были проведены или какие ограничения изначально предложил пользователь.

С помощью Astra Codex может сохранять рабочие заметки в контекстных окнах и искать предыдущие сообщения и выходные данные инструмента. Даже если какой-либо элемент информации не включен в сводку, его можно найти позже.
Astra также может запрашивать у пользователей дополнительную информацию во время работы. Разделы, не относящиеся к ответу, не будут останавливаться и ждать ответа; только когда речь идет о важном выборе, он делает паузу и ждет подтверждения.
OpenAI также обновила систему управления использованием компьютеров Кодекса. В тесте Mind2Web новая платформа в сочетании с Astra выполнила задачи в 1,9 раза быстрее, чем текущая версия GPT-5.6 Sol.
Кто-то над этим уже работает
Astra еще не запущена в крупные масштабы, но уже началась первая партия корпоративных испытаний.
Legora, юридическая платформа искусственного интеллекта, использовала Astra для одновременной сверки 41 финансового документа. Весь процесс занял всего несколько минут, и были обнаружены все четыре встроенные ошибки, включая разницу в 500 000 фунтов стерлингов в примечаниях о доходах.
Если рассматривать только эту работу, Astra почти на 40 % быстрее модели предыдущего поколения; но при усреднении по всем задачам агента Legora улучшение составляет около 3%.

С другой стороны, игровая компания Playco позволяет Astra напрямую входить в Unity и Godot для создания игр.
С одним и тем же черновиком «серого ящика» он предлагает сразу 3 игровых прототипа с разными темами, и большинство из них можно запустить в первой версии.
По отзывам Playco, объем работ по ручному ремонту сократился вдвое, а пространственное мышление, восстановление эталонных изображений и внутриигровой пользовательский интерфейс также стали намного лучше, чем в предыдущем поколении.
Оба примера показывают, что GPT-6 Astra фокусируется больше не только на ответах на вопросы, но и на завершении всего рабочего процесса с реальным программным обеспечением и сложными материалами.
Он может непрерывно считывать информацию, вызывать инструменты, проверять результаты, а затем изменять свои выходные данные на основе обратной связи.
Согласно официальным новостям, Astra будет доступна пользователям ChatGPT Plus, Pro, Business и Enterprise, а Astra Pro будет доступна пользователям Pro, Business и Enterprise.
Обычным бесплатным пользователям... придется пока подождать.
Считается ли это искусственным интеллектом?
Можно сказать, что на этот раз OpenAI проявил себя довольно смело.
На пресс-конференции Грег Брокман заявил, что лично он считает, что
мир вступил в эпоху AGI
——То есть комплексный интеллект системы искусственного интеллекта превосходит человеческий.
Через несколько лет, когда мы оглянемся назад и спросим, когда родился AGI, ответ, вероятно, будет сейчас, и Astra может стать отправной точкой.
Я правда без ума от тебя...
OpenAI представила здесь покерный стол, стоит с нетерпением ждать, когда Anthropic предпримет следующие действия (doge)
После выпуска GPT-4 ученый из Microsoft Себастьян Бубек опубликовал статью, в которой говорилось, что «GPT-4 — это ранняя искра для AGI».
Задача по рисованию единорога с использованием пакета рисования LaTeX TiKZ призвана проиллюстрировать, что GPT-4 обладает гибким пониманием концепций, заложенных в языке.

Позже я перешел на GPT-5.4. Хотя рисунки становились все более и более изысканными, они все еще относились к «категории простых рисунков».

С последней версией GPT-6 совершенно невозможно сказать, что она нарисована с помощью кода.

Действительно, не будет преувеличением сказать, что он претерпел качественные изменения по сравнению с «ранней искрой ОИИ».
Комментарии