На новый флагман уходит в среднем 6 дней. Большие модели обновляются так быстро, что люди не успевают за ними.

📅 2026-09-26

Аннотация:

Это безумие. Всего за два дня появилось 4 новые модели! На переднем крае компания xAI Лао Ма только что закончила выпуск Grok 4.7. Сразу после этого OpenAI внезапно отказалась от GPT-6 Sol и Luna, и цена была снижена вдвое. В тот же день Anthropic также выставила на продажу Claude Opus 5.5, который на 40% дешевле предыдущего поколения. 22 сентября анимационная картинка стала вирусной на X и собрала почти миллион просмотров.


В 2023 году большие модели будут обновляться каждые 73 дня, а в 2026 году — каждые 18 дней.

С момента запуска ChatGPT OpenAI и Anthropic атаковали 42 модели-блокбастеры (44, включая GPT-6 Sol и Luna, выпущенные в тот день).

Несколько часов спустя основатель Stability AI Эмад Мостак ретвитнул фотографию и добавил пророчество.

"Как сказал Алекс, такими темпами в начале следующего года будет по одному в день."

Два гиганта, выпускайте «обновление раз в полгода»

На самом деле количество «обновлений каждые 18 дней» довольно консервативно, поскольку оно учитывает только OpenAI и Anthropic.

From the beginning of this year to September 22, Anthropic released 8 flagship models, and OpenAI released 6. The 14 models were spread over 265 days, with an average of 19 days per model.

During the same period of time, the ten major domestic large model manufacturers released at least 28 more flagship models, an average of more than one every 9 days.

Было время, когда они запускались вместе. In the week before the Spring Festival, four companies launched new flagships one after another; from April 20th to 24th, four more companies took turns in the five days.

Taking both sides together, a new flagship emerges in an average of more than 6 days, which is not far from the "one a day" mentioned by Emad.


Anthropic's speed increase is visible to the naked eye.

В первом полугодии на выпуск модели уходило в среднем 46 дней, а во втором полугодии — 26 дней. Опус 4.8 — 28 мая, Опус 5 — 24 июля и Опус 5.5 — 22 сентября.

OpenAI идет по пути «сдерживания окончательного хода, а затем его устранения».

GPT-6 Astra только что взорвала всю сеть 3 сентября, и всего 19 дней спустя Сол и Луна последовали его примеру.

На следующей неделе состоится конференция DevDay. Altman lamented that this is the first time in his memory that OpenAI shouted "there are too many things to release" when preparing for a press conference.


Why is publishing becoming more and more dense? Ответ Anthropic дал в своем отчете. AI is already helping to create the next generation of AI.

In February this year, Claude could independently lead less than 1% of the AI ​​R&D work. After that, it improved almost every month, reaching 12% in May, 22% in July, and 26% in August.


В OpenAI по состоянию на середину августа количество рабочих дней, затраченных агентами ИИ, в 3,1 раза превышало количество рабочих дней, затрачиваемых исследователями-людьми (из расчета 8 часов в день).

В Anthropic четверть работы по созданию моделей передана самому Клоду. Следующие модели будут просто появляться одна за другой.

Очередь уже дошла до двери. Майк Кригер из Anthropic сообщил, что Sonnet 5.5 и Haiku 5.5 выйдут в ближайшие несколько недель.


Google Gemini 4 начал «самую амбициозную на сегодняшний день предварительную подготовку» еще в июле, и внешний мир делает ставку на то, что он будет представлен примерно в конце года. По крайней мере две отечественные компании официально анонсировали свои флагманы следующего поколения, при этом только одна дата выпуска отсутствует.

Добытая тяжким трудом «метафизика»

Он будет удален сразу через два месяца

Чем быстрее работает большая модель, тем более неловко она становится для людей, пишущих код на последующих этапах.

В конце июля вы не спали несколько ночей и только что перенесли приложение на Opus 5. Все параметры были настроены плавно, как шелк. Через два месяца вышел Opus 5.5, и вы радостно поменяли интерфейс — клик, и некоторые запросы прямо сообщали об ошибках.

Просматривая недавние официальные руководства по словам этих двух компаний, вы обнаружите, что они передают один и тот же факт. Многие из наследственных подсказок, которые вы написали для модели предыдущего поколения, превратились в макулатуру.

Первое, что нужно сделать, это вычитание.

В руководстве OpenAI четко указано, что инструкции по процессу, которые раньше были слишком подробными, теперь будут помехой. Такие слова, как «внимательно прочитайте документ перед изменением кода» и «не забудьте запустить тесты», можно удалить.


Руководство Anthropic также означает это.

Раньше к подсказкам часто приходилось добавлять предложение «Проверьте после завершения», но Opus 5 уже может проверять это самостоятельно. Если это предложение не удалить, оно будет перепроверено.

В Opus 5.5 рекомендуется удалить фразу PUA «тщательно подумайте, прежде чем ответить» в сцене чата. После его удаления ответ стал быстрее и качество существенно не упало.

После удаления старых приходится добавлять новые, ведь у каждого поколения новый характер.

Опус 5.5 всегда любит возвращаться назад и думать о вопросах, на которые уже были даны ответы в ходе нескольких раундов диалога, что является пустой тратой вычислительной мощности. Выпущен официальный патч: «То, что был дан ответ, уже прошло».


Параметры и значения по умолчанию также незаметно меняются.

В Opus 5.5 выключение режима мышления сразу сообщает об ошибке 400; без записи параметра усилия передача по умолчанию снижается с высокой до средней, а стоимость и эффект соответственно перетасовываются.

В связи с этим официальное предложение — повторно запустить тест усилий и не переносить напрямую старые настройки из Opus 5.

Набор слов-подсказок плюс набор параметров, каждое поколение должно снимать слои кожи. Если корректировка не была произведена, счет может сильно отличаться.

Лэнс Мартин из Anthropic продемонстрировал на видео, что старая подсказка, написанная для Opus 4.8, стоит 2,45 цента за заказ на работу, а прямая замена ее на Opus 5.5 стоит 2,02 цента. После повторной промывки официальными средствами точность увеличилась до 92,0%, а стоимость снизилась до 1,83 цента.


Кроме этого сокращается срок службы самой модели.

В этом году OpenAI опубликовала 9 объявлений об прекращении поддержки, касающихся более 40 моделей и функций.

Среди них GPT-5.5, который был выпущен только 23 апреля, будет удален из ChatGPT и Кодекса 14 октября и просуществовал менее полугода.

Даже собственная оценочная платформа Evals OpenAI закроется в конце ноября.

Почистить список? За полгода был разработан новый набор тестовых вопросов

Не беда, если люди не успевают, сейчас даже «экзаменационных работ» не хватает.

В марте этого года был запущен ARC-AGI-3, который, как утверждается, специализируется на искусственном интеллекте и тестирует IQ без запоминания вопросов. Gemini 3.1 Pro, занимавший на тот момент первое место, получил всего 0,37%, тогда как люди получили 100%.

3 сентября GPT-6 Astra поступила в экзаменационную комнату, набрав 62,7 % в стандартном тесте и напрямую достигнув 99,9 % при использовании специальной системы. В 96% уровней он сделал меньше шагов, чем человек.


Через полгода был составлен новый набор тестовых вопросов, и чиновники ARC начали думать о том, как подготовить следующее поколение оценок.

В списке кодирования (Next.js) Sol, Opus 5.5 и Fable 5.1 набрали 97 % и разделили первое место; В списке написания Opus 5.5 Fault лидирует на втором месте с результатом 307 баллов.

Этот результат является крупнейшим одиночным прыжком в истории списка. После прочтения блоггер сказал, что это возмутительно, и почти подумал, что в его собственном тесте есть ошибка!


Каждый раз, когда появляется новая модель, разработчикам приходится начинать процесс тестирования заново, как Сизифу.

Согласно текущему темпу, если в следующем году он действительно достигнет точки «одно обновление в день», слова-подсказки и ссылки агента, которые вы скорректировали сегодня, могут длиться не более недели.

Впервые скорость замены моделей полностью превысила скорость адаптации к ней людей.

Самыми медленными сегодня бегунами на самом деле являются те, кто использует искусственный интеллект.

Связанные теги

Похожие статьи

Комментарии

0/500
Captcha (click to refresh)
Нет комментариев