Gemini 4 Pro подозревают в утечке, а «замедление ИИ» — снова пустой разговор

📅 2026-09-19

Аннотация:

В последние несколько месяцев OpenAI и Anthropic по очереди продвигали свои флагманские модели, но Google казался необычайно тихим. Flash обновляется почти каждые три недели, при этом версии 3.6, 3.7 и 3.8 постоянно продвигаются вперед, но в Pro не было никаких изменений, что представляет собой наивысший предел возможностей. А пока в эти два дня на большой арене слепых испытаний моделей Arena внезапно появилась модель с названием Gemini-3.8-flash.


Как только разработчики приступили к работе, они заметили, что что-то не так. Выпущена настоящая флэш-память Gemini 3.8. Все знают, какой это должен быть уровень. Но с этой «3.8 Flash» производительность написания кода, создания SVG и запуска агента явно поднялась на ступеньку выше.



После нескольких раундов реального тестирования предположение быстро распространилось:

Эта модель, скорее всего, будет флагманом Google следующего поколения, скрытым за этикеткой, — Gemini 4 Pro.

Сразу после этого стало вирусным еще более преувеличенное сравнение показателей. Кодирование, Агент, Рассуждение, множественные оценки поставили GPT-6 Astra и Claude Fable ниже.


Всего несколько дней назад несколько крупнейших компаний, занимающихся искусственным интеллектом, открыто обсуждали, не пора ли сбавить темп. Теперь звук замедления еще не донесся до земли, и начался новый раунд соревнований.

За этой предполагаемой «моделью божественного уровня» Gemini 4 Pro скрывается более опасное ключевое слово:

RSI.


Возможна утечка данных о Gemini 4 Pro

2 сентября Google официально выпустила Gemini 3.8 Flash. По словам официальных лиц, это последнее поколение Flash в серии Gemini 3, в котором значительно улучшена разработка программного обеспечения, задачи агентов и сложные многоэтапные рассуждения; с 3.7 Flash на 3.8 Flash прошло всего три недели.

Поэтому, когда на Арене появилась еще одна модель с таким же названием Gemini-3.8-flash, разработчики быстро заметили аномалию.

Настоящая версия Flash 3.8 уже существует, и у каждого есть готовая ссылка. И эта модель выглядит явно сильнее, и это явно та сила, которую можно найти только в модели Pro.


Первая партия реальных тестов, положившая начало распространению, была сосредоточена на SVG, веб-страницах и 3D-сценах.

Разработчик Харшит попросил его нарисовать бокового домашнего кота с помощью SVG и совместить результаты с GPT-6 Astra Max и официальной версией Gemini 3.8 Flash. Эта версия для Arena имеет заметный разрыв с официальной версией Flash 3.8 с точки зрения контуров, пропорций и полноты деталей.


Слева направо: «4 Pro», Astra, 3.8 Flash

Пользователь сети @thtbee_ постоянно тестировал предполагаемую модель Gemini 4 Pro с разных точек зрения.

Пагода в стиле Voxel. Модель работала 8 минут и непосредственно генерировала полный набор интерактивных 3D-сцен.



На вертолете Airbus H145 потребовалось всего около 10 минут, чтобы создать полную страницу 3D-дисплея, которая очень детализирована. Однако этот пользователь сети сказал, что элементы пользовательского интерфейса внизу страницы «выглядят немного плохо».



Что касается веб-дизайна, модели потребовалось около 14 минут, чтобы создать монохромный тематический веб-сайт, который в целом был очень чистым и полным. Проблемы дизайнерского вкуса, на которые в прошлом часто жаловались Близнецы, похоже, на этот раз наконец-то решены.



Другой пользователь сети @Mr_Salio напрямую использовал эту предполагаемую модель Gemini 4 Pro для создания игр. Готовая графика достаточно плавная, а генерация мира и игровой дизайн также очень завершены.



Более важная подсказка исходит от разработчика Qwinah.

Он заявил, что успешно «призрачно перенаправился» на серверную часть Gemini 4 Pro, и опубликовал снимок экрана с подозрительной внутренней информацией терминала.

По его словам, G4P-ARGON и VIA_3.8_FLASH фигурируют непосредственно во внутреннем логотипе этой модели. Максимальный объем вывода достигает 256 КБ, контекстное окно превышает 10 миллионов токенов, а также имеет постоянную межсессионную память, работу в сети без API, внутреннюю автоматическую компиляцию и запуск сценариев и даже возможности физического управления роботами.


Если эта информация верна, то это, очевидно, уже не обычное обновление Flash.

В то же время в сообществе начала распространяться сравнительная таблица тестов Gemini 4 Pro.


Согласно данным на картинке, Gemini 4 Pro набрал 88,7% в тесте разработки программного обеспечения DeepSWE v1.1, 95,3% в тесте Terminal-Bench 2.1 на терминальном агенте, 72,1% в экспертном тесте на рассуждение знаний HLE-Verified и 86,8% в тесте агента по эксплуатации компьютера OSWorld 2.0.

Что еще более преувеличено, так это то, что в GDPval-AA v2, который измеряет реальную интеллектуальную работу, он записан как 2064 Elo, что прямо превышает отметку 2000 года.

Если эти данные верны, Gemini 4 Pro сможет просто «пробить Fable и пнуть Astra», одним махом встав на вершину передовых моделей.

Но чем больше преувеличено, тем осторожнее нужно быть.

Следует отметить, что эта контрольная таблица не полностью соответствует предполагаемому скриншоту серверной части, «выкопанному» Qwinah; оценка Astra, которая используется в качестве объекта сравнения в сравнительной таблице, не соответствует официальным данным; Оба материала официально не одобрены Google, Arena или соответствующими тестами и по-прежнему представляют собой лишь информацию, распространяемую в сообществе.

Единственная модель, которая может быть подтверждена, — это модель под названием Gemini-3.8-flash, которая совершенно не соответствует производительности Gemini 3.8 Flash.

Но есть еще одна очень важная причина, по которой все сразу указывают на Gemini 4 Pro: модель Google Pro слишком долго пустовала.

Gemini 3.5 Pro еще официально не запущен, а Gemini 4 уже подтвержден для участия в обучении. За последние несколько месяцев Flash продвигался вперед из поколения в поколение, и в линейке Pro никогда не было новой модели, которая действительно представляла бы верхний предел возможностей.

Теперь на Арене внезапно появился «Флэш 3.8» с явно ненормальными способностями.

В результате предположения, естественно, становятся все более обоснованными — Google, возможно, не намерен оставлять настоящее большое обновление до 3.5 Pro, а непосредственно до Gemini 4 Pro.


За Gemini 4 Pro

Самое важное ключевое слово – RSI

Если Gemini 4 Pro по-прежнему остается всего лишь слухами сообщества, то более примечательно то, что

Google значительно ускоряет скорость участия ИИ в разработке моделей.

В слухах о Gemini 4 Pro ключевое слово RSI упоминалось неоднократно.



RSI означает Recursive Self-Improvement, что означает рекурсивное самосовершенствование. Проще говоря, ИИ начинает участвовать в создании более сильного ИИ, а более сильный ИИ еще больше ускоряет разработку моделей следующего поколения.

После запуска этого цикла ускоряются не только сами способности модели.

Даже скорость эволюции модели начнет ускоряться за счет самой модели.

В августе этого года агентство Reuters сообщило, что соучредитель Google Сергей Брин в последние месяцы подталкивал Gemini к ускорению и назвал рекурсивное самосовершенствование одним из ключевых направлений.

Хотя Google публично не объявил о том, что достиг этого замкнутого цикла, он передает все больше и больше задач, которые изначально принадлежали исследователям, агентам, включая оценку моделей, поиск направлений для улучшения, проведение экспериментов, а затем передачу результатов обратно в процесс разработки модели.

Когда 2 сентября был выпущен Gemini 3.8 Flash, Google также упомянул в официальном описании, что длительный цикл агента «рекурсивно оценивает и улучшает базовую модель».


Исследователь Google DeepMind Яо Шуньюй (а не Яо Шуньюй из Tencent) использовал слова Армстронга, когда он высадился на Луне, чтобы описать это обновление после выпуска 3.8 Flash:

"Это один маленький шаг для модели и огромный шаг для RSI".


Недавно Google также включил слово «RSI» в название новой статьи.

14 сентября Google, GDM и другие команды выпустили Dream-RSI, в котором конкретно изучается, как дать агентам возможность достичь рекурсивного самосовершенствования посредством постоянного улучшения стратегий разведки. В разработке алгоритмов, математической оптимизации и задачах ядра графического процессора этот метод показывает более высокую эффективность исследования и более низкую стоимость поиска.

Именно из-за этого слухи о Gemini 4 Pro быстро завязались с RSI.

Слухи в сообществе не ограничиваются словами «Gemini 4 Pro очень силен», но также задаются вопросом, в какой степени Google достигла внутреннего RSI.

Очевидно, Google не единственный, кто идет по пути RSI.

17 сентября по американскому времени компания Anthropic раскрыла ряд внутренних данных по автоматизации исследований и разработок в области искусственного интеллекта.

Официальные лица Anthropic заявили, что причина, по которой они раскрыли эти показатели, заключается в том, что, по их мнению, внешний мир должен знать, какая часть исследований и разработок ИИ в передовых лабораториях начала выполняться самим ИИ.


Данные показывают, что по состоянию на август этого года Клод смог возглавить 26 % задач по исследованиям и разработкам в области антропного ИИ. То есть людям нужно только ставить цели высокого уровня и контролировать их, а Клод может практически выполнять задачи от начала до конца. В феврале и марте этого года эта доля составляла менее 1%.

В то же время более 90% задач исследований и разработок в области искусственного интеллекта в рамках Anthropic как минимум перешли на стадию сотрудничества с искусственным интеллектом.

В Китае Тан Цзе, основатель и главный научный сотрудник Zhipu, также недавно заявил: «Мы еще далеки от рекурсивного самосовершенствования, но появился самый маленький цикл: система оптимизации модели, модель системного обслуживания».


Большая статья Тан Цзе о X, обрезано только начало

В инженерной практике, раскрытой Zhipu, инфраструктурный агент, управляемый GLM-5.3, участвовал в проектировании, отладке и оптимизации инфраструктуры вывода GLM-5.3-Flash. Эта система работает на кластере из более чем 100 000 отечественных чипов искусственного интеллекта. С момента первого запуска до принятия на себя всего производственного трафика потребовалось всего две недели, в результате чего сквозная пропускная способность увеличилась в 3,2 раза по сравнению с первоначальным уровнем.


Слово «Помедленнее» в конечном итоге оставляет только предупреждение

Всего несколько дней назад Amodei призвал передовые компании, занимающиеся искусственным интеллектом, объединиться и «замедлиться».

Первое условие, на которое он указал, на что следует обратить внимание, — это RSI.

Прогресс моделей сам по себе, конечно, хорош, но проблема в том, что если ИИ начнет участвовать в производстве ИИ следующего поколения, скорость прогресса модели может быть все быстрее и быстрее, но скорость человеческого понимания, оценки и контроля над ней не может при этом ускориться.

Поэтому Амодей неоднократно подчеркивал, что сторонняя оценка, общие стандарты безопасности и механизмы замедления должны быть установлены заранее, прежде чем возможности превысят определенные пороговые значения.

Поскольку, как только RSI действительно сформирует положительную обратную связь, модель может пересечь «безопасную дистанцию» торможения.

Что касается риска, несколько передовых лабораторий действительно пришли к единому мнению.

Альтман публично согласился с «замедлением темпов разработки передового искусственного интеллекта» и пообещал, что OpenAI также представит независимых рецензентов с аналогичными правами сотрудников; Маск сказал, что «Дарио прав»; Хассабис также сказал, что это правильное направление, но как это сделать, нужно продолжать обсуждать.

Но в инициативе также упоминается, что нет смысла замедляться в одиночку. Если исследования и разработки ИИ продолжат ускоряться с помощью ИИ, то для действительно эффективного замедления или приостановки в будущем потребуется установление набора общих правил: таких как введение независимых оценщиков и разрешение передовым лабораториям совместно устанавливать пороговые значения возможностей и меры безопасности, а также координировать действия для замедления темпов исследований и разработок, когда это необходимо.

Но до сих пор по разным конкурентным причинам единые правила не установлены.

Все уже могут дружно сказать, что «нам следует быть осторожными», но когда дело доходит до того, «как именно замедляться, кто должен замедляться первым и должны ли замедляться другие страны», консенсус быстро исчезает.

Между лабораториями существует самая прямая конкуренция моделей, а между странами существует более серьезная конкуренция в области ИИ. Если какая-либо страна замедляется в одиночку, она рискует уступить преимущество своим противникам; если какая-либо страна введет ограничения в одиночку, она будет беспокоиться о том, что другая сторона продолжит ускоряться.

Поэтому некоторые передовые лаборатории искусственного интеллекта ведут себя несколько противоречиво в своих словах и делах.

Со стороны Google есть упомянутый выше Gemini 4 Pro, который, как предполагается, был анонимно протестирован на Arena.

Что касается антропной стороны, то в последнее время в сообществе также начали появляться полутоновые следы Opus 5.2. Некоторые пользователи Claude Code заявили, что они увидели логотип новой модели claude-opus-5-2 через статус работы и информацию о маршрутизации запросов, и подозревали, что некоторые запросы были переведены в оттенки серого на Opus следующего поколения.


Что касается OpenAI, некоторые люди сказали, что видели название модели gpt-6-sol в фоновом списке моделей, а некоторые сказали, что подозревали, что они были переведены в оттенки серого на новую модель. Согласно широко распространенной новости, GPT 6 Sol может выйти на следующей неделе, а может быть, это может быть в День разработки 29 сентября по американскому времени... Короче говоря, это не за горами.


Очередной раунд моделей из трех передовых лабораторий искусственного интеллекта начал проявлять следы тестирования в сообществе.

Наиболее верным результатом этого раунда «инициативы по замедлению» на данный момент является не то, что какая-либо компания действительно замедлилась, а то, что наиболее важные компании, занимающиеся искусственным интеллектом, заранее публично говорили о рисках.

Модель не замедляется.

Но, по крайней мере, если однажды что-то случится, они смогут сказать: мы их предупредили.

Связанные теги

Похожие статьи

Организация Объединенных Наций объединяется с Google, чтобы реконструировать глобальную статистическую базу данных, чтобы она была более адаптирована к инструментам искусственного интеллекта и средам взаимодействия на естественном языке. 2026-09-18 ИИ отвечает, как уничтожить человечество, роботы-убийцы занимают последнее место 2026-09-11 Законность использования контента, защищенного авторским правом, для крупномасштабного обучения языковым моделям остается спорной. Правительство США публично поддерживает OpenAI 2026-09-03 Ходят слухи, что Anthropic планирует запустить новое поколение моделей искусственного интеллекта накануне IPO, чтобы повысить доверие рынка капитала. 2026-09-19 Anthropic Claude будет совместим со спецификацией инструкций OpenAI Markdown. 2026-09-19 Мета-помощник AI Muse входит в систему Mac и может напрямую выполнять задачи от имени пользователей. 2026-09-18

Комментарии

0/500
Captcha (click to refresh)
Нет комментариев