Аннотация:
Можете ли вы поверить, что первый чип OpenAI фактически превзошел всю серию NVIDIA? ! Только что первый чип собственной разработки OpenAI, Jalapeño, предоставил первую партию результатов измерений — производительность вывода ИИ, полностью превосходящую NVIDIA GB200 и GB300.


Взлетайте прямо на измеренной скорости!
Халапеньо может выдать 1459 токенов за одну секунду, тогда как Nvidia GB200 может выдать только 535 токенов, что меньше половины.
У «Pepper» на выполнение задачи требуется всего 1,65 секунды, а у GB300 — почти 6 секунд, то есть разница в 3,6 раза.
Самое жестокое то, что даже если GB300 принудительно использовать максимальную скорость декодирования, пропускная способность Jalapeño все равно будет в 104,3 раза выше, чем у него.
Номинальная потребляемая мощность Jalapeño составляет всего 700 Вт, а у GB300 — 1400 Вт, что составляет ровно половину.
Известный аналитик по полупроводникам Дилан Патель даже резко сказал: «Не только Blackwell был свергнут, даже чип Nvidia Rubin был превзойден»!

На какое-то время весь круг ИИ взорвался. Пользователи сети были поражены тем, что OpenAI была настолько сумасшедшей, что Nvidia также потерпела поражение.
Заявление Ультрамена было властным, но сдержанным: «Мы сделали чип, он невероятно быстрый»!


01
"Перец чили" перевернул флагман Nvidia
Это не OpenAI, говорящая о себе.
Полуанализ отправился в лабораторию для проведения реальных измерений, и заключение, которое они написали:—
Халапеньо победил все чипы Nvidia, AMD и Google, которые они тестировали ранее.
Насколько велика разница? Последняя версия Vera Rubin от Nvidia потребляет достаточно электроэнергии, чтобы накормить почти три халапеньо.

В ходе тестирования OpenAI выбрала для запуска три общедоступные модели: GPT-OSS 120B, а также модели 670B и 1T.
Этот раунд тестирования охватывает архитектуры MoE от среднего до триллиона параметров. Общие результаты таковы:
Нагрузка ИИ на ватт увеличилась в 1,5–1,9 раза
Сквозная задержка снижена в 1,7–3,6 раза
Увеличение производительности в 2,1–4,1 раза при высокоинтерактивных рабочих нагрузках

Упомянутые ранее 1459 токенов/с были измерены на GPT-OSS 120B.
Если преобразовать в интервал слов, между двумя токенами будет всего 0,69 миллисекунды.
Обычно человек читает около пяти-шести слов за одну секунду, а выплевывает 1459 слов за одну секунду. Глаза не успевают за ними, а экран не может их прочитать.

Зеленый — халапеньо, синий — самый крепкий. Эти три модели работают в 2,7 раза, 4,1 раза и 3,8 раза быстрее соответственно
Разрыв в четыре секунды между 1,65 секунды и 5,99 секунды в чате можно допустить, но другое дело, когда он используется на агенте, ведь задача требует десятков последовательных шагов, поэтому разницу нужно умножать.
Тогда говорилось, что вся сеть вращалась 104,3 раза.
Это означает, что при достижении GB300 максимальной скорости декодирования, составляющей 169 токенов в секунду, пропускная способность Jalapeño в 104,3 раза превышает его скорость.
Эта тенденция справедлива для трех моделей: GPT-OSS достигает 53,7 раза, а модель 1T — 56,1 раза.


Для той же модели при увеличении требуемой скорости производства слов опережающая маржа увеличивается с 1,7 раза до 104,3 раза
Другими словами, то место, где противник достигает предела и начинает задыхаться, находится именно там, где он еще спокойно курсирует.
Если пиковые значения рассчитываться на основе соответствующих лучших рабочих точек, разница будет намного меньше: в 1,9 раза, 1,7 раза и 1,5 раза для трех моделей соответственно.

Что действительно создает дистанцию, так это сцена с высоким уровнем взаимодействия

Горизонтальная ось левого изображения — это скорость вывода слова, а горизонтальная ось правого изображения — задержка полного запроса. Зеленый халапеньо давит синий GB200 на всей кривой
Полуанализ учитывает электропитание, тепловыделение и сеть, а затем распределяет их по каждому чипу.
В результате у Халапеньо — 1,125 киловатта на единицу, у GB200 — 1,87 киловатта, а у Веры Рубин — 3,3 киловатта.
При использовании GPT-OSS такого калибра Халапеньо выделяет около 53 миллионов токенов на мегаватт в секунду, а GB200 NVL72 — всего около 10 миллионов.

Фиолетовый цвет — халапеньо, горизонтальная ось — скорость взаимодействия, а вертикальная ось — количество токенов, выделяемых на мегаватт в секунду.
Что касается стоимости, то общая стоимость владения чип-часом составляет 1,56 доллара США для халапеньо, что почти столько же, сколько 1,55 доллара США для H100, а для Vera Rubin — 3,61 доллара США.

Зеленый — Вера Рубин, фиолетовый — Халапеньо. После 200 токенов в секунду фиолетовый дошел до места, недоступного для зеленого
Самое ужасное, что эти результаты не отражают всей силы Халапеньо.
Он даже не включает спекулятивное декодирование и прогнозирование токенов, а также не выполняет отдельное развертывание предварительного заполнения и декодирования. Однако каждый второй чип на картинке использует свою собственную оптимальную конфигурацию, и ни одна из оптимизаций, которые следует включить, не упущена.
По оценкам SemiAnaанализа, само по себе спекулятивное декодирование может снизить стоимость токена более чем на 2/3.

Халапеньо также может управлять «Убийцей Рока»
02
За девять месяцев GPT‑Astra проработала весь путь до комнаты с кассетами
В таком случае от проектирования до вывода OpenAI на пленку потребовалось всего девять месяцев. Для сравнения, общий срок в отрасли составляет 18-36 месяцев.
Все, кто занимался ASIC, знают, что самая изнурительная работа в этом цикле — верификация. Симуляцию приходится запускать снова и снова, и если вы поменяете место, вам придется начинать все сначала.
Причина, по которой OpenAI может «обманывать», заключается в том, что он приглашает свою самую мощную модель в комнату с кассетами ——
Модель, которая помогла разработать халапеньо, называется GPT-Astra, то есть GPT-6, о которой ходили слухи во внешнем мире!


На протяжении всего процесса GPT-Astra фактически оказывалась сильнейшей поддержкой команды.
Он помогает исследовать решения по реализации, сжимает до конца весь цикл «проектирование-измерение-проверка», а также микроманипулирует арифметическими схемами.
В какой степени осуществляется микроменеджмент? Цифры, полученные SemiAnaанализом, показывают, что проектирование с помощью искусственного интеллекта уменьшает площадь блока SIMD на 8%, а площадь матричного двигателя на 10%.
В то же время эти модули лучше первой версии по времени и энергопотреблению.

Вычислительный кристалл находится в центре, по три HBM4 с каждой стороны, верхний — чип ввода-вывода.
Основной расчетный штамп составляет около 840 квадратных миллиметров, а предел маски машины для литографии EUV составляет 858 квадратных миллиметров. Этот кусок кремния находится всего в 18 квадратных миллиметрах от физического потолка.
Можно сказать, что область, где можно использовать фотолитографическую машину для рисования, в основном занята, не осталось вообще ничего.

Розовая строка – халапеньо, а три крайних правых столбца — пропускная способность HBM на ватт, число флопов на ватт и соотношение вычислительной мощности к пропускной способности.
По пропускной способности HBM на ватт у Халапеньо — 22, на втором месте Рубин — 11,1, а у GB300 — всего 5,71. Это ровно в два раза выше второго места.
Количество флопов на ватт составляет 19,1, а у Рубина — 19,4. Эти два показателя почти равны, но «Рубин» потребляет более 1800 Вт, а «Халапеньо» — всего 700 Вт.
Это просто выполняется с шагами A0. B0 уже находится в производстве, и его производительность на ватт примерно на 25% выше, чем у A0.
Таким образом, опираясь на мощную комбинацию Codex и GPT-Astra, OpenAI всего за два месяца преобразовала три модели с открытым исходным кодом, которые изначально не планировались, в высокопроизводительное состояние.
Что еще более пугающе, так это то, что в наиболее требовательных к производительности модулях «внимания» и MoE код, набираемый ИИ, выполняется в 1,5–1,8 раза быстрее, чем лучшие специалисты-люди.
ИИ проектирует чип, чип управляет ИИ, а ИИ возвращается к оптимизации ИИ на чипе.
Этот маховик OpenAI уже крутится.


Ров CUDA мертв?
Самым глубоким рвом NVIDIA всегда была CUDA.
Накопленный за последние два десятилетия набор программного обеспечения развил мышечную память инженеров по всему миру. Каждый раз, когда оборудование меняется, им приходится его сносить и начинать все заново.
В статье SemiAnaанализ вынес очень суровое суждение, заявив, что ров CUDA, возможно, мертв.

Причина — скорость.
Они также добавили более душераздирающее сравнение: Рубин от Nvidia фактически завершил запись CoWoS на месяц раньше, чем Халапеньо.
Но до сих пор единственные результаты Rubin, которые может видеть внешний мир, — это данные инженерных образцов CoreWeave. Nvidia не привлекает третьих лиц в лабораторию для выборочного тестирования, как OpenAI.
Итак, проблема заключается в скорости запуска программного обеспечения. В самом оборудовании NVIDIA нет ничего плохого.
Начиная с нуля даже дает OpenAI преимущество. Ему не нужно нести исторический багаж, а архитектуру можно полностью нарисовать на чистом листе бумаги.
Последнее предложение SemiAnaанализа очень наглядно——
Они говорят, что модели OpenAI, такие как GPT-5.6 Sol, работающие на графических процессорах NVIDIA, использовались для разработки чипа, который действительно угрожает рову CUDA. Собственные графические процессоры NVIDIA в реальном времени порождают своих «преемников».

03
10 гигаватт, это только начало
Халапеньо – это лишь первый шаг на пути к успеху.
В октябре прошлого года OpenAI и Broadcom сделали большой шаг и подписали крупный заказ на сотрудничество по созданию специального ускорителя мощностью 10 ГВт.

Генеральный директор Ultraman и Broadcom Чэнь Фуян продемонстрировал пластину халапеньо с фирменной табличкой «Jalapeño Intelligence Processor»
Уровень 10 ГВт практически эквивалентен десяти атомным электростанциям, работающим на полную мощность.

Основной шкаф ЦП слева, шкаф ASIC справа, 128 микросхем в одном шкафу, общая мощность двух шкафов около 160 киловатт
Кстати, лоток, в котором находится процессор, называется Katsu, чип — Vindaloo Indian Curry, а переключатель — Chana nut. От японской кухни до острой индийской еды — эти люди действительно хотят, чтобы вы запомнили эту систему.
И халапеньо — это только первое поколение в дорожной карте, четко заявила OpenAI в отчете——
Gen2 уже находится в стадии глубокой разработки, Gen3 также находится в стадии формирования.
Массовое производство не будет постепенно наращиваться до 2027 года, а следующая веха — 100 мегаватт.

Однако только сегодня стало известно, что менеджер центра обработки данных OpenAI Крис Мэлоун ушел из жизни!
Мэлоун — глава Звездных врат.
Теперь IPO становится все ближе и ближе. На данном этапе потеря главного командира вычислительной инфраструктуры заставляет людей задуматься о скрытых тенденциях, стоящих за OpenAI.

Конечно, одного халапеньо недостаточно, чтобы свергнуть Nvidia.
Но настоящий сигнал опасности заключается в том, что OpenAI превратила модели, чипы и программное обеспечение в ускоряющийся маховик.
Сегодняшний Халапеньо — это только первое поколение, за которым следуют поколение 2, поколение 3 и вычислительная мощность 10 ГВт. Даже если основные руководители уйдут, это не сможет остановить дальнейшее движение вперед по этому пути.
Nvidia по-прежнему занимает трон.
Только на этот раз замена не выстроилась за дверью, а уже вбежала в компьютерный зал.
Конкуренты Nvidia наконец-то начали создавать свою собственную Nvidia.
Комментарии