Intel раскрывает подробности о 256-ядерном процессоре Xeon 7: выпуск Diamond Rapids перенесен на 2027 год с ориентацией на рынок высокопроизводительных высокопроизводительных вычислений

📅 2026-08-26

Аннотация:

Недавно на конференции Hot Chips компания Intel объявила дополнительные технические подробности о своей серверной процессорной платформе нового поколения Xeon 7 Diamond Rapids (под кодовым названием DMR). Первоначально планировалось запустить платформу в 2026 году с максимальной конфигурацией в 192 ядра и 16 каналов памяти, но было подтверждено, что ее запуск будет отложен до 2027 года. В то же время Intel еще больше увеличила количество ядер своей флагманской модели до 256 ядер производительности, напрямую сравнивая серию AMD EPYC Venice шестого поколения, которая также имеет максимум 256 ядер.

В отличие от предыдущих продуктов, ориентированных на более широкий рынок серверов, Diamond Rapids будет ориентирован на высокопроизводительные вычисления. Эта платформа полностью отменяет технологию гиперпоточности, которую в отрасли часто называют одновременной многопоточностью (SMT), и предоставляет только высокопроизводительные версии точек доступа для рынка высокопроизводительных процессоров. Первоначально запланированный 8-канальный продукт Diamond Rapids-SP был отменен. Таким образом, DMR не будет охватывать все уровни линейки продуктов AMD, а будет сосредоточен на борьбе за ведущий рынок высокопроизводительных вычислений.

Ожидается, что в последующих продуктах Intel Coral Rapids будет вновь реализована технология гиперпоточности, а также может появиться новое поколение процессоров серии SP. Однако с точки зрения архитектурной сложности Diamond Rapids по-прежнему остается одним из самых сложных процессоров Intel Xeon на сегодняшний день. В определенной степени его конструктивная идея напоминает модульный маршрут чиплетов, представленный AMD в EPYC Rome в 2019 году: разделение вычислений, функций ввода-вывода и памяти, а затем гибкое объединение их в соответствии с различными потребностями продукта. Изучив несколько поколений продуктов, Intel, похоже, наконец нашла более подходящий для себя метод многоядерной интеграции.

Один процессор Diamond Rapids может содержать до 22 ядер, число которых может быть увеличено или уменьшено в зависимости от потребностей в вычислительной мощности, емкости кэш-памяти и конфигурации памяти. Эти ядра в основном делятся на три категории: до 16 вычислительных ядер, изготовленных по техпроцессу Intel 18A-P, 4 базовых ядра вычислительных блоков, изготовленных по техпроцессу Intel 3-T, и 2 масштабируемых ядра Fabric Hub на основе техпроцесса Intel 3, которые отвечают за соединение различных частей системы.

Среди них 18A-P представляет собой улучшенную версию процесса Intel 18A и относится к технологическому процессу уровня 2 нм. Intel утверждает, что при той же производительности этот процесс может снизить энергопотребление на 18%; при том же энергопотреблении это может привести к повышению производительности до 9%. Помимо улучшения процесса, Diamond Rapids также примет новую микроархитектуру ядра производительности, поэтому на реальную производительность также повлияют основные улучшения IPC.

Каждое вычислительное ядро ​​объединяет до 16 ядер и соответствующий им кэш второго уровня. До четырех таких вычислительных ядер будут размещены поверх базового ядра вычислительного строительного блока с использованием технологии прямого гибридного соединения Foveros 3D. Базовый чип имеет кэш-память L3: каждый вычислительный блок обеспечивает 320 МБ кэш-памяти L3, а топовая модель Diamond Rapids имеет общую емкость кэш-памяти L3 до 1,28 ГБ.

Intel не использует встроенные многоядерные межблочные мосты EMIB для соединения вычислительных модулей с модулями ввода-вывода и памяти. Вместо этого он использует решение для соединения корпусов, более близкое к стилю UCIe-S, которое передает данные через органическую подложку упаковки вместо кремниевого моста. Intel называет эту новую архитектуру кристалла «архитектурой разветвленных межсоединений».

Два масштабируемых чипа Fabric Hub объединяют контроллер памяти и интерфейс ввода-вывода. Их концепция дизайна аналогична кристаллу ввода-вывода в последних поколениях серверных процессоров AMD EPYC. Тиражируя такие кристаллы, Intel может расширить каналы памяти и возможности межсетевого взаимодействия. Два Fabric Hub могут обеспечить в общей сложности до 16 каналов памяти DDR5. Стандартная скорость памяти DDR5 может достигать 8000 МТ/с, а при использовании MRDIMM — 12 800 МТ/с.

Что касается расширенных возможностей подключения, Diamond Rapids поддерживает до 128 линий PCIe 6.0, CXL 3 или UPI 3, а также 8 линий PCIe 4.0, которые можно использовать для вспомогательных устройств ввода-вывода, таких как встроенная сеть, USB или контроллеры управления основной платой.

Этот дизайн также отражает изменения Intel в методах доступа к памяти. Предыдущие точки доступа Granite Rapids-AP по умолчанию представляли собой три узла неоднородного доступа к памяти (NUMA), тогда как Xeon 7 Diamond Rapids надеется предложить архитектуру унифицированного доступа к памяти (UMA). Благодаря новому методу соединения пакетов вычислительный строительный блок может напрямую взаимодействовать с двумя Fabric Hub, избегая проблемы доступа к различным модулям ввода-вывода посредством дополнительных переходов. Intel считает, что этот дизайн может не только помочь реализовать UMA, но и контролировать стоимость усовершенствованной упаковки.

Однако многие ключевые параметры платформы DMR еще не объявлены. Intel не указала максимальную частоту ядра и не раскрыла улучшение IPC нового ядра производительности по сравнению с Granite Rapids. Конкретные сведения об уровне кэша также ограничены, и в настоящее время можно подтвердить, что только емкость кэша L3 является очень значительной.

Что касается набора команд, Diamond Rapids будет поддерживать обновленные инструкции расширения матрицы AMX и добавит поддержку FP8 для повышения эффективности ЦП при выполнении задач машинного обучения. Этот процессор также станет одним из первых продуктов, полностью поддерживающих AVX 10.2. AVX 10.2 направлен на улучшение некоторых ограничений ранней реализации Intel AVX-512 и имеет большое значение для высокопроизводительных вычислений и суперкомпьютерных приложений.

Хотя UMA, как ожидается, станет конфигурацией по умолчанию, поддержка NUMA остается критически важной для рабочих нагрузок HPC, требующих разделения большого количества ядер на более мелкие домены ресурсов. Intel пока не подробно рассказала, как DMR будет реализовывать секционирование NUMA, но с архитектурной точки зрения процессор теоретически можно разделить на два, четыре или даже более суб-NUMA-кластеров. Открытие этой возможности может в основном зависеть от настроек BIOS.

Стратификация продукта — еще одна нерешенная проблема. На данный момент известно, что Intel выпустит 256-ядерную и 192-ядерную версии, однако неясно, насколько будет сокращено количество ядер. Теоретически Intel может адаптировать продукт к версии только с одним вычислительным блоком и 16-ядерным вычислительным ядром; но более реалистично предположить, что минимальная конфигурация Diamond Rapids может находиться в диапазоне от 64 до 128 ядер.

Судя по опубликованным спецификациям, ожидается, что Diamond Rapids станет самым конкурентоспособным поколением высокопроизводительных процессоров Intel за последние годы. AMD Venice EPYC и Intel DMR будут обеспечивать до 256 ядер, 16 каналов памяти, более 1 ГБ кэш-памяти третьего уровня и аналогичные возможности межсоединения; Ожидается, что тепловая расчетная потребляемая мощность флагманских продуктов обеих сторон составит около 600 Вт.

Очевидным недостатком Intel является отсутствие технологии Hyper-Threading. В некоторых рабочих нагрузках, которые сильно зависят от количества потоков, AMD все равно может добиться двузначного преимущества в производительности с помощью SMT, даже если производительность ядра обеих сторон одинакова. Но в мире высокопроизводительных вычислений гиперпоточность не всегда приносит пользу. Например, тест HPL, используемый для ранжирования суперкомпьютеров по всему миру, обычно не обязательно выигрывает от гиперпоточности. Ранее Арм даже заявлял, что в некоторых сценариях синхронизированная многопоточность может принести больше вреда, чем пользы.

Это также дает Diamond Rapids возможность позиционироваться Intel как песочница для агентов искусственного интеллекта с малой задержкой, например, среда выполнения кода Python, в которой размещается генерация искусственного интеллекта, или изолирующий контейнер для компиляции и запуска кода C и Rust. Но даже в этом случае существует высокая вероятность того, что DMR не станет массовым продуктом Intel, особенно в контексте продвижения Nvidia процессора Vera собственной разработки в качестве предпочтительного процессора на стороне хоста для систем искусственного интеллекта.

В конечном итоге рыночные показатели Diamond Rapids по-прежнему будут зависеть от цены и соотношения цены и качества. Когда AMD выпустила EPYC Rome, она, возможно, не смогла превзойти Intel по одноядерной производительности, но обеспечила более привлекательную стоимость единицы продукции благодаря большему количеству ядер, более богатому вводу-выводу и большим возможностям расширения памяти. Если Intel сможет предоставить больше ядер по более низкой цене, Xeon 7 все равно может быть конкурентоспособным для определенных клиентов, даже если AMD будет иметь лучшую абсолютную производительность.

Связанные теги

Похожие статьи

Комментарии

0/500
验证码
Нет комментариев