NVIDIA недавно провела углубленный анализ своей новейшей архитектуры графического процессора Rubin, продемонстрировав ее основные достижения в достижении крупномасштабных вычислений на уровне нескольких стоек, мультисистем и центров обработки данных. Являясь важной вехой в развитии технологий компании, этот ускоритель может обеспечить до 50 петафлопс вычислительной мощности при редких операциях NVFP4.

На полной мощности графический процессор Rubin объединяет до 224 потоковых мультипроцессоров (SM) и 288 ГБ памяти HBM4. Имея 336 миллиардов транзисторов, Nvidia также оснастила его 896 тензорными ядрами с движком Transformer третьего поколения. Чтобы высвободить огромную вычислительную мощность, NVIDIA делит ресурсы графического процессора на кластеры графических процессоров с централизованным кэшем L2, дополненным механизмом GigaThread для координации рабочего процесса и оптимизации использования ресурсов. Кроме того, функция разделения управления MIG позволяет разделить этот графический процессор на несколько виртуальных графических процессоров, что работает аналогично тому, как современные процессоры обрабатывают виртуальные ядра.

Что касается конфигурации памяти, Nvidia работала с партнерами по памяти, чтобы предоставить 288 ГБ памяти HBM4 посредством 12-слойных модулей. Выделенный контроллер HBM взаимодействует с физическим уровнем для достижения пиковой пропускной способности памяти до 22 ТБ в секунду, что является чрезвычайно конкурентоспособным показателем в отрасли. Его менеджер тензорной памяти был модернизирован для повышения эффективности передачи данных, а вертикальное расширение и связь всего графического процессора полностью управляются NVLink 6. Благодаря NVLink 6 архитектурная пропускная способность полностью взаимосвязанной связи графического процессора достигает 3600 ГБ в секунду, а технология межчипового соединения NVLink-C2C достигает 1800 ГБ в секунду пропускной способности связи между процессором и графическим процессором. Nvidia также имеет встроенный коммутатор PCIe Gen 6 с пропускной способностью 256 ГБ в секунду для обмена данными с внешними устройствами.

Масштабируемая связь — одна из основных сильных сторон NVIDIA, позволяющая графическим процессорам эффективно и беспрепятственно взаимодействовать с другими графическими процессорами в стоечных системах. Традиционная связь между графическими процессорами часто требует координации и синхронизации, что приводит к задержкам, когда система зависает в ожидании передачи данных. Чтобы решить эту проблему, архитектура Rubin представляет механизм связи, инициируемый устройством, позволяющий каждому графическому процессору независимо управлять передачей данных, тем самым устраняя необходимость во внешней оптимизации и эффективно уменьшая задержку.

Такие высокопроизводительные системы часто сопровождаются огромным энергопотреблением, а одна стойка NVL72 объединяет 72 графических процессора. Для системы Vera Rubin NVL72 NVIDIA разработала интеллектуальную технологию сглаживания мощности, которая объединяет все компоненты системы в единый фиксированный диапазон мощности. Например, при выполнении рабочих нагрузок искусственного интеллекта требования к электропитанию могут сильно колебаться между состояниями простоя, ожидающими полной загрузки процессора и графического процессора. Благодаря интеллектуальной технологии сглаживания мощности среднее энергопотребление системы Vera Rubin NVL72 снижается примерно на 10 % по сравнению с Grace Blackwell NVL72 предыдущего поколения, а пиковая мощность в течение 50 миллисекунд снижается примерно на 20 %. Оптимизация бюджета мощности дополнительно поддерживается технологией NVIDIA DSX MaxLPS.