Сообщается, что Nvidia перезапускает проект искусственного интеллекта Rubin CPX и переходит на 168 ГБ памяти HBM4.

📅 2026-09-01

Аннотация:

По словам аналитика цепочки поставок Минг-Чи Куо, ранее отложенный проект NVIDIA по ускорителю искусственного интеллекта Rubin CPX теперь перезапущен, а архитектура памяти была переработана. Изначально планировалось, что этот продукт будет оснащен 128 ГБ видеопамяти GDDR7, но теперь он оснащен 168 ГБ высокоскоростной памяти HBM4.

В конце прошлого года компания NVIDIA объявила, что планирует разработать специальный ускоритель на базе семейства графических процессоров Rubin, предназначенный в основном для крупномасштабных рабочих нагрузок агентного искусственного интеллекта. После анонса проекта сообщалось, что он временно отложен, но Nvidia, похоже, завершила перепланировку. Rubin CPX будет развернут в независимых стойках, каждая стойка может быть оснащена от 64 до 256 независимыми графическими процессорами CPX.

В отличие от обычных графических процессоров Rubin, отвечающих за задачи декодирования, графические процессоры CPX в основном используются на этапе «предварительного заполнения» в процессе вывода больших языковых моделей и отвечают за обработку входного контекста и кэша KV. NVIDIA пытается разделить задачи предварительного заполнения и декодирования: графический процессор CPX берет на себя работу по предварительному заполнению, а затем обычный графический процессор Rubin отвечает за декодирование, тем самым повышая общую эффективность вывода.

Стойочный лоток, оснащенный 8 графическими процессорами CPX, может обрабатывать до 1,34 ТБ длинных контекстных данных предварительного заполнения и связанного с ним KV-кэша, и все это опирается на память HBM4. HBM4 может обеспечить более высокую пропускную способность памяти, помогая ускорить обработку длинных контекстных данных. Поскольку предыдущая конструкция не требовала встроенного HBM4, Nvidia также должна была перепроектировать корпус чипа и, как ожидается, будет использовать передовую технологию упаковки TSMC CoWoS-S или CoWoS-L.

Что касается вычислительной производительности, Rubin CPX использует монолитную конструкцию чипа и может обеспечить 30 гигафлопс вычислительной производительности NVFP4 или 30 PFLOPS. Чип также включает в себя 4 механизма кодирования видео NVENC и 4 механизма декодирования видео NVDEC, что позволяет ему выполнять более эффективные рабочие нагрузки, связанные с мультимедиа, не полагаясь на внешние процессоры.

Поскольку масштаб параметров больших языковых моделей приближается к уровню триллионов, ожидается, что передача задач предварительного заполнения и задач декодирования на разные стойки значительно увеличит скорость генерации и доставки токенов. Nvidia также рекомендует поддерживать соотношение графических процессоров CPX и обычных графических процессоров Rubin в стойке декодирования 1:1.

Связанные теги

Похожие статьи

Комментарии

0/500
Captcha (click to refresh)
Нет комментариев