Разбираем состав платформы и заявленные характеристики Rubin GPU, Vera CPU, NVLink 6 и Groq 3 LPX.
На CES 2026 NVIDIA представила Rubin как платформу из шести новых чипов: CPU Vera, GPU Rubin, NVLink 6 Switch, ConnectX-9 SuperNIC, BlueField-4 DPU и Spectrum-6 Ethernet Switch. В марте 2026 года компания добавила седьмой — Groq 3 LPU в составе системы LPX для низколатентного инференса. Rubin находится в серийном производстве, а поставки продуктов на его базе запланированы на вторую половину 2026 года.
По данным NVIDIA, Rubin может обеспечить до пятикратного прироста производительности инференса и до 3,5-кратного прироста производительности обучения по сравнению с Blackwell. Это показатели производителя; фактический прирост зависит от модели, точности вычислений, размера пакета и конфигурации системы.
NVIDIA указывает до 50 PFLOPS производительности NVFP4 в инференсе с использованием Transformer Engine и до 35 PFLOPS плотных вычислений NVFP4 при обучении. Также заявлены 288 ГБ памяти HBM4 и пропускная способность памяти до 22 ТБ/с. Без тестирования эти показатели нельзя напрямую переносить на другие числовые форматы и рабочие нагрузки.
NVLink 6 обеспечивает до 3,6 ТБ/с пропускной способности на GPU. Стоечные системы Vera Rubin NVL72 используют жидкостное охлаждение.
Vera CPU использует 88 собственных ядер Olympus с полной совместимостью с архитектурой Arm и поддерживает 176 потоков. NVIDIA указывает до 1,5 ТБ памяти LPDDR5X в модулях SOCAMM и пропускную способность до 1,2 ТБ/с.
Сетевая подсистема включает ConnectX-9 с суммарной пропускной способностью до 1,6 Тбит/с, BlueField-4 и коммутаторы Spectrum-6. В старших конфигурациях Spectrum-X применяется совместно упакованная оптика (co-packaged optics, CPO).
Vera Rubin POD включает пять стоечных систем: Vera Rubin NVL72, Groq 3 LPX, стойку Vera CPU, BlueField-4 STX и Spectrum-6 SPX. Для NVL72 NVIDIA заявляет модульные вычислительные лотки без кабелей, шлангов и вентиляторов; время сборки лотка сократилось почти с двух часов до пяти минут. Коммутаторы NVLink можно переводить в режим обслуживания и заменять без остановки всей стойки.
NVIDIA Inference Context Memory Storage — подключаемый по Ethernet уровень флеш-хранилища для KV-кэша, работающий с BlueField-4 и Spectrum-X. Его влияние на производительность и энергопотребление зависит от модели, длины контекста, профиля запросов и конфигурации кластера.
Rubin показывает, что ИИ-кластер нельзя проектировать как набор отдельных ускорителей. Перед выбором оборудования нужно проверить требования рабочей нагрузки к памяти, восточно-западному трафику и хранилищу, а также рассчитать питание и охлаждение всей стойки.