NVIDIA называет Vera Rubin платформой следующего поколения после Blackwell. В неё входят Rubin GPU, CPU Vera, сетевые компоненты и системы NVL72. Поэтому в сравнении важно не смешивать характеристики отдельного ускорителя, стойки и результаты бенчмарков: они отвечают на разные вопросы при проектировании инфраструктуры.
По сообщению NVIDIA от 31 мая 2026 года, платформа выходит на полномасштабное производство, а производственные поставки ожидаются осенью 2026 года.

Вычислительные стойки, в которых будут использоваться центральные процессоры Nvidia Vera. Источник: Nvidia
Что изменилось в Rubin GPU
По техническим материалам NVIDIA, Rubin GPU производится по техпроцессу TSMC N3P, содержит 336 млрд транзисторов, 224 потоковых мультипроцессора (SM) и 896 Tensor Cores пятого поколения. Ускоритель поддерживает до 288 ГБ HBM4 в восьми 12-слойных стеках; заявленная пропускная способность памяти — до 22 ТБ/с.
NVIDIA также указывает NVLink 6 с пропускной способностью 3,6 ТБ/с на GPU, NVLink-C2C — 1,8 ТБ/с и PCIe Gen 6 x16. Пиковая метрика для инференса NVFP4 заявлена на уровне до 50 петафлопс (PFLOPS) на GPU. Это характеристика, опубликованная NVIDIA, а не результат независимого теста заказчика.
Архитектура чипа NVIDIA Rubin GPU

Источник: NVIDIA Technical Blog, «Inside NVIDIA Rubin GPU Architecture», 21 июля 2026. Fig. 2. 224 SM, 896 Tensor Cores, 288 ГБ HBM4, NVLink 6, PCIe Gen 6.
Сравнение с B200 и B300
B200 и B300 относятся к поколению Blackwell. В доступных материалах NVIDIA для B300 указывается 288 ГБ HBM3e; Rubin сохраняет тот же максимальный объём памяти на ускоритель, но переходит на HBM4 и увеличивает пропускную способность памяти. Поэтому 288 ГБ сами по себе не позволяют делать универсальный вывод о том, какие модели поместятся в сервер: результат зависит от количества GPU, точности, KV-кеша, длины контекста и резерва памяти.
| Параметр | B200 | B300 | Rubin GPU |
| Поколение | Blackwell | Blackwell Ultra | Rubin |
| Техпроцесс | TSMC 4NP | TSMC 4NP | TSMC N3P |
| Транзисторы | 208 млрд | 208 млрд | 336 млрд (+1,6x) |
| Память (макс.) | 180 ГБ | 288 ГБ HBM3e | 288 ГБ HBM4 |
| Пропускная сп. памяти | ~8 ТБ/с | ~8 ТБ/с | 22 ТБ/с (+2,8x) |
| NVLink | NVLink 5 / 1,8 ТБ/с | NVLink 5 / 1,8 ТБ/с | NVLink 6 / 3,6 ТБ/с |
| NVFP4 инференс | 10 PFLOPS | 10 PFLOPS | 50 PFLOPS (+5x) |
| NVFP4 обучение | 10 PFLOPS | 10 PFLOPS | 35 PFLOPS (+3,5x) |
Сравнение 22 ТБ/с и 8 ТБ/с даёт коэффициент до 2,75, а не универсальный показатель ускорения любой модели. Реальная скорость генерации зависит от модели, батчинга, длины контекста, сетевой топологии и программного стека.
График NVIDIA: пропускная способность памяти HBM — Blackwell → Rubin (+2,8x)
Источник: NVIDIA Technical Blog, «Inside NVIDIA Rubin GPU Architecture», 21 июля 2026. Fig. 8.
Производительность Vera Rubin относительно Blackwell
Для Vera Rubin NVL72 NVIDIA публикует собственные ориентиры для определённых конфигураций и нагрузок. В частности, для Kimi-K2-Thinking компания заявляет до 10× меньшую стоимость выходного токена по сравнению с GB200 NVL72 при сопоставимой интерактивности. Для обучения 10-триллионной MoE-модели на 100 трлн токенов за месяц NVIDIA заявляет до 4× меньше GPU; также заявлено до 10× более высокая производительность на ватт на уровне платформы по сравнению с Blackwell.
Эти цифры следует использовать как вендорские ориентиры для названных систем и методик, а не как SLA, TCO-расчёт или обещание результата для любой нагрузки. Перед закупкой необходимы профиль модели, целевые SLO по задержке, число одновременных запросов, схема сети и расчёт энергоснабжения конкретного ЦОД.
График NVIDIA: агентная производительность Hopper → Blackwell → Rubin
10x рост агентной производительности Vera Rubin NVL72 vs Blackwell

Источник: NVIDIA Technical Blog, «Inside NVIDIA Rubin GPU Architecture», 21 июля 2026. Fig. 1. Pareto frontiers, internal 2T MoE workload.
Что учитывать при выборе платформы
Переход на Rubin имеет смысл оценивать прежде всего там, где ограничением стали пропускная способность памяти, взаимодействие GPU по NVLink или масштабирование инференса MoE-моделей. Для расчёта сравнивают не только PFLOPS, но и рабочую нагрузку, объём KV-кеша, сеть, питание, охлаждение и доступность оборудования.
NVIDIA описывает Vera Rubin NVL72 как систему с 72 GPU и 36 CPU Vera; в платформе также названы ConnectX-9, BlueField-4 и Spectrum-6. NVIDIA заявляет возможность подачи жидкости на входе с температурой до 45 °C. При этом конкретные TGP-профили, мощность стойки, расход воды и наличие либо отсутствие всех воздушных SKU в использованных первоисточниках не зафиксированы как финальные спецификации. Их не следует закладывать в проект без актуальной спецификации и подтверждения поставщика.
Для уже работающего парка B200/B300 решение зависит от измеряемых показателей: загрузки HBM и NVLink, задержки, стоимости токена, роста числа одновременных запросов и ограничений машинного зала.
Для нового кластера под интенсивный инференс и MoE стоит заранее проверить требования выбранной конфигурации к питанию, сети и охлаждению у NVIDIA или OEM.
Вычислительный лоток Vera Rubin NVL72

Источник: NVIDIA Technical Blog, «Inside the NVIDIA Vera Rubin Platform», 5 января 2026. Fig. 18. 2 суперчипа Vera Rubin · BlueField-4 DPU · ConnectX-9 · NVLink 6 · 200 PFLOPS NVFP4 · полное жидкостное охлаждение
Суперчип Vera Rubin

Источник: NVIDIA Technical Blog, «Inside the NVIDIA Vera Rubin Platform», 5 января 2026. Fig. 17. 2 GPU Rubin + 1 CPU Vera + NVLink-C2C · 100 PFLOPS NVFP4 · 2 ТБ памяти · 6 трлн транзисторов.
Сроки и выводы
NVIDIA сообщает о выходе платформы на полномасштабное производство и планирует производственные поставки осенью 2026 года. Партнёрские продукты компания относит ко второй половине 2026 года; это заявление NVIDIA, а не подтверждение доступности у каждого поставщика.
Ключевое отличие Rubin от B300 — не увеличение максимального объёма памяти на GPU (оба 288 ГБ), а изменение типа памяти (HBM3e → HBM4), рост пропускной способности (+2,8x), новое поколение NVLink (+2x) и кратный прирост вычислительной производительности (+5x NVFP4-инференс, +3,5x NVFP4-обучение). Ожидаемый эффект для конкретной инфраструктуры нужно подтверждать нагрузочным тестом и расчётом полной стоимости владения.
FAQ
По материалам NVIDIA, оба ускорителя имеют до 288 ГБ памяти, но Rubin использует HBM4 с пропускной способностью до 22 ТБ/с и NVLink 6 с пропускной способностью 3,6 ТБ/с на GPU. У B300 указаны HBM3e, 8 ТБ/с и NVLink 5, 1,8 ТБ/с.
Универсального списка нет. Объём весов зависит от точности, а фактическое размещение — также от KV-кеша, длины контекста, размера пакета запросов и среды выполнения и необходимого резерва. Расчёт нужно делать для конкретной модели и профиля инференса.
Rubin использует NVLink 6, тогда как B200 и B300 — NVLink 5. Совместимость и состав фабрики необходимо проверять по документации NVIDIA и OEM для выбранной системы; переносить существующую схему без такой проверки нельзя.
NVIDIA позиционирует Rubin в экосистеме CUDA, однако совместимость прикладного кода не отменяет необходимость тестирования: требуется проверить версии CUDA, драйверов, библиотек, контейнеров и используемые CUDA-расширения на целевой конфигурации.
Это определяется не числом параметров модели, а профилем нагрузки и экономикой. Для умеренного инференса без требования к тесно связанной много-GPU-конфигурации преимущества NVLink 6 и высокой пропускной способности HBM4 могут не стать ограничивающим фактором.