Содержание
Nvidia Rubin получила набор архитектурных доработок для инференса: компания обещает до 50 PFLOPS в NVFP4 с разреженностью и меньше накладных расходов от одного GPU до целой стойки NVL72.
Это не история про красивую цифру в таблице. Для больших ИИ-сервисов сейчас больнее другое: сколько токенов система выдаёт за секунду, сколько стоит каждый токен и как быстро агентные сценарии отвечают пользователю.
Характеристики Rubin GPU и стойки Vera Rubin NVL72
Vera Rubin NVL72 собирает 36 процессоров Vera и 72 ускорителя Rubin в одной стоечной системе. Nvidia строит платформу под масштабный инференс агентных ИИ, где GPU постоянно гоняют веса моделей, KV-кэш и синхронизацию между ускорителями.
Сам Rubin GPU соединяет два вычислительных кристалла в одном корпусе через Nvidia High Bandwidth Interface. Чип получил 224 потоковых мультипроцессора SM, 896 Tensor Cores и 288 ГБ памяти HBM4. Пропускная способность памяти достигает 22 ТБ/с.
| Режим | Производительность |
| NVFP4 Inference | 50 PFLOPS с разреженностью |
| NVFP4 Training | 35 PFLOPS |
| FP8/FP6 Training | 17,5 PFLOPS |
| INT8 | 250 TOPS |
| FP16/BF16 | 4 PFLOPS |
| TF32 | 2 PFLOPS |
| FP32 | 130 TFLOPS |
| FP64 | 33 TFLOPS |
Цифры внушительные, но Nvidia делает упор не только на пиковые FLOPS. Компания доработала участки архитектуры, где ускоритель теряет время на подачу данных, зависимости между ядрами и обмен с соседними GPU.
TMA в Rubin лучше кормит Tensor Cores в MoE-моделях
Tensor Memory Accelerator в Rubin получил доработки под модели Mixture-of-Experts. Такие модели активируют не все параметры на каждый токен, а выбирают нужные экспертные подсети через роутер.
У MoE есть практичная причина для популярности. Веса экспертов можно разложить по нескольким GPU, потому что память HBM на одном ускорителе всё равно ограничена. Но чем больше экспертов в модели, тем сложнее быстро найти нужные веса и подать их в вычислительные блоки.

В Blackwell TMA хранил отдельные MoE-дескрипторы для каждого эксперта. Это добавляло вычисления для метаданных и движения данных. В Rubin ядра GPU могут вести единый MoE-дескриптор прямо в инструкции TMA во время выполнения.
Смысл простой: меньше служебной математики вокруг адресов, больше времени уходит на инференс. Для дорогого ускорителя это критично. Никто не хочет покупать стойку GPU, чтобы она ждала метаданные.
Tensor Cores делают меньше проходов по K-измерению
Rubin удваивает объём работы Tensor Cores по K-измерению при матричных операциях. K-измерение — это общая внутренняя размерность двух матриц, и она напрямую влияет на число циклов внутри умножения.
В примере Nvidia задача, которая на Blackwell требовала четыре прохода, на Rubin укладывается в два. Выигрыш должен проявиться в ядрах, упёртых в пропускную способность, память или задержки.

Это касается обеих фаз инференса. На этапе обработки контекста модель переваривает входной запрос. На этапе декодирования она выдаёт токены один за другим. В агентных сценариях обе фазы легко становятся узким местом, особенно при длинном контексте.
Softmax ускорили до 4 раз относительно Blackwell
Softmax в Rubin получил прирост в блоках Special Function Unit, которые считают экспоненты для механизма внимания. Для современных LLM это больное место, потому что контекст уже доходит до миллиона токенов.
Blackwell Ultra уже удвоил пропускную способность экспонент FP32 и BF16/FP16 относительно первого Blackwell GB200. Rubin сохраняет ускорение 2x для FP32 и снова удваивает BF16/FP16 относительно Blackwell Ultra. В итоге BF16/FP16 дают прирост 4x против Blackwell.
| GPU | FP32 exponential | BF16/FP16 exponential |
| Blackwell | 1x | 1x |
| Blackwell Ultra | 2x | 2x |
| Rubin | 2x | 4x |

Nvidia меняет и управление зависимостями между ядрами. На Blackwell потребительское ядро могло ждать, пока длинное производящее ядро завершит пакет целиком. Rubin запускает потребителя по отдельным блокам потоков, как только нужный результат готов.
На практике это повышает занятость Tensor Cores и режет задержку между CUDA-ядрами. Для пользователя это выражается не в красивой строке спецификаций, а в большем числе токенов в секунду на сессию.
NVLink в стойке получил меньше синхронизационного шума
В стойке NVL72 отдельный GPU не живёт сам по себе. Через NVLink ходят веса модели, KV-кэш и сообщения синхронизации, поэтому лишние операции связи быстро съедают часть выигрыша от быстрых Tensor Cores.
В системах Blackwell передача по NVLink могла требовать записи данных, барьера памяти и атомарного флага. Rubin вводит counted writes — механизм, где барьер и атомарные операции заменяет обновление счётчика записи на принимающем GPU.
Такой подход снижает сетевой трафик и задержку координации. GPU меньше ждут друг друга и дольше считают полезную нагрузку. В масштабе 72 ускорителей даже небольшая экономия на синхронизации превращается в заметную разницу по стоимости токена.
Vera CPU в этой платформе берёт на себя агентные обвязки, вызов инструментов и компиляцию кода, где нужна высокая однопоточная скорость. Поставки систем Vera Rubin Nvidia планирует начать осенью 2026 года.