Nvidia Rubin получила набор архитектурных доработок для инференса: компания обещает до 50 PFLOPS в NVFP4 с разреженностью и меньше накладных расходов от одного GPU до целой стойки NVL72.

Это не история про красивую цифру в таблице. Для больших ИИ-сервисов сейчас больнее другое: сколько токенов система выдаёт за секунду, сколько стоит каждый токен и как быстро агентные сценарии отвечают пользователю.

Характеристики Rubin GPU и стойки Vera Rubin NVL72

Vera Rubin NVL72 собирает 36 процессоров Vera и 72 ускорителя Rubin в одной стоечной системе. Nvidia строит платформу под масштабный инференс агентных ИИ, где GPU постоянно гоняют веса моделей, KV-кэш и синхронизацию между ускорителями.

Продолжение после рекламы

Сам Rubin GPU соединяет два вычислительных кристалла в одном корпусе через Nvidia High Bandwidth Interface. Чип получил 224 потоковых мультипроцессора SM, 896 Tensor Cores и 288 ГБ памяти HBM4. Пропускная способность памяти достигает 22 ТБ/с.

Изображение к статье: Nvidia Rubin ускорит инференс ИИ: до 50 PFLOPS в NVFP4
Режим Производительность
NVFP4 Inference 50 PFLOPS с разреженностью
NVFP4 Training 35 PFLOPS
FP8/FP6 Training 17,5 PFLOPS
INT8 250 TOPS
FP16/BF16 4 PFLOPS
TF32 2 PFLOPS
FP32 130 TFLOPS
FP64 33 TFLOPS

Цифры внушительные, но Nvidia делает упор не только на пиковые FLOPS. Компания доработала участки архитектуры, где ускоритель теряет время на подачу данных, зависимости между ядрами и обмен с соседними GPU.

TMA в Rubin лучше кормит Tensor Cores в MoE-моделях

Tensor Memory Accelerator в Rubin получил доработки под модели Mixture-of-Experts. Такие модели активируют не все параметры на каждый токен, а выбирают нужные экспертные подсети через роутер.

У MoE есть практичная причина для популярности. Веса экспертов можно разложить по нескольким GPU, потому что память HBM на одном ускорителе всё равно ограничена. Но чем больше экспертов в модели, тем сложнее быстро найти нужные веса и подать их в вычислительные блоки.

Изображение к статье: Nvidia Rubin ускорит инференс ИИ: до 50 PFLOPS в NVFP4

В Blackwell TMA хранил отдельные MoE-дескрипторы для каждого эксперта. Это добавляло вычисления для метаданных и движения данных. В Rubin ядра GPU могут вести единый MoE-дескриптор прямо в инструкции TMA во время выполнения.

Смысл простой: меньше служебной математики вокруг адресов, больше времени уходит на инференс. Для дорогого ускорителя это критично. Никто не хочет покупать стойку GPU, чтобы она ждала метаданные.

Tensor Cores делают меньше проходов по K-измерению

Rubin удваивает объём работы Tensor Cores по K-измерению при матричных операциях. K-измерение — это общая внутренняя размерность двух матриц, и она напрямую влияет на число циклов внутри умножения.

В примере Nvidia задача, которая на Blackwell требовала четыре прохода, на Rubin укладывается в два. Выигрыш должен проявиться в ядрах, упёртых в пропускную способность, память или задержки.

Изображение к статье: Nvidia Rubin ускорит инференс ИИ: до 50 PFLOPS в NVFP4

Это касается обеих фаз инференса. На этапе обработки контекста модель переваривает входной запрос. На этапе декодирования она выдаёт токены один за другим. В агентных сценариях обе фазы легко становятся узким местом, особенно при длинном контексте.

Продолжение после рекламы

Softmax ускорили до 4 раз относительно Blackwell

Softmax в Rubin получил прирост в блоках Special Function Unit, которые считают экспоненты для механизма внимания. Для современных LLM это больное место, потому что контекст уже доходит до миллиона токенов.

Blackwell Ultra уже удвоил пропускную способность экспонент FP32 и BF16/FP16 относительно первого Blackwell GB200. Rubin сохраняет ускорение 2x для FP32 и снова удваивает BF16/FP16 относительно Blackwell Ultra. В итоге BF16/FP16 дают прирост 4x против Blackwell.

GPU FP32 exponential BF16/FP16 exponential
Blackwell 1x 1x
Blackwell Ultra 2x 2x
Rubin 2x 4x
Изображение к статье: Nvidia Rubin ускорит инференс ИИ: до 50 PFLOPS в NVFP4

Nvidia меняет и управление зависимостями между ядрами. На Blackwell потребительское ядро могло ждать, пока длинное производящее ядро завершит пакет целиком. Rubin запускает потребителя по отдельным блокам потоков, как только нужный результат готов.

На практике это повышает занятость Tensor Cores и режет задержку между CUDA-ядрами. Для пользователя это выражается не в красивой строке спецификаций, а в большем числе токенов в секунду на сессию.

NVLink в стойке получил меньше синхронизационного шума

В стойке NVL72 отдельный GPU не живёт сам по себе. Через NVLink ходят веса модели, KV-кэш и сообщения синхронизации, поэтому лишние операции связи быстро съедают часть выигрыша от быстрых Tensor Cores.

В системах Blackwell передача по NVLink могла требовать записи данных, барьера памяти и атомарного флага. Rubin вводит counted writes — механизм, где барьер и атомарные операции заменяет обновление счётчика записи на принимающем GPU.

Такой подход снижает сетевой трафик и задержку координации. GPU меньше ждут друг друга и дольше считают полезную нагрузку. В масштабе 72 ускорителей даже небольшая экономия на синхронизации превращается в заметную разницу по стоимости токена.

Vera CPU в этой платформе берёт на себя агентные обвязки, вызов инструментов и компиляцию кода, где нужна высокая однопоточная скорость. Поставки систем Vera Rubin Nvidia планирует начать осенью 2026 года.

Рейтинг: 0 / 5. Оценок: 0

Рекомендуем почитать

Оставьте комментарий

Перед оставлением комментария, пожалуйста, ознакомьтесь с правилами комментирования.