Содержание
NVIDIA GB300 NVL72 показал заметный прирост в задачах long-context инференса на свежих open source моделях DeepSeek. По данным тестов команды LMSYS, стойка Blackwell Ultra в среднем опережает предыдущее поколение GB200 NVL72 примерно на 1,4-1,5x в сценариях, где важны задержки и скорость ответа.
Если вы следите за «агентным» ИИ, новость логичная. Длинный контекст — это уже не игрушка для демо. Это то, что упирается в память, маршрутизацию и реальную инфраструктуру. И там выигрыш в латентности часто ценнее, чем сухие TFLOPS.
Что именно протестировали в long-context и почему это больно
Тесты LMSYS сфокусировались на long-context инференсе. Это режим, где модель держит большой KV-кэш и переваривает длинные промпты. В таких задачах нагрузка смещается в сторону VRAM и эффективности работы с контекстом, а не только «сырой» вычислительной мощности.
Чтобы не упираться в узкие места, команда внедрила PD (Prefill-Decode) Disaggregation. Идея простая: разнести по разным узлам фазу prefill (обработка промпта) и decode (генерация токенов). Так система лучше масштабируется и меньше простаивает на перекосах нагрузки.
Вдобавок применили оптимизации уровня инференс-стека. Среди них — dynamic chunking для более предсказуемых ответов на длинных окнах и механики для эффективной «переводимости» KV-емкости между узлами. Детали методологии LMSYS описали в своём посте: tested GB300 NVL72 for long-context inference.
GB300 NVL72 против GB200 NVL72: цифры по throughput, скорости и латентности
В отчёте LMSYS сравнили GB300 NVL72 и GB200 NVL72 по трём метрикам: пропускная способность, «пользовательская» скорость и задержка. И в среднем новое поколение выглядит сильнее, особенно там, где критичен отклик.
| Метрика | Преимущество GB300 NVL72 | Комментарий |
|---|---|---|
| Peak throughput | 1,53x (до 226,2 TPS/GPU) | Tokens per second на GPU в пике |
| TPS/User | 1,87x | Рост связывают с MTP (Multi-Token Prediction) |
| Latency | 1,58x | Выигрыш в задержке для чувствительных сценариев |
В пересказе «на пальцах» это значит так. GB300 быстрее «прожёвывает» длинные запросы и быстрее начинает отвечать. А при параллельной нагрузке (много пользователей, много контекста) преимущество становится заметнее.
Почему NVIDIA упирает в длинный контекст и «агентов»
Длинный контекст — это фундамент для агентных сценариев. Там модель не просто отвечает на один вопрос. Она держит историю, планы, промежуточные результаты и контекст инструментов. В таких задачах задержка и стабильная скорость на пользователя важнее, чем рекорды в синтетике.
И GB300 тут выглядит как продукт под реальную эксплуатацию. Не только «новая архитектура», но и ставка на связку железа с софтом и маршрутизацией. Именно поэтому в тестах отдельно фигурируют инфраструктурные приёмы вроде PD Disaggregation и оптимизаций под KV-кэш.
Что это значит для рынка и почему мы пока не знаем главного
Для гиперскейлеров и neocloud-провайдеров такие цифры — прямой аргумент в пользу обновления, если их бизнес завязан на long-context. Быстрее ответ — больше запросов на ту же стойку. И меньше нервов у пользователей, которые не готовы ждать.
Но есть и вторая сторона. В отчёте прямо признают: цифр по TCO пока нет. А это ключевой вопрос. Стойки уровня NVL72 — это не «купил видеокарту и вставил». Это питание, охлаждение, сеть, софт, обслуживание. И авторы отмечают, что с GB300 параллельно растут и затраты на развёртывание.
На момент публикации GB300 NVL72 выглядит как сильный шаг вперёд для long-context и latency-sensitive инференса. Теперь рынок ждёт приземлённые расчёты по стоимости владения и поставкам. Без них любые «в 1,5 раза быстрее» для многих останутся красивой цифрой в презентации.