Nvidia вывела свою open-source модель Nemotron 3 Super в лидеры таблицы EnterpriseOps-Gym. В свежих результатах бенчмарка модель набрала 27,3 балла в среднем и обошла Kimi-K2.5 и DeepSeek v3.2 среди открытых решений.

Речь про корпоративный агентный бенчмарк, где модели решают задачи не в вакууме, а в интерактивных средах. Там нужно дергать инструменты и доводить workflow до конца, как в реальных энтерпрайз-системах.

EnterpriseOps-Gym проверяет агентные модели на 1 150 задачах

EnterpriseOps-Gym оценивает модели на 1 150 задачах в полностью интерактивных окружениях и с доступом к 512 функциональным инструментам. По описанию бенчмарка, агентам приходится координировать действия между несколькими корпоративными системами и тулзами, чтобы закрыть один бизнес-процесс.

Продолжение после рекламы

Это важная оговорка: такие тесты меньше про «красивый текст», и больше про то, как модель ведет себя в цепочках действий. Ошибся на шаге — и весь сценарий разваливается.

Текущий лидер open-source части таблицы — Nemotron 3 Super с 27,3 балла. По разбивке сценариев модель лидирует в TEAMS, Email и Hybrid workflows. В категориях CSM, ITSM и Drive она остается конкурентоспособной, но без заявленного лидерства.

Из ближайших преследователей: Kimi-K2.5 идет на втором месте, DeepSeek v3.2 — на третьем. GPT-OSS-120B в этом рейтинге стоит на пятой позиции.

Сама таблица доступна публично на сайте проекта: EnterpriseOps-Gym leaderboard.

Изображение к статье: Nemotron 3 Super от Nvidia возглавила рейтинг EnterpriseOps-Gym

Что именно Nvidia вложила в Nemotron 3 Super

Nemotron 3 Super Nvidia представила в марте этого года. Это модель класса 120B, но с 12B активных параметров и гибридной архитектурой MoE (mixture of experts). Компания заявляет 5x throughput по сравнению с предыдущей Nemotron Super.

Отдельный акцент — контекст. У Nemotron 3 Super заявлено нативное окно 1M токенов, которое Nvidia подает как базу для «долгой памяти» агентных сценариев и более точного, согласованного рассуждения.

  • Latent MoE: модель вызывает в 4 раза больше «экспертов» при той же стоимости инференса за счет сжатия токенов до попадания к экспертам.
  • Multi-token prediction (MTP): предсказывает несколько будущих токенов за один forward pass, чтобы ускорять генерацию длинных последовательностей и дать встроенный speculative decoding.
  • Hybrid Mamba-Transformer: бэкбон сочетает слои Mamba для эффективности на последовательностях и Transformer-слои для точного reasoning. Nvidia заявляет 4-кратное улучшение эффективности по памяти и вычислениям.
  • NVFP4 pretraining: предобучение в NVFP4 с оптимизацией под Blackwell. Nvidia говорит о 4-кратном ускорении инференса на B200 по сравнению с FP8 на H100 при сохранении точности.
  • RL пост-тренировка: обучение с reinforcement learning в 21 конфигурации окружений через NeMo Gym и NeMo RL, с более чем 1,2 млн rollout-эпизодов.

Почему это похоже на демонстрацию «полного стека» Nvidia

В этой истории важен не только результат в таблице. Nvidia явно продвигает идею «полного AI-стека», где железо и софт идут парой: модель обучали и оптимизировали под собственные форматы и ускорители, а затем показывают бенчмарк в агентной среде, где throughput и память решают не меньше, чем качество ответов.

У линейки Nemotron 3 компания прямо называет три уровня: Nano, Super и Ultra. Параллельно Nvidia упоминала Nemotron 3 Nano Omni, где заявляет 9x прирост throughput для агентных сценариев.

Первую публикацию результатов компания сделала через свой публичный аккаунт NVIDIA AI: пост NVIDIAAI с бенчмарками Nemotron 3 Super.

Продолжение после рекламы

Рейтинг: 0 / 5. Оценок: 0

Рекомендуем почитать

Оставьте комментарий

Перед оставлением комментария, пожалуйста, ознакомьтесь с правилами комментирования.