Содержание
NeMo Switchyard — новый open source-роутер Nvidia для корпоративных ИИ-сервисов. Он выбирает модель под каждый запрос и, по оценке Nvidia, режет расходы на 74% против сценария, где всё крутится на одной frontier-модели.
Цена компромисса тоже названа: точность падает на 6%. И вот здесь начинается самое интересное. Для бизнеса это не магия бесплатного ИИ, а очередная попытка приручить расходы на инференс.
Как NeMo Switchyard выбирает модель для запроса
NeMo Switchyard стоит между приложением и набором языковых моделей, принимает запрос, оценивает задачу и отправляет её туда, где ответ должен стоить дешевле без сильной потери качества. Простую операцию он отдаёт малой модели, а сложный запрос эскалирует к более сильной системе.
Идея знакомая любому, кто собирал ПК под конкретные задачи. Не надо гонять RTX 4090 ради «Косынки». В мире LLM логика та же: не каждый PDF, тикет поддержки или короткое письмо требует дорогую модель верхнего уровня.
- OpenAI API: принимает совместимые запросы от приложений.
- Anthropic API: переводит обращения между разными форматами.
- Responses API: сохраняет совместимость с современными агентными сценариями.
Система логирует выбранную модель, причину выбора, расход токенов и задержку по каждому вызову. Для корпоративного ИИ это не косметика. Финансовый отдел хочет видеть, куда улетают деньги, а инженерам нужны цифры для настройки маршрутизации.
Один из примеров Nvidia — Nemotron Parse, модель на 1 млрд параметров для извлечения структуры из PDF. Ей не нужно соревноваться с Claude Opus или GPT-классом моделей в рассуждениях. Её задача уже, и поэтому она может быть дешевле в эксплуатации.
Рынок роутеров уже тесный
Nvidia выходит не в пустое поле: маршрутизацией запросов уже занимаются RouteLLM, LiteLLM, OpenRouter и внутренние системы крупных компаний. По данным Bloomberg, Stripe близка к покупке OpenRouter более чем за $7 млрд, то есть около 540 млрд рублей.
Смысл сделки легко понять. Если компания платит за миллионы обращений к ИИ, даже несколько процентов экономии превращаются в бюджет хорошего дата-центра. А если экономия доходит до десятков процентов, роутер становится не надстройкой, а частью финансовой модели продукта.
У Nvidia здесь свой интерес. Чем больше рабочих нагрузок уходит на малые open-weight модели, тем больше инференса компании могут запускать на собственном железе. А это уже территория ускорителей Nvidia, которые стоят в корпоративных серверах.
| Подход | Плюс | Минус |
|---|---|---|
| Одна frontier-модель | Стабильное качество и проще прогнозировать поведение | Высокая цена даже для простых задач |
| NeMo Switchyard | До 74% экономии по оценке Nvidia | Минус 6% к точности и дополнительная задержка |
Экономия есть, но предсказуемость страдает
Тесты LangChain показывают главный подвох роутеров: сама проверка тоже стоит денег. В сценарии с Nemotron 3.5 Lightning judge-модель, которая после каждого шага проверяет поведение агента, съедала до 21,2% общей стоимости.
Это много. Судья в таких схемах читает вывод модели, решает, идёт ли агент по плану, и может поднять запрос на более дорогую модель. Если рабочая нагрузка короткая, эта надбавка быстро съедает часть выгоды.
LangChain отдельно указывает на разброс цены. В тестах расходы были ниже, чем при работе только через Claude Opus 4.8, но колебались от $2,16 до $3,61. Разница между нижней и верхней границей — около 67%.
Для разработчика это неприятная математика. Средний чек падает, но прогнозировать счёт сложнее. Сегодня роутер чаще оставил задачи на малой модели, завтра чаще отправил их наверх — и бюджет прыгает.
Есть и задержка. По оценке LangChain, Switchyard добавляет около 700 мс, потому что judge-модель читает вывод на каждом шаге. Для фоновой обработки документов это терпимо. Для коротких и чувствительных к задержке запросов LangChain прямо не советует использовать Switchyard.
Nvidia опубликовала NeMo Switchyard как open source-решение с интеграциями для OpenAI API, Anthropic API и Responses API; в тесте LangChain judge-модель доходила до 21,2% стоимости, а дополнительная задержка оценивалась примерно в 700 мс.