Ryzen AI Halo в версии Longsys запустил локальную ИИ-модель на 397 млрд параметров на компактном ПК с 128 ГБ памяти. Еще год назад для такой задачи мы бы скорее представляли стойку с несколькими ускорителями, а не коробку формата мини-ПК.

Угол тут простой: демонстрация выглядит сильной, но без скорости генерации она остается инженерным показом. Longsys показала не столько «новый суперкомпьютер на столе», сколько способ обойти узкое место локального ИИ — память.

Как 397B-модель поместили в 128 ГБ памяти

Longsys использовала систему на базе Ryzen AI Max+ 395: 16 ядер CPU, встроенный GPU и единая память объемом 128 ГБ. В такой конфигурации графической части доступно примерно 96 ГБ VRAM, а модели такого класса обычно требуют около 200-250 ГБ видеопамяти даже при агрессивной оптимизации.

Продолжение после рекламы

Название модели компания прямо не раскрыла. По описанию она похожа на кастомную версию Alibaba Qwen 3.5 397B (A17B). Это мультимодальная foundation-модель с архитектурой Mixture-of-Experts, где активируется не вся сеть сразу, а только нужные «эксперты».

Даже INT4-квантование не закрывает разрыв по памяти. Сжать веса до 4 бит полезно, но 397 млрд параметров все равно давят на RAM и VRAM. Особенно когда растет KV Cache при длинном контексте.

  • Процессор: AMD Ryzen AI Max+ 395, 16 ядер
  • Память: 128 ГБ unified RAM
  • Доступно GPU: около 96 ГБ VRAM
  • Оценка для модели: около 200-250 ГБ VRAM
  • Архитектура модели: вероятно MoE, 397B параметров

Longsys сделала ставку на хранилище как продолжение памяти

Изображение к статье: Мини-ПК AMD запустил ИИ-модель на 397 млрд параметров

Главный фокус демонстрации — не чистая вычислительная мощность Ryzen AI Max+ 395. Longsys задействовала собственную связку SPU и iSA, которая сжимает данные в реальном времени и управляет кэшем между памятью и быстрым накопителем.

Идея понятная для всех, кто когда-то упирался в swap-файл. Только здесь все пытаются сделать без привычной боли: неактивные MoE-эксперты уходят в быстрый буфер хранения, а система заранее подтягивает нужные блоки обратно. Так Longsys снижает требования к DRAM и сглаживает задержки ввода-вывода.

В пресс-релизе Longsys компания прямо называет болевые точки MoE-моделей: большое число параметров, быстрый рост KV Cache и задержки I/O, которые режут эффективность инференса. В переводе на человеческий: модель вроде помещается, но начинает ждать данные вместо генерации ответа.

Longsys утверждает, что ее подход использует «выгрузку экспертов, интеллектуальное управление кэшем и предиктивную предварительную загрузку». Это звучит сухо, но смысл практичный: система старается угадать, какие части модели понадобятся дальше, и заранее поднимает их из накопителя.

Скорость генерации пока не раскрыли

У демонстрации есть жесткое ограничение: Longsys не назвала производительность в токенах в секунду. Для локального ИИ это ключевая цифра, потому что «запустилось» и «приятно отвечает» — разные вещи.

Ryzen AI Max+ 395 интересен для компактных рабочих станций и локальных моделей. Но по чистому AI compute он слабее крупных современных ускорителей Nvidia и серверных GPU. Поэтому без tokens/sec нельзя честно сравнить этот мини-ПК с полноценной AI-станцией.

Контекст по цене тоже любопытный. Ryzen AI Halo недавно вышел в продажу за $4 000 (около 310 000 рублей), и из-за этого его начали сравнивать с Nvidia DGX Spark, который стоит немного дороже. Но Longsys показала другой спор: иногда вопрос не только в TOPS, а в том, как система кормит модель данными.

Продолжение после рекламы

Если подход Longsys подтвердят независимыми тестами, локальный ИИ сможет запускать модели крупнее физической VRAM. Пока зафиксированы только конфигурация Ryzen AI Max+ 395, 128 ГБ unified RAM и демонстрация 397B-модели; скорость генерации Longsys не раскрыла.

Рейтинг: 0 / 5. Оценок: 0

Рекомендуем почитать

Оставьте комментарий

Перед оставлением комментария, пожалуйста, ознакомьтесь с правилами комментирования.