Содержание
Ryzen AI Halo в версии Longsys запустил локальную ИИ-модель на 397 млрд параметров на компактном ПК с 128 ГБ памяти. Еще год назад для такой задачи мы бы скорее представляли стойку с несколькими ускорителями, а не коробку формата мини-ПК.
Угол тут простой: демонстрация выглядит сильной, но без скорости генерации она остается инженерным показом. Longsys показала не столько «новый суперкомпьютер на столе», сколько способ обойти узкое место локального ИИ — память.
Как 397B-модель поместили в 128 ГБ памяти
Longsys использовала систему на базе Ryzen AI Max+ 395: 16 ядер CPU, встроенный GPU и единая память объемом 128 ГБ. В такой конфигурации графической части доступно примерно 96 ГБ VRAM, а модели такого класса обычно требуют около 200-250 ГБ видеопамяти даже при агрессивной оптимизации.
Название модели компания прямо не раскрыла. По описанию она похожа на кастомную версию Alibaba Qwen 3.5 397B (A17B). Это мультимодальная foundation-модель с архитектурой Mixture-of-Experts, где активируется не вся сеть сразу, а только нужные «эксперты».
Даже INT4-квантование не закрывает разрыв по памяти. Сжать веса до 4 бит полезно, но 397 млрд параметров все равно давят на RAM и VRAM. Особенно когда растет KV Cache при длинном контексте.
- Процессор: AMD Ryzen AI Max+ 395, 16 ядер
- Память: 128 ГБ unified RAM
- Доступно GPU: около 96 ГБ VRAM
- Оценка для модели: около 200-250 ГБ VRAM
- Архитектура модели: вероятно MoE, 397B параметров
Longsys сделала ставку на хранилище как продолжение памяти
Главный фокус демонстрации — не чистая вычислительная мощность Ryzen AI Max+ 395. Longsys задействовала собственную связку SPU и iSA, которая сжимает данные в реальном времени и управляет кэшем между памятью и быстрым накопителем.
Идея понятная для всех, кто когда-то упирался в swap-файл. Только здесь все пытаются сделать без привычной боли: неактивные MoE-эксперты уходят в быстрый буфер хранения, а система заранее подтягивает нужные блоки обратно. Так Longsys снижает требования к DRAM и сглаживает задержки ввода-вывода.
В пресс-релизе Longsys компания прямо называет болевые точки MoE-моделей: большое число параметров, быстрый рост KV Cache и задержки I/O, которые режут эффективность инференса. В переводе на человеческий: модель вроде помещается, но начинает ждать данные вместо генерации ответа.
Longsys утверждает, что ее подход использует «выгрузку экспертов, интеллектуальное управление кэшем и предиктивную предварительную загрузку». Это звучит сухо, но смысл практичный: система старается угадать, какие части модели понадобятся дальше, и заранее поднимает их из накопителя.
Скорость генерации пока не раскрыли
У демонстрации есть жесткое ограничение: Longsys не назвала производительность в токенах в секунду. Для локального ИИ это ключевая цифра, потому что «запустилось» и «приятно отвечает» — разные вещи.
Ryzen AI Max+ 395 интересен для компактных рабочих станций и локальных моделей. Но по чистому AI compute он слабее крупных современных ускорителей Nvidia и серверных GPU. Поэтому без tokens/sec нельзя честно сравнить этот мини-ПК с полноценной AI-станцией.
Контекст по цене тоже любопытный. Ryzen AI Halo недавно вышел в продажу за $4 000 (около 310 000 рублей), и из-за этого его начали сравнивать с Nvidia DGX Spark, который стоит немного дороже. Но Longsys показала другой спор: иногда вопрос не только в TOPS, а в том, как система кормит модель данными.
Если подход Longsys подтвердят независимыми тестами, локальный ИИ сможет запускать модели крупнее физической VRAM. Пока зафиксированы только конфигурация Ryzen AI Max+ 395, 128 ГБ unified RAM и демонстрация 397B-модели; скорость генерации Longsys не раскрыла.