Разработчик Niko1221 опубликовал Strata — движок для локального запуска модели Alibaba Qwen3.8-Flash-Next. В опубликованном тесте, который приводит PC Watch, ПК с GeForce RTX 5070 на 12 ГБ, Ryzen 5 7600 и 64 ГБ оперативной памяти выдавал 93 токена в секунду в коротком диалоге. Результат получен на самой лёгкой квантованной версии модели Q2_0.
Qwen3.8-Flash-Next содержит 125 млрд параметров, но при генерации задействует около 6 млрд: модель устроена как набор специализированных частей — «экспертов». Strata держит часто используемые части в видеопамяти, остальные — в оперативной памяти и при необходимости обрабатывает их с помощью процессора. Так движок распределяет работу между видеокартой и остальным ПК вместо попытки целиком разместить модель в VRAM.
В том же опубликованном тесте Q2_0 показала 74 токена в секунду при контексте в 128 тыс. токенов. Рекомендованная разработчиком версия IQ2_XS достигла 79 токенов в секунду при генерации ответа; скорость обработки входного запроса составила 2090 токенов в секунду. Для этих версий требуется соответственно 37,6 и 39,2 ГБ памяти под модель. Дополнительное ускорение Strata получает за счёт предварительного подбора следующих токенов небольшим вспомогательным компонентом: основной моделью они затем проверяются.
Strata рассчитана на GeForce серий RTX 20, 30, 40 и 50 с видеопамятью от 12 ГБ. Для установки также нужны подходящий объём оперативной памяти и около 80 ГБ свободного места на диске. Движок работает в Windows 10/11 и Linux, распространяется по лицензии MIT и предоставляет браузерный чат и API, совместимые с форматами OpenAI и Anthropic. Поддержка некоторых видеокарт AMD в Linux пока экспериментальная.
Источник: PC Watch.