AI90 от GenStorAIGE расширяет память AI-сервера не только за счёт HBM на видеокартах. Компания показала платформу на WAIC 2026 и заявила, что восемь GeForce RTX 5090 в инференсе могут работать ближе к кластеру из 46 GPU.
Звучит как рекламная фраза с выставочного стенда, поэтому держим холодную голову. Речь не о магическом разгоне видеокарт. GenStorAIGE переносит часть нагрузки с дорогой видеопамяти на быстрые SSD и системную DDR-память.
AI90 выносит KV Cache за пределы видеопамяти
Платформа AI90 строит трёхуровневую память из HBM на GPU, системной DRAM и SSD на PCIe 5.0, чтобы хранить часть KV Cache вне видеокарты. Для больших языковых моделей это критично: длинный контекст быстро съедает видеопамять, даже если вычислительных блоков ещё хватает.
KV Cache хранит промежуточные данные, которые модель использует при генерации ответа. Чем длиннее переписка или документ, тем больше кэша нужно держать рядом с GPU. Обычно это давит на HBM, а HBM стоит дорого и масштабируется хуже, чем накопители.
- Латентность первого токена: снижение с нескольких секунд до менее одной секунды
- Ускорение по первому токену: до 50 раз
- Рост пропускной способности: до 5,1 раза
- Снижение расхода памяти GPU: примерно на 39%
- Контекстное окно: более 128 000 токенов
В связке с peer-to-peer обменом между GPU компания говорит об ускорении до 5,8 раза на системе с восемью RTX 5090. Отсюда и сравнение с 46 видеокартами при длительном инференсе.
Тут есть важная оговорка. Это заявленные цифры GenStorAIGE, а не независимый тест. Мы бы не советовали воспринимать их как готовую формулу: купил восемь RTX 5090, поставил AI90 — получил маленький дата-центр.
PT200Z SSD рассчитали на постоянные записи кэша
Для AI90 компания подготовила накопитель PT200Z AI SSD, потому что обычный быстрый SSD не всегда переживёт постоянные обновления KV Cache. Накопитель использует pSLC NAND, подключается по PCIe Gen5 x4 и рассчитан на тяжёлую запись, а не только на красивые цифры чтения.
По спецификациям PT200Z читает последовательно до 14,8 ГБ/с. Случайное чтение достигает примерно 3,1 млн IOPS. Задержка чтения — 54 мкс, задержка записи — 10 мкс.
Выносливость заявлена до 100 перезаписей диска в день. Для домашнего ПК это избыточная цифра, но для AI-инференса логика другая. Кэш постоянно меняется, и накопитель получает поток мелких операций.
| Параметр | GenStorAIGE PT200Z |
|---|---|
| Интерфейс | PCIe Gen5 x4 |
| Память | pSLC NAND |
| Последовательное чтение | до 14,8 ГБ/с |
| Случайное чтение | около 3,1 млн IOPS |
| Задержка чтения | 54 мкс |
| Задержка записи | 10 мкс |
| Выносливость | до 100 DWPD |
Идея понятна тем, кто собирал рабочие станции под локальные модели. У GPU может хватать вычислительной мощности, но память упирается в размер модели, батч и длину контекста. AI90 пытается растянуть эту память через быстрый слой хранения.
Цена вопроса пока не названа. И это важнее, чем кажется. Если платформа стоит как ещё несколько видеокарт, экономия на GPU станет спорной. Если цена ниже стоимости расширения кластера, подход может заинтересовать команды с плотными инференс-нагрузками.
Подход укладывается в общий тренд tiered memory для LLM. Модели растут быстрее, чем объём HBM в доступных системах. Поэтому инженеры всё чаще смешивают HBM, DRAM и быстрые накопители, чтобы не покупать новую стойку GPU под каждый скачок контекста.
Независимых бенчмарков AI90 пока нет. Публично известные цифры — до 50-кратного снижения задержки первого токена, до 5,1 раза по throughput, до 5,8 раза на восьми RTX 5090 и до 100 DWPD для PT200Z; похожую сводку характеристик опубликовал Guru3D.