Google Research опубликовала TurboQuant — алгоритм сжатия KV-кэша для LLM, который ужимает данные до 3 бит и заявляет нулевую потерю точности. В тестах на Nvidia H100 4-битный режим TurboQuant дал до 8 раз ускорения при расчёте attention logits по сравнению с не квантованными 32-битными ключами, а память под KV-кэш сократилась минимум в 6 раз.

Речь про практическую боль инференса. KV-кэш хранит уже посчитанные данные внимания, чтобы модель не пересчитывала их на каждом новом токене. Чем больше контекстное окно, тем быстрее KV-кэш превращается в главный потребитель памяти.

Почему обычная квантование KV-кэша упирается в «мелкие» накладные расходы

Классические методы векторного квантования уменьшают объём KV-кэша. Но они добавляют накладные биты на константы квантования, которые нужно хранить рядом со сжатыми значениями. На коротких контекстах это терпимо. На длинных окнах накладные расходы начинают «расти в цене» вместе с самим кэшем.

Продолжение после рекламы

TurboQuant, по описанию Google, убирает этот оверхед двухэтапной схемой. И в этом его главный трюк, а не сама цифра «3 бита».

Как устроен TurboQuant: PolarQuant и 1-битная коррекция ошибки

Первый этап — PolarQuant. Он переводит векторы из декартовых координат в полярные: отдельно радиус (модуль) и углы (направление). Google пишет, что распределения углов получаются предсказуемыми и «собранными», поэтому можно пропустить дорогую нормализацию по блокам, которая нужна многим обычным квантователям. Итог — качественное сжатие без хранения дополнительных констант квантования.

Изображение к статье: Google TurboQuant сжал KV-кэш LLM до 3 бит без потери точности

Второй этап — 1-битный слой коррекции ошибки на базе Quantized Johnson-Lindenstrauss (QJL). Он берёт остаточную ошибку квантования, проецирует её в пространство меньшей размерности и сводит каждое значение к одному знаковому биту. Цель — убрать систематический сдвиг в расчётах attention scores при почти нулевой цене по времени.

Бенчмарки: LongBench, Needle In A Haystack и модели Gemma и Mistral

Google прогнала TurboQuant на длинноконтекстных наборах: LongBench, Needle In A Haystack, ZeroSCROLLS, RULER и L-Eval. Для тестов взяли открытые модели Gemma и Mistral.

На задачах needle-in-a-haystack TurboQuant, по данным Google, показал «идеальные» downstream-результаты, при этом сжимал KV-память минимум в 6 раз. На LongBench TurboQuant сравнили с базовой линией KIVI и получили показатели на уровне или выше по всем задачам набора, включая вопрос-ответ, генерацию кода и суммаризацию.

Отдельно алгоритм проверили в векторном поиске. На датасете GloVe TurboQuant сравнили с Product Quantization и RabbiQ. Google заявляет лучшие значения 1@k recall, хотя конкурирующие подходы опирались на более крупные кодбуки и подстройку под конкретный датасет.

Ключевой прикладной момент: Google подчёркивает, что TurboQuant не требует обучения или fine-tuning, а накладные расходы по времени исполнения у него «незначительные». Это делает метод кандидатом на продакшен-инференс и крупные системы векторного поиска.

Публикацию подготовили соавторы Amir Zandieh и Vahab Mirrokni. Работу представят на ICLR 2026 в следующем месяце. Первоисточник — пост Google Research: TurboQuant: redefining AI efficiency with extreme compression.

Продолжение после рекламы

Рейтинг: 0 / 5. Оценок: 0

Рекомендуем почитать

Оставьте комментарий

Перед оставлением комментария, пожалуйста, ознакомьтесь с правилами комментирования.