Содержание
Google Research опубликовала TurboQuant — алгоритм сжатия KV-кэша для LLM, который ужимает данные до 3 бит и заявляет нулевую потерю точности. В тестах на Nvidia H100 4-битный режим TurboQuant дал до 8 раз ускорения при расчёте attention logits по сравнению с не квантованными 32-битными ключами, а память под KV-кэш сократилась минимум в 6 раз.
Речь про практическую боль инференса. KV-кэш хранит уже посчитанные данные внимания, чтобы модель не пересчитывала их на каждом новом токене. Чем больше контекстное окно, тем быстрее KV-кэш превращается в главный потребитель памяти.
Почему обычная квантование KV-кэша упирается в «мелкие» накладные расходы
Классические методы векторного квантования уменьшают объём KV-кэша. Но они добавляют накладные биты на константы квантования, которые нужно хранить рядом со сжатыми значениями. На коротких контекстах это терпимо. На длинных окнах накладные расходы начинают «расти в цене» вместе с самим кэшем.
TurboQuant, по описанию Google, убирает этот оверхед двухэтапной схемой. И в этом его главный трюк, а не сама цифра «3 бита».
Как устроен TurboQuant: PolarQuant и 1-битная коррекция ошибки
Первый этап — PolarQuant. Он переводит векторы из декартовых координат в полярные: отдельно радиус (модуль) и углы (направление). Google пишет, что распределения углов получаются предсказуемыми и «собранными», поэтому можно пропустить дорогую нормализацию по блокам, которая нужна многим обычным квантователям. Итог — качественное сжатие без хранения дополнительных констант квантования.
Второй этап — 1-битный слой коррекции ошибки на базе Quantized Johnson-Lindenstrauss (QJL). Он берёт остаточную ошибку квантования, проецирует её в пространство меньшей размерности и сводит каждое значение к одному знаковому биту. Цель — убрать систематический сдвиг в расчётах attention scores при почти нулевой цене по времени.
Бенчмарки: LongBench, Needle In A Haystack и модели Gemma и Mistral
Google прогнала TurboQuant на длинноконтекстных наборах: LongBench, Needle In A Haystack, ZeroSCROLLS, RULER и L-Eval. Для тестов взяли открытые модели Gemma и Mistral.
На задачах needle-in-a-haystack TurboQuant, по данным Google, показал «идеальные» downstream-результаты, при этом сжимал KV-память минимум в 6 раз. На LongBench TurboQuant сравнили с базовой линией KIVI и получили показатели на уровне или выше по всем задачам набора, включая вопрос-ответ, генерацию кода и суммаризацию.
Отдельно алгоритм проверили в векторном поиске. На датасете GloVe TurboQuant сравнили с Product Quantization и RabbiQ. Google заявляет лучшие значения 1@k recall, хотя конкурирующие подходы опирались на более крупные кодбуки и подстройку под конкретный датасет.
Ключевой прикладной момент: Google подчёркивает, что TurboQuant не требует обучения или fine-tuning, а накладные расходы по времени исполнения у него «незначительные». Это делает метод кандидатом на продакшен-инференс и крупные системы векторного поиска.
Публикацию подготовили соавторы Amir Zandieh и Vahab Mirrokni. Работу представят на ICLR 2026 в следующем месяце. Первоисточник — пост Google Research: TurboQuant: redefining AI efficiency with extreme compression.