TurboQuant: сжатие AI от Google, которое теперь работает на CPU
Google представила TurboQuant - новую технику квантования для больших языковых моделей и векторного поиска. Исследование бьёт по одному из самых устойчивых узких мест при развёртывании AI: кешу KV, который растёт пропорционально длине контекста и исторически вынуждал команды идти к дорогим кластерам GPU. TurboQuant меняет расстановку. Сжимая записи кеша KV примерно до 3 бит без дообучения и без потери точности, он делает инференс AI пригодным для обычного оборудования на CPU - того самого, на котором сегодня работают стандартные облачные серверы.

Как работает TurboQuant
TurboQuant - система из двух частей. PolarQuant берёт на себя основную работу по сжатию и убирает большую часть данных. QJL затем выполняет оставшийся однобитный проход коррекции ошибок. Вместе они дают квантование кеша KV до 3 бит. Дообучение не нужно, а точность на стандартных тестах сохраняется. Ключевое наблюдение в том, что эти два метода дополняют друг друга: каждый компенсирует остаточную ошибку другого так, что в сумме получается сжатие, близкое к теоретическому пределу.
QJL: однобитный приём без накладных расходов
QJL применяет преобразование Джонсона-Линденштрауса к многомерным векторам ключей и значений. Это математическое преобразование известно тем, что сжимает данные, сохраняя относительные расстояния между точками. QJL идёт дальше и сводит каждый вектор к одному знаковому биту: плюс единица или минус единица на измерение. В результате объём памяти сокращается предельно, а дополнительных накладных расходов нет. Расчёт оценок внимания остаётся точным, потому что проекция на знаковый бит сохраняет геометрические отношения, самые важные при инференсе.
PolarQuant: новый взгляд на сжатие под другим углом
PolarQuant переформулирует задачу сжатия геометрически. Вместо работы в обычных декартовых координатах он переводит векторы в полярную форму: радиус как величина и углы как направление. Это убирает дорогой шаг нормализации, который нужен большинству методов квантования. Полярное представление естественно ложится на предсказуемую круговую сетку, которая квантуется чисто. Рекурсивные полярные преобразования способны свести полный многомерный вектор к одному радиусу и компактному набору углов, добиваясь агрессивного сжатия без искажения исходных данных.
Эксперименты и результаты
Команда Google проверила TurboQuant на ряде тестов с длинным контекстом: LongBench, Needle-in-Haystack, ZeroSCROLLS, RULER и L-Eval. Среди проверенных моделей Gemma, Mistral и Llama-3.1-8B-Instruct. Память под кеш KV сократилась в 6 раз и более. При квантовании до 4 бит TurboQuant даёт восьмикратное ускорение относительно обычных 32 бит на GPU H100. В задачах векторного поиска TurboQuant обходит и Product Quantization (PQ), и RaBitQ по метрикам полноты и качества поиска.
Инференс на CPU теперь готов к продакшену
Это и есть практический вывод. TurboQuant сжимает модели так агрессивно, что инференс на CPU становится пригоден для настоящих продакшен-нагрузок, а не только для исследовательских демонстраций. Сообщество llama.cpp быстро это заметило и уже выпустило рабочие ветки с реализацией:
- https://github.com/elusznik/llama.cpp/tree/turboquant-cpu-tbq-pr
- https://github.com/Aaryan-Kapoor/llama.cpp/tree/turboquant-tq3_0
Облачные серверы - такие как доступные в DCXV - теперь более чем способны выполнять инференс AI вообще без оборудования GPU. Если вы ждали повода перенести нагрузки AI с дорогих инстансов с GPU на обычные облачные машины, TurboQuant - этот повод. Актуальные варианты облачных серверов смотрите на https://dcxv.com/data-center#cloud.
Что дальше
TurboQuant снимает узкое место кеша KV, которое ограничивало модели масштаба Gemini с самого их выхода. Он также делает возможным качественный семантический векторный поиск на собственном операционном масштабе Google. Тесты показывают, что метод подходит близко к теоретическим нижним границам для этого класса сжатия. По мере того как возможности AI глубже входят в программные продукты, эффективное квантование становится базовой инфраструктурой, а не исследовательским курьёзом. TurboQuant указывает на будущее, где способный AI работает на обычном оборудовании, доступном любому владельцу стандартного сервера.