TurboQuant: сжатие AI от Google, которое теперь работает на CPU

TurboQuant: сжатие AI от Google, которое теперь работает на CPU

TurboQuant: сжатие AI от Google, которое теперь работает на CPU

Google представила TurboQuant - новую технику квантования для больших языковых моделей и векторного поиска. Исследование бьёт по одному из самых устойчивых узких мест при развёртывании AI: кешу KV, который растёт пропорционально длине контекста и исторически вынуждал команды идти к дорогим кластерам GPU. TurboQuant меняет расстановку. Сжимая записи кеша KV примерно до 3 бит без дообучения и без потери точности, он делает инференс AI пригодным для обычного оборудования на CPU - того самого, на котором сегодня работают стандартные облачные серверы.

Сжатие AI в TurboQuant

Как работает TurboQuant

TurboQuant - система из двух частей. PolarQuant берёт на себя основную работу по сжатию и убирает большую часть данных. QJL затем выполняет оставшийся однобитный проход коррекции ошибок. Вместе они дают квантование кеша KV до 3 бит. Дообучение не нужно, а точность на стандартных тестах сохраняется. Ключевое наблюдение в том, что эти два метода дополняют друг друга: каждый компенсирует остаточную ошибку другого так, что в сумме получается сжатие, близкое к теоретическому пределу.

QJL: однобитный приём без накладных расходов

QJL применяет преобразование Джонсона-Линденштрауса к многомерным векторам ключей и значений. Это математическое преобразование известно тем, что сжимает данные, сохраняя относительные расстояния между точками. QJL идёт дальше и сводит каждый вектор к одному знаковому биту: плюс единица или минус единица на измерение. В результате объём памяти сокращается предельно, а дополнительных накладных расходов нет. Расчёт оценок внимания остаётся точным, потому что проекция на знаковый бит сохраняет геометрические отношения, самые важные при инференсе.

PolarQuant: новый взгляд на сжатие под другим углом

PolarQuant переформулирует задачу сжатия геометрически. Вместо работы в обычных декартовых координатах он переводит векторы в полярную форму: радиус как величина и углы как направление. Это убирает дорогой шаг нормализации, который нужен большинству методов квантования. Полярное представление естественно ложится на предсказуемую круговую сетку, которая квантуется чисто. Рекурсивные полярные преобразования способны свести полный многомерный вектор к одному радиусу и компактному набору углов, добиваясь агрессивного сжатия без искажения исходных данных.

Эксперименты и результаты

Команда Google проверила TurboQuant на ряде тестов с длинным контекстом: LongBench, Needle-in-Haystack, ZeroSCROLLS, RULER и L-Eval. Среди проверенных моделей Gemma, Mistral и Llama-3.1-8B-Instruct. Память под кеш KV сократилась в 6 раз и более. При квантовании до 4 бит TurboQuant даёт восьмикратное ускорение относительно обычных 32 бит на GPU H100. В задачах векторного поиска TurboQuant обходит и Product Quantization (PQ), и RaBitQ по метрикам полноты и качества поиска.

Инференс на CPU теперь готов к продакшену

Это и есть практический вывод. TurboQuant сжимает модели так агрессивно, что инференс на CPU становится пригоден для настоящих продакшен-нагрузок, а не только для исследовательских демонстраций. Сообщество llama.cpp быстро это заметило и уже выпустило рабочие ветки с реализацией:

Облачные серверы - такие как доступные в DCXV - теперь более чем способны выполнять инференс AI вообще без оборудования GPU. Если вы ждали повода перенести нагрузки AI с дорогих инстансов с GPU на обычные облачные машины, TurboQuant - этот повод. Актуальные варианты облачных серверов смотрите на https://dcxv.com/data-center#cloud.

Что дальше

TurboQuant снимает узкое место кеша KV, которое ограничивало модели масштаба Gemini с самого их выхода. Он также делает возможным качественный семантический векторный поиск на собственном операционном масштабе Google. Тесты показывают, что метод подходит близко к теоретическим нижним границам для этого класса сжатия. По мере того как возможности AI глубже входят в программные продукты, эффективное квантование становится базовой инфраструктурой, а не исследовательским курьёзом. TurboQuant указывает на будущее, где способный AI работает на обычном оборудовании, доступном любому владельцу стандартного сервера.

Как подключиться к новому облачному серверу по SSH
sshtutorialcloud

Как подключиться к новому облачному серверу по SSH

Сервер готов, а в панели есть IP, логин и пароль. Вот первое подключение по SSH, четыре ошибки, которые встречаются чаще всего, и первые десять минут.

Как подключиться к Windows-серверу через удалённый рабочий стол
rdpwindowstutorialcloud

Как подключиться к Windows-серверу через удалённый рабочий стол

У вас есть адрес, имя пользователя и пароль. Вот как превратить их в рабочий стол Windows у себя на экране - с ПК, Mac или телефона, шаг за шагом.

Облачный сервер для Stable Diffusion в Европе: настройка GPU
cloudaigpu

Облачный сервер для Stable Diffusion в Европе: настройка GPU

Какое оборудование GPU нужно Stable Diffusion, как поднять два самых популярных интерфейса и какой скорости генерации изображений ожидать в ЕС.

Облачный сервер для хостинга LLM в Европе: руководство по AI и GDPR
cloudaigpu

Облачный сервер для хостинга LLM в Европе: руководство по AI и GDPR

Какое оборудование нужно для продакшен-хостинга LLM, как выбрать размер модели и уровень квантования и какие фреймворки обслуживания лучше работают в облаке ЕС.

Запустите Claude Code, Codex и Grok CLI на своём облачном сервере
cloudaivps

Запустите Claude Code, Codex и Grok CLI на своём облачном сервере

Превратите облачный сервер на Debian или Ubuntu в песочницу для ИИ-агентов вроде Claude Code, Codex и Grok CLI. Пишите код откуда угодно, даже с телефона.