Мы предлагаем
Наши демократичные цены на услуги
Только Брендовое Оборудование, Полный Контроль, Никаких Ограничений Трафика, Никаких Сюрпризов!
NVIDIA GPU-серверы для AI, машинного обучения и рендеринга в дата-центрах Tier III в ЕС
Только Брендовое Оборудование, Полный Контроль, Никаких Ограничений Трафика, Никаких Сюрпризов!
Корпоративная инфраструктура с гарантией 99.9% аптайма по локациям ЕС
Получите ваши серверы и ресурсы онлайн за часы, а не дни. Никакой комиссии за установку
GDPR-совместимые операции со всеми данными, хранящимися в европейских дата-центрах
GPU-сервер - это выделенная машина с одним или несколькими ускорителями в наших собственных европейских стойках. Вы получаете карту целиком, а не поделённую во времени долю, вместе с CPU, RAM и NVMe, чтобы её кормить, - и именно это обычно определяет реальную пропускную способность.
Доступные карты меняются вместе с поставками, поэтому честным списком является страница конфигурации, а не фиксированная таблица здесь. Что не меняется - это форма: достаточно системной памяти, чтобы удержать модель во время загрузки, NVMe достаточно быстрый, чтобы загрузка данных не стала узким местом, и сетевой порт, через который пройдёт набор данных.
Практическое ограничение - VRAM. Модель на 7 миллиардов параметров, квантованная до 4 бит, свободно помещается на карте 16 ГБ и оставляет место для полезного окна контекста; 13B хочет 24 ГБ; модель 70B при той же квантизации требует примерно 40-48 ГБ или двух карт. Обслуживание в полной 16-битной точности примерно удваивает каждое из этих чисел.
Если модель не помещается, ответ - квантизация, модель поменьше или ещё одна карта, а не выгрузка в системную память, которая превращает интерактивного помощника в пакетную задачу.
vLLM для обслуживания с высокой пропускной способностью и совместимым с OpenAI эндпоинтом, Ollama, когда удобство важнее пиковых токенов в секунду, llama.cpp для наименьшего следа и PyTorch напрямую для всего нестандартного. Всё это ставится так же, как на любой машине с Ubuntu, потому что именно ею она и является.
Инференс чувствителен к задержкам и ограничен в основном VRAM и пропускной способностью памяти: одна карта, достаточно большая, и короткий путь до клиента. Он работает непрерывно, поэтому машина с помесячной оплатой - более дешёвое решение.
Обучение и дообучение ограничены пропускной способностью и приходят всплесками. Им нужно больше карт, значительно больше системной памяти и NVMe, достаточный для набора данных. Если работа нерегулярная, берите размер под пик и возвращайте машину, вместо того чтобы платить за простаивающий кремний.
Причина, по которой большинство наших GPU-клиентов здесь, - не цена. А то, что модель, работающая на машине, которую вы арендуете в Праге или Ковильяне, не отправляет запросы третьей стороне, не обучает чужую модель на ваших документах и находится в юрисдикции, которую вы можете назвать в договоре об обработке данных.
Это важно для всего, что касается клиентских записей, договоров, медицинских или финансовых данных, - для нагрузок, где публичный API инференса является проблемой соответствия ещё до того, как становится технической.
GPU-машины физические и собираются под заказ, поэтому срок дольше, чем у облачного сервера: скажите поддержке, какую модель собираетесь обслуживать и с какой параллельностью, и вам назовут наименьшую карту, которая с этим справится, а не самую большую на складе.
Обе площадки Tier III могут их разместить, и выбор идёт за вашими пользователями так же, как для любого другого сервера.
Частые вопросы
Всю карту. GPU-сервер - это выделенная машина с подключённым ускорителем, вместе с CPU, RAM и NVMe, нужными, чтобы его кормить, и обычно именно это, а не сама карта, определяет реальную пропускную способность
Ограничением является VRAM. Модель на 7 миллиардов параметров, квантованная до 4 бит, свободно помещается в 16 ГБ и оставляет место для полезного окна контекста, 13B требует 24 ГБ, а модель 70B при той же квантизации - около 40-48 ГБ или двух карт. Обслуживание в полной 16-битной точности примерно удваивает каждое число
Всё, что работает на Ubuntu с драйверами NVIDIA: vLLM для обслуживания с высокой пропускной способностью и совместимым с OpenAI эндпоинтом, Ollama, когда удобство важнее пиковой пропускной способности, llama.cpp для наименьшего следа или PyTorch напрямую для нестандартной работы
Им нужны разные машины. Инференс ограничен задержками и в основном VRAM, поэтому достаточно большая карта в непрерывной работе - более дешёвое решение. Обучение и дообучение ограничены пропускной способностью и приходят всплесками: больше карт, значительно больше системной памяти и NVMe, достаточный для набора данных
Никуда. Модель работает на машине, которую вы арендуете в Праге или Ковильяне: запросы не отправляются третьей стороне, ничто не используется для обучения чужой модели, а юрисдикция - та, которую вы можете назвать в договоре об обработке данных
Дольше, чем облачный сервер, потому что машина физическая и собирается под заказ. Скажите поддержке, какую модель собираетесь обслуживать и какую параллельность ожидаете, и они подберут наименьшую карту, которая с этим справится, а не самую большую на складе
Если вам нужна помощь или у вас возникли дополнительные вопросы, пожалуйста, обращайтесь к менеджерам или напишите в службу поддержки по адресу support@dcxv.com