GPU-серверы в Европе

NVIDIA GPU-серверы для AI, машинного обучения и рендеринга в дата-центрах Tier III в ЕС

Сертифицировано по Tier III ISO 9001 ISO/IEC 27001 ISO 14001 Соответствует GDPR

Мы предлагаем

Наши демократичные цены на услуги

Только Брендовое Оборудование, Полный Контроль, Никаких Ограничений Трафика, Никаких Сюрпризов!

1
1
1
1
IP 1 IP
1 IP min max 7 IP
Месяцы оплачены заранее 6 month
6 month min max 12 month

Почему выбирают нас

Дата-центры TIER III

Корпоративная инфраструктура с гарантией 99.9% аптайма по локациям ЕС

Мгновенное развертывание

Получите ваши серверы и ресурсы онлайн за часы, а не дни. Никакой комиссии за установку

Соответствие требованиям ЕС

GDPR-совместимые операции со всеми данными, хранящимися в европейских дата-центрах

GPU-серверы для инференса, обучения и рендеринга

GPU-сервер - это выделенная машина с одним или несколькими ускорителями в наших собственных европейских стойках. Вы получаете карту целиком, а не поделённую во времени долю, вместе с CPU, RAM и NVMe, чтобы её кормить, - и именно это обычно определяет реальную пропускную способность.

Доступные карты меняются вместе с поставками, поэтому честным списком является страница конфигурации, а не фиксированная таблица здесь. Что не меняется - это форма: достаточно системной памяти, чтобы удержать модель во время загрузки, NVMe достаточно быстрый, чтобы загрузка данных не стала узким местом, и сетевой порт, через который пройдёт набор данных.

Какие размеры моделей помещаются на какую карту

Практическое ограничение - VRAM. Модель на 7 миллиардов параметров, квантованная до 4 бит, свободно помещается на карте 16 ГБ и оставляет место для полезного окна контекста; 13B хочет 24 ГБ; модель 70B при той же квантизации требует примерно 40-48 ГБ или двух карт. Обслуживание в полной 16-битной точности примерно удваивает каждое из этих чисел.

Если модель не помещается, ответ - квантизация, модель поменьше или ещё одна карта, а не выгрузка в системную память, которая превращает интерактивного помощника в пакетную задачу.

Программы, которыми пользуются на самом деле

vLLM для обслуживания с высокой пропускной способностью и совместимым с OpenAI эндпоинтом, Ollama, когда удобство важнее пиковых токенов в секунду, llama.cpp для наименьшего следа и PyTorch напрямую для всего нестандартного. Всё это ставится так же, как на любой машине с Ubuntu, потому что именно ею она и является.

Инференс или обучение - им нужны разные машины

Инференс чувствителен к задержкам и ограничен в основном VRAM и пропускной способностью памяти: одна карта, достаточно большая, и короткий путь до клиента. Он работает непрерывно, поэтому машина с помесячной оплатой - более дешёвое решение.

Обучение и дообучение ограничены пропускной способностью и приходят всплесками. Им нужно больше карт, значительно больше системной памяти и NVMe, достаточный для набора данных. Если работа нерегулярная, берите размер под пик и возвращайте машину, вместо того чтобы платить за простаивающий кремний.

Приватный ИИ, и где лежат данные

Причина, по которой большинство наших GPU-клиентов здесь, - не цена. А то, что модель, работающая на машине, которую вы арендуете в Праге или Ковильяне, не отправляет запросы третьей стороне, не обучает чужую модель на ваших документах и находится в юрисдикции, которую вы можете назвать в договоре об обработке данных.

Это важно для всего, что касается клиентских записей, договоров, медицинских или финансовых данных, - для нагрузок, где публичный API инференса является проблемой соответствия ещё до того, как становится технической.

Локации и как получить сервер

GPU-машины физические и собираются под заказ, поэтому срок дольше, чем у облачного сервера: скажите поддержке, какую модель собираетесь обслуживать и с какой параллельностью, и вам назовут наименьшую карту, которая с этим справится, а не самую большую на складе.

Обе площадки Tier III могут их разместить, и выбор идёт за вашими пользователями так же, как для любого другого сервера.

FAQ

Частые вопросы

Я получаю весь GPU или его долю?

Всю карту. GPU-сервер - это выделенная машина с подключённым ускорителем, вместе с CPU, RAM и NVMe, нужными, чтобы его кормить, и обычно именно это, а не сама карта, определяет реальную пропускную способность

Какие размеры моделей помещаются на какую карту?

Ограничением является VRAM. Модель на 7 миллиардов параметров, квантованная до 4 бит, свободно помещается в 16 ГБ и оставляет место для полезного окна контекста, 13B требует 24 ГБ, а модель 70B при той же квантизации - около 40-48 ГБ или двух карт. Обслуживание в полной 16-битной точности примерно удваивает каждое число

Какие стеки обслуживания поддерживаются?

Всё, что работает на Ubuntu с драйверами NVIDIA: vLLM для обслуживания с высокой пропускной способностью и совместимым с OpenAI эндпоинтом, Ollama, когда удобство важнее пиковой пропускной способности, llama.cpp для наименьшего следа или PyTorch напрямую для нестандартной работы

GPU-сервер лучше подходит для инференса или для обучения?

Им нужны разные машины. Инференс ограничен задержками и в основном VRAM, поэтому достаточно большая карта в непрерывной работе - более дешёвое решение. Обучение и дообучение ограничены пропускной способностью и приходят всплесками: больше карт, значительно больше системной памяти и NVMe, достаточный для набора данных

Куда попадают мои данные, когда я запускаю здесь модель?

Никуда. Модель работает на машине, которую вы арендуете в Праге или Ковильяне: запросы не отправляются третьей стороне, ничто не используется для обучения чужой модели, а юрисдикция - та, которую вы можете назвать в договоре об обработке данных

Сколько времени нужно, чтобы получить такой сервер?

Дольше, чем облачный сервер, потому что машина физическая и собирается под заказ. Скажите поддержке, какую модель собираетесь обслуживать и какую параллельность ожидаете, и они подберут наименьшую карту, которая с этим справится, а не самую большую на складе

Если вам нужна помощь или у вас возникли дополнительные вопросы, пожалуйста, обращайтесь к менеджерам или напишите в службу поддержки по адресу support@dcxv.com