Облачный сервер для AI-инференса в Европе: руководство по GPU и CPU

Облачный сервер для AI-инференса в Европе: руководство по GPU и CPU

Облачный сервер для AI-инференса в Европе: руководство по GPU и CPU

Инференс AI - запуск обученной модели для получения предсказаний или продолжений - одна из самых быстро растущих серверных нагрузок в 2026 году. Для компаний, работающих в Европе, выбор инфраструктуры не сводится к характеристикам оборудования: GDPR требует, чтобы запросы инференса с персональными данными обрабатывались на инфраструктуре под юрисдикцией ЕС.

Это руководство описывает, как выбрать между инференсом на GPU и на CPU, какое оборудование нужно каждому подходу и как обслуживать модели AI в продакшене на облачном сервере в ЕС с соблюдением GDPR.

Почему место хранения данных в ЕС важно для инференса AI

Любой запрос к модели AI потенциально является персональными данными по GDPR: он может содержать имена пользователей, содержимое писем, медицинские вопросы или финансовые сведения. Если инференс идёт через размещённый в США API, эти данные покидают юрисдикцию ЕС. Инференс на облачном сервере DCXV в ЕС держит все запросы и ответы в границах ЕС, выполняя требования к месту хранения без опоры на стандартные договорные условия.

Помимо соответствия требованиям, инференс в ЕС снимает трансатлантическое время оборота. Модель, отдаваемая из Праги или Франкфурта, отвечает на 80-120 мс быстрее на запрос, чем та же модель с точки в США, и для интерактивных приложений вроде чат-ботов и помощников это заметная разница.

Инференс на GPU или на CPU: когда что использовать

Подходящие вычисления зависят от размера модели и требований к пропускной способности:

  • Инференс на CPU хорошо работает для небольших моделей (менее 7B параметров в INT8 или INT4), моделей эмбеддингов и сценариев с невысокой пропускной способностью (менее 20 запросов в секунду). Современные CPU с AVX-512 держат модели 7B на 15-30 токенах в секунду, чего достаточно для фоновой обработки или внутренних инструментов.
  • Инференс на GPU нужен для крупных моделей (13B параметров и больше), интерактивных сценариев в реальном времени и пакетных нагрузок, которым требуется 50 токенов в секунду и выше. Один RTX 4090 или A100 даёт в 10-20 раз большую токенную пропускную способность, чем инференс на CPU для той же модели.

Минимальные требования к серверу для инференса AI

Инференс только на CPU:

  • Небольшой (модели эмбеддингов, классификаторы) - 8 vCPU, 16 ГБ RAM, 100 ГБ NVMe SSD
  • Средний (модель 7B, внутренний API) - 16 vCPU, 32 ГБ RAM, 200 ГБ NVMe SSD
  • Крупный (модель 13B в INT4, умеренный трафик) - 32 vCPU, 64 ГБ RAM, 500 ГБ NVMe SSD

Инференс на GPU:

  • Начальный (модели 7B-13B, RTX 4090 с 24 ГБ VRAM) - 8 vCPU, 32 ГБ RAM, 24 ГБ GPU, 500 ГБ NVMe
  • Продакшен (модели 34B-70B, A100 с 80 ГБ VRAM) - 16 vCPU, 128 ГБ RAM, 80 ГБ GPU, 1 ТБ NVMe
  • Несколько GPU (70B и больше в полной точности) - 2 или 4 карты A100 либо H100, 256 ГБ RAM и больше, 2 ТБ NVMe и больше

Рекомендуемая конфигурация DCXV

Облачные серверы DCXV поддерживают и оптимизированные под CPU, и GPU-конфигурации для нагрузок инференса AI:

  • 16 vCPU, 64 ГБ RAM, 500 ГБ NVMe - инференс на CPU для квантованных моделей 7B-13B, внутренние инструменты
  • Сервер с GPU на 24 ГБ VRAM - инференс в реальном времени для моделей 7B-13B, API чат-ботов
  • Сервер с GPU на 80 ГБ VRAM - продакшен-инференс для моделей 34B-70B

Все конфигурации работают в сертифицированных по Tier III дата-центрах ЕС с приватной сетью для защищённых точек инференса. Напишите на sales@dcxv.com, чтобы обсудить наличие GPU и конфигурации с несколькими GPU.

Команды для быстрой установки

# Установка Ollama для простого обслуживания моделей на CPU или GPU в Ubuntu 22.04
curl -fsSL https://ollama.com/install.sh | sh

# Запуск службы Ollama
sudo systemctl start ollama
sudo systemctl enable ollama

# Загрузка и запуск модели (для примера Llama 3.1 8B)
ollama pull llama3.1:8b

# Локальная проверка инференса
ollama run llama3.1:8b "Explain EU GDPR data residency in one paragraph"
# Публикация Ollama как API в приватной сети
# Правьте /etc/systemd/system/ollama.service - добавьте строку Environment:
# Environment="OLLAMA_HOST=0.0.0.0:11434"

sudo systemctl daemon-reload
sudo systemctl restart ollama

# Проверка REST API с сервера приложений
curl http://10.0.0.5:11434/api/generate \
  -d '{"model": "llama3.1:8b", "prompt": "What is GDPR?", "stream": false}'
# Для продакшен-обслуживания с высокой пропускной способностью используйте vLLM (нужен GPU)
pip install vllm

# Обслуживание модели через API, совместимый с OpenAI
python -m vllm.entrypoints.openai.api_server \
  --model meta-llama/Llama-3.1-8B-Instruct \
  --host 10.0.0.5 \
  --port 8000 \
  --max-model-len 4096 \
  --gpu-memory-utilization 0.85
# Для инференса только на CPU через llama.cpp
# Установка зависимостей сборки
sudo apt install -y build-essential cmake

git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp && cmake -B build -DLLAMA_AVX512=ON && cmake --build build -j $(nproc)

# Скачайте модель в формате GGUF (пример 8B с 4-битным квантованием)
# Положите в каталог models/, затем обслуживайте:
./build/bin/llama-server \
  --model models/llama-3.1-8b-instruct-q4_k_m.gguf \
  --host 10.0.0.5 \
  --port 8080 \
  --ctx-size 4096 \
  --threads $(nproc)

Ожидаемые показатели производительности

Инференс на CPU (сервер 16 vCPU, llama.cpp, INT4):

  • Llama 3.1 8B в Q4_K_M - генерация 18-28 токенов в секунду
  • Модель эмбеддингов (nomic-embed-text) - 200-400 эмбеддингов в секунду
  • Задержка до первого токена (модель 8B) - от 800 мс до 2 с

Инференс на GPU (RTX 4090 24 ГБ, vLLM):

  • Llama 3.1 8B в FP16 - 80-120 токенов в секунду на запрос
  • Пропускная способность Llama 3.1 8B (пакетно) - 400-800 токенов в секунду суммарно
  • Задержка до первого токена - 150-400 мс

Инференс на GPU (A100 80 ГБ, vLLM):

  • Llama 3.1 70B в FP16 - 25-45 токенов в секунду на запрос
  • Пропускная способность Mistral 7B (пакетно) - 1 200-2 000 токенов в секунду суммарно

Это ожидания для оборудования такого класса, а не измерения из нашей лаборатории. Считайте их отправной точкой для расчёта и измеряйте собственную нагрузку: реальные цифры зависят от ваших данных, ваших запросов и вашей настройки гораздо сильнее, чем от провайдера.

Итог

Инференс AI в Европе - требование GDPR для любого приложения, которое обрабатывает персональные данные через LLM или другие модели AI. Инференс на CPU на хорошо укомплектованном сервере DCXV справляется с внутренними инструментами и API с небольшим трафиком. Инференс на GPU - верный выбор для интерактивных приложений, с которыми работает конечный пользователь. Оба варианта держат трафик инференса на инфраструктуре ЕС под юрисдикцией ЕС. Напишите на sales@dcxv.com, чтобы собрать конфигурацию под размер вашей модели и целевую пропускную способность.

Как подключиться к новому облачному серверу по SSH
sshtutorialcloud

Как подключиться к новому облачному серверу по SSH

Сервер готов, а в панели есть IP, логин и пароль. Вот первое подключение по SSH, четыре ошибки, которые встречаются чаще всего, и первые десять минут.

Как подключиться к Windows-серверу через удалённый рабочий стол
rdpwindowstutorialcloud

Как подключиться к Windows-серверу через удалённый рабочий стол

У вас есть адрес, имя пользователя и пароль. Вот как превратить их в рабочий стол Windows у себя на экране - с ПК, Mac или телефона, шаг за шагом.

Облачный сервер для Stable Diffusion в Европе: настройка GPU
cloudaigpu

Облачный сервер для Stable Diffusion в Европе: настройка GPU

Какое оборудование GPU нужно Stable Diffusion, как поднять два самых популярных интерфейса и какой скорости генерации изображений ожидать в ЕС.

Облачный сервер для хостинга LLM в Европе: руководство по AI и GDPR
cloudaigpu

Облачный сервер для хостинга LLM в Европе: руководство по AI и GDPR

Какое оборудование нужно для продакшен-хостинга LLM, как выбрать размер модели и уровень квантования и какие фреймворки обслуживания лучше работают в облаке ЕС.

Запустите Claude Code, Codex и Grok CLI на своём облачном сервере
cloudaivps

Запустите Claude Code, Codex и Grok CLI на своём облачном сервере

Превратите облачный сервер на Debian или Ubuntu в песочницу для ИИ-агентов вроде Claude Code, Codex и Grok CLI. Пишите код откуда угодно, даже с телефона.