Облачный сервер для AI-инференса в Европе: руководство по GPU и CPU
Инференс AI - запуск обученной модели для получения предсказаний или продолжений - одна из самых быстро растущих серверных нагрузок в 2026 году. Для компаний, работающих в Европе, выбор инфраструктуры не сводится к характеристикам оборудования: GDPR требует, чтобы запросы инференса с персональными данными обрабатывались на инфраструктуре под юрисдикцией ЕС.
Это руководство описывает, как выбрать между инференсом на GPU и на CPU, какое оборудование нужно каждому подходу и как обслуживать модели AI в продакшене на облачном сервере в ЕС с соблюдением GDPR.
Почему место хранения данных в ЕС важно для инференса AI
Любой запрос к модели AI потенциально является персональными данными по GDPR: он может содержать имена пользователей, содержимое писем, медицинские вопросы или финансовые сведения. Если инференс идёт через размещённый в США API, эти данные покидают юрисдикцию ЕС. Инференс на облачном сервере DCXV в ЕС держит все запросы и ответы в границах ЕС, выполняя требования к месту хранения без опоры на стандартные договорные условия.
Помимо соответствия требованиям, инференс в ЕС снимает трансатлантическое время оборота. Модель, отдаваемая из Праги или Франкфурта, отвечает на 80-120 мс быстрее на запрос, чем та же модель с точки в США, и для интерактивных приложений вроде чат-ботов и помощников это заметная разница.
Инференс на GPU или на CPU: когда что использовать
Подходящие вычисления зависят от размера модели и требований к пропускной способности:
- Инференс на CPU хорошо работает для небольших моделей (менее 7B параметров в INT8 или INT4), моделей эмбеддингов и сценариев с невысокой пропускной способностью (менее 20 запросов в секунду). Современные CPU с AVX-512 держат модели 7B на 15-30 токенах в секунду, чего достаточно для фоновой обработки или внутренних инструментов.
- Инференс на GPU нужен для крупных моделей (13B параметров и больше), интерактивных сценариев в реальном времени и пакетных нагрузок, которым требуется 50 токенов в секунду и выше. Один RTX 4090 или A100 даёт в 10-20 раз большую токенную пропускную способность, чем инференс на CPU для той же модели.
Минимальные требования к серверу для инференса AI
Инференс только на CPU:
- Небольшой (модели эмбеддингов, классификаторы) - 8 vCPU, 16 ГБ RAM, 100 ГБ NVMe SSD
- Средний (модель 7B, внутренний API) - 16 vCPU, 32 ГБ RAM, 200 ГБ NVMe SSD
- Крупный (модель 13B в INT4, умеренный трафик) - 32 vCPU, 64 ГБ RAM, 500 ГБ NVMe SSD
Инференс на GPU:
- Начальный (модели 7B-13B, RTX 4090 с 24 ГБ VRAM) - 8 vCPU, 32 ГБ RAM, 24 ГБ GPU, 500 ГБ NVMe
- Продакшен (модели 34B-70B, A100 с 80 ГБ VRAM) - 16 vCPU, 128 ГБ RAM, 80 ГБ GPU, 1 ТБ NVMe
- Несколько GPU (70B и больше в полной точности) - 2 или 4 карты A100 либо H100, 256 ГБ RAM и больше, 2 ТБ NVMe и больше
Рекомендуемая конфигурация DCXV
Облачные серверы DCXV поддерживают и оптимизированные под CPU, и GPU-конфигурации для нагрузок инференса AI:
- 16 vCPU, 64 ГБ RAM, 500 ГБ NVMe - инференс на CPU для квантованных моделей 7B-13B, внутренние инструменты
- Сервер с GPU на 24 ГБ VRAM - инференс в реальном времени для моделей 7B-13B, API чат-ботов
- Сервер с GPU на 80 ГБ VRAM - продакшен-инференс для моделей 34B-70B
Все конфигурации работают в сертифицированных по Tier III дата-центрах ЕС с приватной сетью для защищённых точек инференса. Напишите на sales@dcxv.com, чтобы обсудить наличие GPU и конфигурации с несколькими GPU.
Команды для быстрой установки
# Установка Ollama для простого обслуживания моделей на CPU или GPU в Ubuntu 22.04
curl -fsSL https://ollama.com/install.sh | sh
# Запуск службы Ollama
sudo systemctl start ollama
sudo systemctl enable ollama
# Загрузка и запуск модели (для примера Llama 3.1 8B)
ollama pull llama3.1:8b
# Локальная проверка инференса
ollama run llama3.1:8b "Explain EU GDPR data residency in one paragraph"
# Публикация Ollama как API в приватной сети
# Правьте /etc/systemd/system/ollama.service - добавьте строку Environment:
# Environment="OLLAMA_HOST=0.0.0.0:11434"
sudo systemctl daemon-reload
sudo systemctl restart ollama
# Проверка REST API с сервера приложений
curl http://10.0.0.5:11434/api/generate \
-d '{"model": "llama3.1:8b", "prompt": "What is GDPR?", "stream": false}'
# Для продакшен-обслуживания с высокой пропускной способностью используйте vLLM (нужен GPU)
pip install vllm
# Обслуживание модели через API, совместимый с OpenAI
python -m vllm.entrypoints.openai.api_server \
--model meta-llama/Llama-3.1-8B-Instruct \
--host 10.0.0.5 \
--port 8000 \
--max-model-len 4096 \
--gpu-memory-utilization 0.85
# Для инференса только на CPU через llama.cpp
# Установка зависимостей сборки
sudo apt install -y build-essential cmake
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp && cmake -B build -DLLAMA_AVX512=ON && cmake --build build -j $(nproc)
# Скачайте модель в формате GGUF (пример 8B с 4-битным квантованием)
# Положите в каталог models/, затем обслуживайте:
./build/bin/llama-server \
--model models/llama-3.1-8b-instruct-q4_k_m.gguf \
--host 10.0.0.5 \
--port 8080 \
--ctx-size 4096 \
--threads $(nproc)
Ожидаемые показатели производительности
Инференс на CPU (сервер 16 vCPU, llama.cpp, INT4):
- Llama 3.1 8B в Q4_K_M - генерация 18-28 токенов в секунду
- Модель эмбеддингов (nomic-embed-text) - 200-400 эмбеддингов в секунду
- Задержка до первого токена (модель 8B) - от 800 мс до 2 с
Инференс на GPU (RTX 4090 24 ГБ, vLLM):
- Llama 3.1 8B в FP16 - 80-120 токенов в секунду на запрос
- Пропускная способность Llama 3.1 8B (пакетно) - 400-800 токенов в секунду суммарно
- Задержка до первого токена - 150-400 мс
Инференс на GPU (A100 80 ГБ, vLLM):
- Llama 3.1 70B в FP16 - 25-45 токенов в секунду на запрос
- Пропускная способность Mistral 7B (пакетно) - 1 200-2 000 токенов в секунду суммарно
Это ожидания для оборудования такого класса, а не измерения из нашей лаборатории. Считайте их отправной точкой для расчёта и измеряйте собственную нагрузку: реальные цифры зависят от ваших данных, ваших запросов и вашей настройки гораздо сильнее, чем от провайдера.
Итог
Инференс AI в Европе - требование GDPR для любого приложения, которое обрабатывает персональные данные через LLM или другие модели AI. Инференс на CPU на хорошо укомплектованном сервере DCXV справляется с внутренними инструментами и API с небольшим трафиком. Инференс на GPU - верный выбор для интерактивных приложений, с которыми работает конечный пользователь. Оба варианта держат трафик инференса на инфраструктуре ЕС под юрисдикцией ЕС. Напишите на sales@dcxv.com, чтобы собрать конфигурацию под размер вашей модели и целевую пропускную способность.
