Еуропадағы AI инференсіне арналған бұлт сервері: GPU және CPU нұсқаулығы

Еуропадағы AI инференсіне арналған бұлт сервері: GPU және CPU нұсқаулығы

Еуропадағы AI инференсіне арналған бұлт сервері: GPU және CPU нұсқаулығы

AI инференсі - үйретілген модельді болжам немесе жалғасын алу үшін жіберу - 2026 жылдағы ең жылдам өсіп келе жатқан сервер жүктемелерінің бірі. Еуропада жұмыс істейтін компаниялар үшін инфрақұрылым таңдауы жабдық сипаттамасымен шектелмейді: GDPR дербес деректері бар инференс сұраныстары ЕО юрисдикциясындағы инфрақұрылымда өңделуін талап етеді.

Бұл нұсқаулық GPU және CPU инференсінің арасынан қалай таңдау керегін, әр тәсілге қандай жабдық қажет екенін және GDPR сақталған ЕО бұлт серверінде AI модельдеріне продакшенде қалай қызмет көрсету керегін баяндайды.

Деректердің ЕО ішінде сақталуы AI инференсі үшін неге маңызды

AI модельіне жіберілген кез келген сұраныс GDPR бойынша ықтимал дербес деректер: онда пайдаланушы есімдері, хат мазмұны, медициналық сұрақтар немесе қаржы мәліметі болуы мүмкін. Егер инференс АҚШ-та орналасқан API арқылы жүрсе, бұл деректер ЕО юрисдикциясынан шығады. DCXV-нің ЕО бұлт серверіндегі инференс барлық сұраныс пен жауапты ЕО шекарасында ұстайды және сақталу орны талаптарын стандартты шарттық ережелерге сүйенбей орындайды.

Талапқа сәйкестіктен басқа, ЕО ішіндегі инференс трансатлантикалық айналым уақытын алып тастайды. Прагадан немесе Франкфурттен берілетін модель АҚШ нүктесіндегі сол модельден сұранысқа 80-120 мс жылдам жауап береді, ал чат-боттар мен көмекшілер сияқты интерактивті қосымшалар үшін бұл байқалатын айырма.

GPU немесе CPU инференсі: қашан қайсысын пайдалану керек

Келетін есептеу модель өлшеміне және өткізу қабілеті талабына байланысты:

  • CPU инференсі шағын модельдерге (INT8 немесе INT4-тегі 7B параметрден аз), эмбеддинг модельдеріне және өткізу қабілеті жоғары емес сценарийлерге (секундына 20 сұраныстан аз) жақсы келеді. AVX-512-і бар қазіргі CPU-лар 7B модельдерін секундына 15-30 токенмен ұстайды, бұл фондық өңдеуге немесе ішкі құралдарға жетеді.
  • GPU инференсі ірі модельдерге (13B параметр және одан көп), нақты уақыттағы интерактивті сценарийлерге және секундына 50 токен және одан жоғары керек пакеттік жүктемелерге қажет. Бір RTX 4090 немесе A100 сол модель үшін CPU инференсінен 10-20 есе үлкен токен өткізу қабілетін береді.

AI инференсі үшін серверге қойылатын ең аз талаптар

Тек CPU-дағы инференс:

  • Шағын (эмбеддинг модельдері, сыныптауыштар) - 8 vCPU, 16 ГБ RAM, 100 ГБ NVMe SSD
  • Орташа (7B модель, ішкі API) - 16 vCPU, 32 ГБ RAM, 200 ГБ NVMe SSD
  • Ірі (INT4-тегі 13B модель, орташа трафик) - 32 vCPU, 64 ГБ RAM, 500 ГБ NVMe SSD

GPU-дағы инференс:

  • Бастапқы (7B-13B модельдері, 24 ГБ VRAM-ы бар RTX 4090) - 8 vCPU, 32 ГБ RAM, 24 ГБ GPU, 500 ГБ NVMe
  • Продакшен (34B-70B модельдері, 80 ГБ VRAM-ы бар A100) - 16 vCPU, 128 ГБ RAM, 80 ГБ GPU, 1 ТБ NVMe
  • Бірнеше GPU (толық дәлдіктегі 70B және одан үлкен) - 2 немесе 4 A100 не H100 картасы, 256 ГБ және одан көп RAM, 2 ТБ және одан көп NVMe

Ұсынылатын DCXV конфигурациясы

DCXV бұлт серверлері AI инференс жүктемелеріне CPU-ға оңтайландырылған да, GPU конфигурацияларын да қолдайды:

  • 16 vCPU, 64 ГБ RAM, 500 ГБ NVMe - кванттталған 7B-13B модельдеріне CPU инференсі, ішкі құралдар
  • 24 ГБ VRAM-ы бар GPU сервері - 7B-13B модельдеріне нақты уақыттағы инференс, чат-бот API-лары
  • 80 ГБ VRAM-ы бар GPU сервері - 34B-70B модельдеріне продакшен инференсі

Барлық конфигурация Tier III бойынша сертификатталған ЕО дата-орталықтарында, қорғалған инференс нүктелеріне жеке желісі бар күйде жұмыс істейді. GPU бар-жоғы және бірнеше GPU конфигурацияларын талқылау үшін sales@dcxv.com адресіне жазыңыз.

Жылдам орнатуға арналған командалар

# Ubuntu 22.04-те CPU немесе GPU-да модельге қарапайым қызмет көрсету үшін Ollama орнату
curl -fsSL https://ollama.com/install.sh | sh

# Ollama қызметін іске қосу
sudo systemctl start ollama
sudo systemctl enable ollama

# Модельді жүктеп іске қосу (мысал үшін Llama 3.1 8B)
ollama pull llama3.1:8b

# Инференсті жергілікті тексеру
ollama run llama3.1:8b "Explain EU GDPR data residency in one paragraph"
# Ollama-ны жеке желіде API ретінде жариялау
# /etc/systemd/system/ollama.service файлын түзетіңіз - Environment жолын қосыңыз:
# Environment="OLLAMA_HOST=0.0.0.0:11434"

sudo systemctl daemon-reload
sudo systemctl restart ollama

# REST API-ды қосымша серверінен тексеру
curl http://10.0.0.5:11434/api/generate \
  -d '{"model": "llama3.1:8b", "prompt": "What is GDPR?", "stream": false}'
# Өткізу қабілеті жоғары продакшен қызметі үшін vLLM қолданыңыз (GPU керек)
pip install vllm

# Модельге OpenAI-мен үйлесімді API арқылы қызмет көрсету
python -m vllm.entrypoints.openai.api_server \
  --model meta-llama/Llama-3.1-8B-Instruct \
  --host 10.0.0.5 \
  --port 8000 \
  --max-model-len 4096 \
  --gpu-memory-utilization 0.85
# llama.cpp арқылы тек CPU-дағы инференс үшін
# Жинау тәуелділіктерін орнату
sudo apt install -y build-essential cmake

git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp && cmake -B build -DLLAMA_AVX512=ON && cmake --build build -j $(nproc)

# GGUF пішіміндегі модельді жүктеңіз (4 биттік кванттауы бар 8B мысалы)
# models/ каталогына қойып, содан кейін қызмет көрсетіңіз:
./build/bin/llama-server \
  --model models/llama-3.1-8b-instruct-q4_k_m.gguf \
  --host 10.0.0.5 \
  --port 8080 \
  --ctx-size 4096 \
  --threads $(nproc)

Күтілетін өнімділік көрсеткіштері

CPU инференсі (16 vCPU сервері, llama.cpp, INT4):

  • Q4_K_M-дегі Llama 3.1 8B - секундына 18-28 токен генерация
  • Эмбеддинг модельі (nomic-embed-text) - секундына 200-400 эмбеддинг
  • Бірінші токенге дейінгі кешігу (8B модель) - 800 мс-тен 2 с-қа дейін

GPU инференсі (RTX 4090 24 ГБ, vLLM):

  • FP16-дағы Llama 3.1 8B - сұранысқа секундына 80-120 токен
  • Llama 3.1 8B өткізу қабілеті (пакетті) - жиыны секундына 400-800 токен
  • Бірінші токенге дейінгі кешігу - 150-400 мс

GPU инференсі (A100 80 ГБ, vLLM):

  • FP16-дағы Llama 3.1 70B - сұранысқа секундына 25-45 токен
  • Mistral 7B өткізу қабілеті (пакетті) - жиыны секундына 1 200-2 000 токен

Бұл осы кластағы жабдыққа күтілетін шамалар, өз зертханамыздағы өлшемдер емес. Оларды есептеудің бастау нүктесі деп санап, өз жүктемеңізді өлшеңіз: нақты цифрлар провайдерден гөрі сіздің деректеріңізге, сұраныстарыңызға және баптауыңызға әлдеқайда күштірек байланысты.

Түйін

Еуропадағы AI инференсі - LLM немесе басқа AI модельдері арқылы дербес деректерді өңдейтін кез келген қосымшаға GDPR талабы. Жақсы жабдықталған DCXV серверіндегі CPU инференсі ішкі құралдар мен трафигі шағын API-лармен алысады. GPU инференсі - соңғы пайдаланушы жұмыс істейтін интерактивті қосымшаларға дұрыс таңдау. Екі нұсқа да инференс трафигін ЕО юрисдикциясындағы ЕО инфрақұрылымында ұстайды. Модель өлшеміңізге және мақсатты өткізу қабілетіне конфигурация жинау үшін sales@dcxv.com адресіне жазыңыз.

Жаңа бұлттық серверге SSH арқылы қалай қосылу керек
sshtutorialcloud

Жаңа бұлттық серверге SSH арқылы қалай қосылу керек

Сервер дайын, ал панельде IP, логин және құпиясөз бар. Міне, SSH арқылы алғашқы қосылу, ең жиі кездесетін төрт қате және алғашқы он минут.

Windows серверіне қашықтағы жұмыс үстелі арқылы қалай қосылу керек
rdpwindowstutorialcloud

Windows серверіне қашықтағы жұмыс үстелі арқылы қалай қосылу керек

Сізде мекенжай, пайдаланушы аты және құпиясөз бар. Оларды өз экраныңыздағы Windows жұмыс үстеліне қалай айналдыруға болады - ПК, Mac немесе телефоннан, қадам-қадаммен.

Еуропадағы Stable Diffusion үшін бұлт сервері: GPU баптау
cloudaigpu

Еуропадағы Stable Diffusion үшін бұлт сервері: GPU баптау

Stable Diffusion-ге қандай GPU жабдығы қажет, ең танымал екі интерфейсті қалай көтеру керек және ЕО ішінде сурет жасаудың қандай жылдамдығын күтуге болады.

Еуропада LLM хостингіне арналған бұлт сервері: AI және GDPR нұсқаулығы
cloudaigpu

Еуропада LLM хостингіне арналған бұлт сервері: AI және GDPR нұсқаулығы

LLM-ді продакшенде хостингілеуге қандай жабдық қажет, модель өлшемі мен кванттау деңгейін қалай таңдау керек және ЕО бұлтында қандай қызмет көрсету фреймворктары жақсы жұмыс істейді.

Claude Code, Codex және Grok CLI-ды өз бұлттық серверіңізде іске қосыңыз
cloudaivps

Claude Code, Codex және Grok CLI-ды өз бұлттық серверіңізде іске қосыңыз

Debian немесе Ubuntu бұлттық серверін Claude Code, Codex және Grok CLI сияқты жасанды зерде агенттеріне арналған құм жәшігіне айналдырыңыз. Кез келген жерден, тіпті телефоннан код жазыңыз.