Еуропадағы AI инференсіне арналған бұлт сервері: GPU және CPU нұсқаулығы
AI инференсі - үйретілген модельді болжам немесе жалғасын алу үшін жіберу - 2026 жылдағы ең жылдам өсіп келе жатқан сервер жүктемелерінің бірі. Еуропада жұмыс істейтін компаниялар үшін инфрақұрылым таңдауы жабдық сипаттамасымен шектелмейді: GDPR дербес деректері бар инференс сұраныстары ЕО юрисдикциясындағы инфрақұрылымда өңделуін талап етеді.
Бұл нұсқаулық GPU және CPU инференсінің арасынан қалай таңдау керегін, әр тәсілге қандай жабдық қажет екенін және GDPR сақталған ЕО бұлт серверінде AI модельдеріне продакшенде қалай қызмет көрсету керегін баяндайды.
Деректердің ЕО ішінде сақталуы AI инференсі үшін неге маңызды
AI модельіне жіберілген кез келген сұраныс GDPR бойынша ықтимал дербес деректер: онда пайдаланушы есімдері, хат мазмұны, медициналық сұрақтар немесе қаржы мәліметі болуы мүмкін. Егер инференс АҚШ-та орналасқан API арқылы жүрсе, бұл деректер ЕО юрисдикциясынан шығады. DCXV-нің ЕО бұлт серверіндегі инференс барлық сұраныс пен жауапты ЕО шекарасында ұстайды және сақталу орны талаптарын стандартты шарттық ережелерге сүйенбей орындайды.
Талапқа сәйкестіктен басқа, ЕО ішіндегі инференс трансатлантикалық айналым уақытын алып тастайды. Прагадан немесе Франкфурттен берілетін модель АҚШ нүктесіндегі сол модельден сұранысқа 80-120 мс жылдам жауап береді, ал чат-боттар мен көмекшілер сияқты интерактивті қосымшалар үшін бұл байқалатын айырма.
GPU немесе CPU инференсі: қашан қайсысын пайдалану керек
Келетін есептеу модель өлшеміне және өткізу қабілеті талабына байланысты:
- CPU инференсі шағын модельдерге (INT8 немесе INT4-тегі 7B параметрден аз), эмбеддинг модельдеріне және өткізу қабілеті жоғары емес сценарийлерге (секундына 20 сұраныстан аз) жақсы келеді. AVX-512-і бар қазіргі CPU-лар 7B модельдерін секундына 15-30 токенмен ұстайды, бұл фондық өңдеуге немесе ішкі құралдарға жетеді.
- GPU инференсі ірі модельдерге (13B параметр және одан көп), нақты уақыттағы интерактивті сценарийлерге және секундына 50 токен және одан жоғары керек пакеттік жүктемелерге қажет. Бір RTX 4090 немесе A100 сол модель үшін CPU инференсінен 10-20 есе үлкен токен өткізу қабілетін береді.
AI инференсі үшін серверге қойылатын ең аз талаптар
Тек CPU-дағы инференс:
- Шағын (эмбеддинг модельдері, сыныптауыштар) - 8 vCPU, 16 ГБ RAM, 100 ГБ NVMe SSD
- Орташа (7B модель, ішкі API) - 16 vCPU, 32 ГБ RAM, 200 ГБ NVMe SSD
- Ірі (INT4-тегі 13B модель, орташа трафик) - 32 vCPU, 64 ГБ RAM, 500 ГБ NVMe SSD
GPU-дағы инференс:
- Бастапқы (7B-13B модельдері, 24 ГБ VRAM-ы бар RTX 4090) - 8 vCPU, 32 ГБ RAM, 24 ГБ GPU, 500 ГБ NVMe
- Продакшен (34B-70B модельдері, 80 ГБ VRAM-ы бар A100) - 16 vCPU, 128 ГБ RAM, 80 ГБ GPU, 1 ТБ NVMe
- Бірнеше GPU (толық дәлдіктегі 70B және одан үлкен) - 2 немесе 4 A100 не H100 картасы, 256 ГБ және одан көп RAM, 2 ТБ және одан көп NVMe
Ұсынылатын DCXV конфигурациясы
DCXV бұлт серверлері AI инференс жүктемелеріне CPU-ға оңтайландырылған да, GPU конфигурацияларын да қолдайды:
- 16 vCPU, 64 ГБ RAM, 500 ГБ NVMe - кванттталған 7B-13B модельдеріне CPU инференсі, ішкі құралдар
- 24 ГБ VRAM-ы бар GPU сервері - 7B-13B модельдеріне нақты уақыттағы инференс, чат-бот API-лары
- 80 ГБ VRAM-ы бар GPU сервері - 34B-70B модельдеріне продакшен инференсі
Барлық конфигурация Tier III бойынша сертификатталған ЕО дата-орталықтарында, қорғалған инференс нүктелеріне жеке желісі бар күйде жұмыс істейді. GPU бар-жоғы және бірнеше GPU конфигурацияларын талқылау үшін sales@dcxv.com адресіне жазыңыз.
Жылдам орнатуға арналған командалар
# Ubuntu 22.04-те CPU немесе GPU-да модельге қарапайым қызмет көрсету үшін Ollama орнату
curl -fsSL https://ollama.com/install.sh | sh
# Ollama қызметін іске қосу
sudo systemctl start ollama
sudo systemctl enable ollama
# Модельді жүктеп іске қосу (мысал үшін Llama 3.1 8B)
ollama pull llama3.1:8b
# Инференсті жергілікті тексеру
ollama run llama3.1:8b "Explain EU GDPR data residency in one paragraph"
# Ollama-ны жеке желіде API ретінде жариялау
# /etc/systemd/system/ollama.service файлын түзетіңіз - Environment жолын қосыңыз:
# Environment="OLLAMA_HOST=0.0.0.0:11434"
sudo systemctl daemon-reload
sudo systemctl restart ollama
# REST API-ды қосымша серверінен тексеру
curl http://10.0.0.5:11434/api/generate \
-d '{"model": "llama3.1:8b", "prompt": "What is GDPR?", "stream": false}'
# Өткізу қабілеті жоғары продакшен қызметі үшін vLLM қолданыңыз (GPU керек)
pip install vllm
# Модельге OpenAI-мен үйлесімді API арқылы қызмет көрсету
python -m vllm.entrypoints.openai.api_server \
--model meta-llama/Llama-3.1-8B-Instruct \
--host 10.0.0.5 \
--port 8000 \
--max-model-len 4096 \
--gpu-memory-utilization 0.85
# llama.cpp арқылы тек CPU-дағы инференс үшін
# Жинау тәуелділіктерін орнату
sudo apt install -y build-essential cmake
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp && cmake -B build -DLLAMA_AVX512=ON && cmake --build build -j $(nproc)
# GGUF пішіміндегі модельді жүктеңіз (4 биттік кванттауы бар 8B мысалы)
# models/ каталогына қойып, содан кейін қызмет көрсетіңіз:
./build/bin/llama-server \
--model models/llama-3.1-8b-instruct-q4_k_m.gguf \
--host 10.0.0.5 \
--port 8080 \
--ctx-size 4096 \
--threads $(nproc)
Күтілетін өнімділік көрсеткіштері
CPU инференсі (16 vCPU сервері, llama.cpp, INT4):
- Q4_K_M-дегі Llama 3.1 8B - секундына 18-28 токен генерация
- Эмбеддинг модельі (nomic-embed-text) - секундына 200-400 эмбеддинг
- Бірінші токенге дейінгі кешігу (8B модель) - 800 мс-тен 2 с-қа дейін
GPU инференсі (RTX 4090 24 ГБ, vLLM):
- FP16-дағы Llama 3.1 8B - сұранысқа секундына 80-120 токен
- Llama 3.1 8B өткізу қабілеті (пакетті) - жиыны секундына 400-800 токен
- Бірінші токенге дейінгі кешігу - 150-400 мс
GPU инференсі (A100 80 ГБ, vLLM):
- FP16-дағы Llama 3.1 70B - сұранысқа секундына 25-45 токен
- Mistral 7B өткізу қабілеті (пакетті) - жиыны секундына 1 200-2 000 токен
Бұл осы кластағы жабдыққа күтілетін шамалар, өз зертханамыздағы өлшемдер емес. Оларды есептеудің бастау нүктесі деп санап, өз жүктемеңізді өлшеңіз: нақты цифрлар провайдерден гөрі сіздің деректеріңізге, сұраныстарыңызға және баптауыңызға әлдеқайда күштірек байланысты.
Түйін
Еуропадағы AI инференсі - LLM немесе басқа AI модельдері арқылы дербес деректерді өңдейтін кез келген қосымшаға GDPR талабы. Жақсы жабдықталған DCXV серверіндегі CPU инференсі ішкі құралдар мен трафигі шағын API-лармен алысады. GPU инференсі - соңғы пайдаланушы жұмыс істейтін интерактивті қосымшаларға дұрыс таңдау. Екі нұсқа да инференс трафигін ЕО юрисдикциясындағы ЕО инфрақұрылымында ұстайды. Модель өлшеміңізге және мақсатты өткізу қабілетіне конфигурация жинау үшін sales@dcxv.com адресіне жазыңыз.
