Еуропада LLM хостингіне арналған бұлт сервері: AI және GDPR нұсқаулығы

Еуропада LLM хостингіне арналған бұлт сервері: AI және GDPR нұсқаулығы

Еуропада LLM хостингіне арналған бұлт сервері: AI және GDPR нұсқаулығы

Үлкен тілдік модельді өз бетінше хостингілеу модельге қандай деректер түсетінін, олар қайда өңделетінін және кімнің қол жеткізе алатынын толық бақылауға береді. Еуропалық бизнес үшін бұл шығын мәселесі ғана емес, сәйкестік талабы да. ЕО тұрғындарының дербес деректерін қамтитын кез келген сұраныс GDPR бойынша ЕО юрисдикциясында өңделуі керек.

Бұл нұсқаулық LLM-ді продакшенде хостингілеуге керек жабдықты, модель өлшемдері мен кванттау деңгейлерінің арасынан қалай таңдау керегін және ЕО бұлт инфрақұрылымында қандай қызмет көрсету фреймворктары жақсы жұмыс істейтінін баяндайды.

ЕО юрисдикциясы LLM хостингі үшін неге маңызды

Пайдаланушылар LLM-мен жұмыс істегенде - сұрақ қойғанда, құжатты қысқаша баяндауды сұрағанда, мәтін жасағанда - бұл сұраныстар жиі есімдерді, пошта адрестерін, денсаулық сұрақтарын және басқа дербес деректерді қамтиды. Мұндай сұраныстарды АҚШ-та орналасқан API-ға жіберу дербес деректердің әр жүгінуде ЕО юрисдикциясынан шығуын білдіреді, ал бұл сәйкестік бойынша тұрақты қауіп туғызады.

DCXV-нің ЕО бұлт серверінде өз бетінше хостингілеу бүкіл инференстің ЕО шекарасында қалатынын білдіреді. Трансатлантикалық деректер беруі жоқ, стандартты шарттық ережелерге сүйену жоқ және бөгде компанияның деректерді өңдеу тәжірибесіне тәуелділік жоқ. Еуропадағы медициналық, заңдық және қаржылық қосымшалар үшін ЕО ішіндегі жеке LLM инфрақұрылымы - GDPR-ға сәйкестікке апаратын практикалық жол.

Желі кешігуі де рөл ойнайды. Прагадағы немесе Франкфурттегі жеке LLM қосымшаңыздың инференс жолына 5-15 мс қосады. АҚШ-тағы API нүктесі арқылы сол модель шақыруға 80-120 мс қосады, ал бұл чат интерфейстерінде және нақты уақытта жұмыс істейтін көмекшілерде әсерді бүлдіруге жетеді.

Модель өлшемін және кванттауды таңдау

Келетін модель сценарийге және қолжетімді жабдыққа байланысты:

  • 7B модельдері (Q4 кванттауы, шамамен 4 ГБ VRAM) - қысқаша баяндауға, сыныптауға, құжаттар бойынша сұрақ-жауапқа келеді. Бір тұтынушылық GPU-да немесе ядросы көп CPU серверінде жұмыс істейді.
  • 13B модельдері (Q4 кванттауы, шамамен 8 ГБ VRAM) - жақсырақ пайымдайды, нұсқауларды дәлірек орындайды. Орташа деңгейлі GPU (RTX 3090 немесе 4090) немесе 2 кішірек GPU керек.
  • 34B модельдері (Q4 кванттауы, шамамен 20 ГБ VRAM) - сапасы GPT-3.5-ке жуық. VRAM көлемі үлкен бір GPU (A100 40 ГБ) немесе 24 ГБ-тық екі GPU керек.
  • 70B модельдері (Q4 кванттауы, шамамен 40 ГБ VRAM) - көп тапсырмада GPT-4 класы. A100 80 ГБ немесе тензорлық параллельдікте екі A100 40 ГБ керек.

Кванттау (GGUF немесе GPTQ арқылы INT4 не INT8) VRAM талабын 2-4 есе төмендетеді, сапа шығыны шамалы - продакшен сценарийлерінің көпшілігі үшін қолайлы.

LLM хостингі үшін серверге қойылатын ең аз талаптар

  • CPU-да қызмет көрсету (7B Q4 модель) - 16 vCPU, 32 ГБ RAM, 200 ГБ NVMe SSD
  • Бастапқы GPU (7B-13B, бір RTX 4090) - 8 vCPU, 32 ГБ RAM, 24 ГБ VRAM, 500 ГБ NVMe
  • Орташа GPU (34B Q4, бір A100 40 ГБ) - 16 vCPU, 64 ГБ RAM, 40 ГБ VRAM, 1 ТБ NVMe
  • Жоғары GPU (70B Q4, A100 80 ГБ) - 16 vCPU, 128 ГБ RAM, 80 ГБ VRAM, 2 ТБ NVMe

Ұсынылатын DCXV конфигурациясы

DCXV бұлт серверлері LLM хостингіне Tier III бойынша сертификатталған инфрақұрылымда, жеке желісі бар GPU-лы ЕО серверлерін береді:

  • GPU сервері, 24 ГБ VRAM - FP16-дағы 7B-13B модельдері немесе INT4-тегі 34B модельдері, SaaS көмекшілері мен ішкі ассистенттерге
  • GPU сервері, 80 ГБ VRAM - INT4-тегі 70B модельдері немесе FP16-дағы 34B, сапасы жоғары продакшен API-ларына
  • CPU сервері, 32-64 ГБ RAM - llama.cpp арқылы INT4-тегі 7B модельдері, фондық өңдеуге және пакеттік тапсырмаларға

GPU бар-жоғы туралы және ірірек модельдерге бірнеше GPU-да тензорлық параллельдікті талқылау үшін sales@dcxv.com адресіне жазыңыз.

Жылдам орнатуға арналған командалар

# 1-нұсқа: Ollama арқылы қызмет көрсету (ең қарапайымы, CPU және GPU)
curl -fsSL https://ollama.com/install.sh | sh
sudo systemctl enable --now ollama

# Модельді жүктеп, API ретінде жариялау
ollama pull llama3.1:8b
# Жеке желіде жариялау:
# /etc/systemd/system/ollama.service файлына қосыңыз:
# Environment="OLLAMA_HOST=0.0.0.0:11434"
sudo systemctl daemon-reload && sudo systemctl restart ollama

# Тексеру
curl http://10.0.0.5:11434/api/chat -d '{
  "model": "llama3.1:8b",
  "messages": [{"role": "user", "content": "Summarize GDPR in 3 bullet points"}]
}'
# 2-нұсқа: өткізу қабілеті жоғары GPU қызметіне vLLM (OpenAI-мен үйлесімді API)
pip install vllm

python -m vllm.entrypoints.openai.api_server \
  --model meta-llama/Llama-3.1-8B-Instruct \
  --host 10.0.0.5 \
  --port 8000 \
  --tensor-parallel-size 1 \
  --max-model-len 8192 \
  --gpu-memory-utilization 0.90 \
  --served-model-name llama3-8b

# OpenAI-мен үйлесімді клиентпен тексеру
curl http://10.0.0.5:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model": "llama3-8b", "messages": [{"role": "user", "content": "Hello"}]}'
# 3-нұсқа: CPU немесе GPU-ға llama.cpp сервері (жад шығыны ең аз)
sudo apt install -y build-essential cmake libcurl4-openssl-dev
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp

# GPU қолдауымен жинау (CUDA)
cmake -B build -DGGML_CUDA=ON
# Немесе AVX-512-мен тек CPU:
cmake -B build -DLLAMA_AVX512=ON

cmake --build build --config Release -j $(nproc)

# GGUF пішіміндегі модельге қызмет көрсету
./build/bin/llama-server \
  --model /models/llama-3.1-8b-instruct-q4_k_m.gguf \
  --host 10.0.0.5 \
  --port 8080 \
  --ctx-size 8192 \
  --n-gpu-layers 35 \
  --parallel 4

Қандай қызмет көрсету ортасын таңдау керек

Жоғарыдағы командалар бір салмақтарға қызмет көрсетудің екі жолын көрсетеді, ал таңдау сапа туралы емес: олардың бәрі бір модельді жібереді. Ол екінші сұраныс бірінші бітпей келгенде не болатыны туралы:

Орта Қатарлас сұраныстар Қайда жақсы жұмыс істейді Қашан таңдау керек
Ollama Кезекте, бір-бірден CPU немесе бір GPU Ішкі құралдар, бір мезгілде бір пайдаланушы, бәрінен тез көтеріледі
llama.cpp Кезекте, шағын партиямен CPU, GGUF салмақтары GPU мүлдем жоқ немесе түнгі пакеттік жұмыс
vLLM Үздіксіз пакеттеу Тек GPU Көп пайдаланушы бір GPU-ды бөліседі және өткізу қабілеті маңызды
TGI Үздіксіз пакеттеу Тек GPU Сіз Hugging Face стегінде әлдеқашан жұмыс істеп жүрсіз

Айырма көрінгеннен үлкен. Бір мезгілде бір сұранысқа қызмет көрсететін GPU өмірінің көп бөлігін жадты күтуге жібереді, сондықтан пакеттейтін орта модельге еш өзгеріс енгізбей сол картада бірнеше есе көп пайдаланушыға қызмет көрсете алады. Сондықтан төмендегі CPU және GPU цифрлары басқа масштабтағы бір өлшем емес, жұмыстың әртүрлі пішіні.

Күтілетін өнімділік көрсеткіштері

RTX 4090-дағы (24 ГБ VRAM) vLLM, Llama 3.1 8B FP16:

  • Бір сұранысқа генерация - секундына 80-120 токен
  • Пакеттік өткізу қабілеті (8 қатарлас сұраныс) - жиыны секундына 400-700 токен
  • Бірінші токенге дейінгі уақыт - 150-300 мс

A100 80 ГБ-тағы vLLM, Llama 3.1 70B INT4:

  • Бір сұранысқа генерация - секундына 25-40 токен
  • Пакеттік өткізу қабілеті (4 қатарлас) - жиыны секундына 100-180 токен
  • Бірінші токенге дейінгі уақыт - 300-600 мс

CPU-дағы llama.cpp (16 vCPU), 8B Q4_K_M:

  • Генерация жылдамдығы - секундына 18-30 токен
  • Бірінші токенге дейінгі уақыт - 800 мс-тен 2 с-қа дейін

Бұл осы кластағы жабдыққа күтілетін шамалар, өз зертханамыздағы өлшемдер емес. Оларды есептеудің бастау нүктесі деп санап, өз жүктемеңізді өлшеңіз: нақты цифрлар провайдерден гөрі сіздің деректеріңізге, сұраныстарыңызға және баптауыңызға әлдеқайда күштірек байланысты.

Түйін

LLM-ді ЕО бұлт инфрақұрылымында өз бетінше хостингілеу - продакшенде GDPR-ға сай AI-ға апаратын ең сенімді жол. Модель өлшемін сапа талабы мен бюджет бойынша таңдаңыз, VRAM қажеттілігін азайту үшін кванттауды қолданыңыз және GPU-да продакшен қызметіне vLLM, CPU-дағы икемділікке llama.cpp алыңыз. DCXV LLM-ді талапқа сай масштабта жіберуге керек GPU серверлерін және деректерді ЕО ішінде сақтауды береді.

Жаңа бұлттық серверге SSH арқылы қалай қосылу керек
sshtutorialcloud

Жаңа бұлттық серверге SSH арқылы қалай қосылу керек

Сервер дайын, ал панельде IP, логин және құпиясөз бар. Міне, SSH арқылы алғашқы қосылу, ең жиі кездесетін төрт қате және алғашқы он минут.

Windows серверіне қашықтағы жұмыс үстелі арқылы қалай қосылу керек
rdpwindowstutorialcloud

Windows серверіне қашықтағы жұмыс үстелі арқылы қалай қосылу керек

Сізде мекенжай, пайдаланушы аты және құпиясөз бар. Оларды өз экраныңыздағы Windows жұмыс үстеліне қалай айналдыруға болады - ПК, Mac немесе телефоннан, қадам-қадаммен.

Еуропадағы Stable Diffusion үшін бұлт сервері: GPU баптау
cloudaigpu

Еуропадағы Stable Diffusion үшін бұлт сервері: GPU баптау

Stable Diffusion-ге қандай GPU жабдығы қажет, ең танымал екі интерфейсті қалай көтеру керек және ЕО ішінде сурет жасаудың қандай жылдамдығын күтуге болады.

Еуропада LLM хостингіне арналған бұлт сервері: AI және GDPR нұсқаулығы
cloudaigpu

Еуропада LLM хостингіне арналған бұлт сервері: AI және GDPR нұсқаулығы

LLM-ді продакшенде хостингілеуге қандай жабдық қажет, модель өлшемі мен кванттау деңгейін қалай таңдау керек және ЕО бұлтында қандай қызмет көрсету фреймворктары жақсы жұмыс істейді.

Claude Code, Codex және Grok CLI-ды өз бұлттық серверіңізде іске қосыңыз
cloudaivps

Claude Code, Codex және Grok CLI-ды өз бұлттық серверіңізде іске қосыңыз

Debian немесе Ubuntu бұлттық серверін Claude Code, Codex және Grok CLI сияқты жасанды зерде агенттеріне арналған құм жәшігіне айналдырыңыз. Кез келген жерден, тіпті телефоннан код жазыңыз.