Еуропада LLM хостингіне арналған бұлт сервері: AI және GDPR нұсқаулығы
Үлкен тілдік модельді өз бетінше хостингілеу модельге қандай деректер түсетінін, олар қайда өңделетінін және кімнің қол жеткізе алатынын толық бақылауға береді. Еуропалық бизнес үшін бұл шығын мәселесі ғана емес, сәйкестік талабы да. ЕО тұрғындарының дербес деректерін қамтитын кез келген сұраныс GDPR бойынша ЕО юрисдикциясында өңделуі керек.
Бұл нұсқаулық LLM-ді продакшенде хостингілеуге керек жабдықты, модель өлшемдері мен кванттау деңгейлерінің арасынан қалай таңдау керегін және ЕО бұлт инфрақұрылымында қандай қызмет көрсету фреймворктары жақсы жұмыс істейтінін баяндайды.
ЕО юрисдикциясы LLM хостингі үшін неге маңызды
Пайдаланушылар LLM-мен жұмыс істегенде - сұрақ қойғанда, құжатты қысқаша баяндауды сұрағанда, мәтін жасағанда - бұл сұраныстар жиі есімдерді, пошта адрестерін, денсаулық сұрақтарын және басқа дербес деректерді қамтиды. Мұндай сұраныстарды АҚШ-та орналасқан API-ға жіберу дербес деректердің әр жүгінуде ЕО юрисдикциясынан шығуын білдіреді, ал бұл сәйкестік бойынша тұрақты қауіп туғызады.
DCXV-нің ЕО бұлт серверінде өз бетінше хостингілеу бүкіл инференстің ЕО шекарасында қалатынын білдіреді. Трансатлантикалық деректер беруі жоқ, стандартты шарттық ережелерге сүйену жоқ және бөгде компанияның деректерді өңдеу тәжірибесіне тәуелділік жоқ. Еуропадағы медициналық, заңдық және қаржылық қосымшалар үшін ЕО ішіндегі жеке LLM инфрақұрылымы - GDPR-ға сәйкестікке апаратын практикалық жол.
Желі кешігуі де рөл ойнайды. Прагадағы немесе Франкфурттегі жеке LLM қосымшаңыздың инференс жолына 5-15 мс қосады. АҚШ-тағы API нүктесі арқылы сол модель шақыруға 80-120 мс қосады, ал бұл чат интерфейстерінде және нақты уақытта жұмыс істейтін көмекшілерде әсерді бүлдіруге жетеді.
Модель өлшемін және кванттауды таңдау
Келетін модель сценарийге және қолжетімді жабдыққа байланысты:
- 7B модельдері (Q4 кванттауы, шамамен 4 ГБ VRAM) - қысқаша баяндауға, сыныптауға, құжаттар бойынша сұрақ-жауапқа келеді. Бір тұтынушылық GPU-да немесе ядросы көп CPU серверінде жұмыс істейді.
- 13B модельдері (Q4 кванттауы, шамамен 8 ГБ VRAM) - жақсырақ пайымдайды, нұсқауларды дәлірек орындайды. Орташа деңгейлі GPU (RTX 3090 немесе 4090) немесе 2 кішірек GPU керек.
- 34B модельдері (Q4 кванттауы, шамамен 20 ГБ VRAM) - сапасы GPT-3.5-ке жуық. VRAM көлемі үлкен бір GPU (A100 40 ГБ) немесе 24 ГБ-тық екі GPU керек.
- 70B модельдері (Q4 кванттауы, шамамен 40 ГБ VRAM) - көп тапсырмада GPT-4 класы. A100 80 ГБ немесе тензорлық параллельдікте екі A100 40 ГБ керек.
Кванттау (GGUF немесе GPTQ арқылы INT4 не INT8) VRAM талабын 2-4 есе төмендетеді, сапа шығыны шамалы - продакшен сценарийлерінің көпшілігі үшін қолайлы.
LLM хостингі үшін серверге қойылатын ең аз талаптар
- CPU-да қызмет көрсету (7B Q4 модель) - 16 vCPU, 32 ГБ RAM, 200 ГБ NVMe SSD
- Бастапқы GPU (7B-13B, бір RTX 4090) - 8 vCPU, 32 ГБ RAM, 24 ГБ VRAM, 500 ГБ NVMe
- Орташа GPU (34B Q4, бір A100 40 ГБ) - 16 vCPU, 64 ГБ RAM, 40 ГБ VRAM, 1 ТБ NVMe
- Жоғары GPU (70B Q4, A100 80 ГБ) - 16 vCPU, 128 ГБ RAM, 80 ГБ VRAM, 2 ТБ NVMe
Ұсынылатын DCXV конфигурациясы
DCXV бұлт серверлері LLM хостингіне Tier III бойынша сертификатталған инфрақұрылымда, жеке желісі бар GPU-лы ЕО серверлерін береді:
- GPU сервері, 24 ГБ VRAM - FP16-дағы 7B-13B модельдері немесе INT4-тегі 34B модельдері, SaaS көмекшілері мен ішкі ассистенттерге
- GPU сервері, 80 ГБ VRAM - INT4-тегі 70B модельдері немесе FP16-дағы 34B, сапасы жоғары продакшен API-ларына
- CPU сервері, 32-64 ГБ RAM - llama.cpp арқылы INT4-тегі 7B модельдері, фондық өңдеуге және пакеттік тапсырмаларға
GPU бар-жоғы туралы және ірірек модельдерге бірнеше GPU-да тензорлық параллельдікті талқылау үшін sales@dcxv.com адресіне жазыңыз.
Жылдам орнатуға арналған командалар
# 1-нұсқа: Ollama арқылы қызмет көрсету (ең қарапайымы, CPU және GPU)
curl -fsSL https://ollama.com/install.sh | sh
sudo systemctl enable --now ollama
# Модельді жүктеп, API ретінде жариялау
ollama pull llama3.1:8b
# Жеке желіде жариялау:
# /etc/systemd/system/ollama.service файлына қосыңыз:
# Environment="OLLAMA_HOST=0.0.0.0:11434"
sudo systemctl daemon-reload && sudo systemctl restart ollama
# Тексеру
curl http://10.0.0.5:11434/api/chat -d '{
"model": "llama3.1:8b",
"messages": [{"role": "user", "content": "Summarize GDPR in 3 bullet points"}]
}'
# 2-нұсқа: өткізу қабілеті жоғары GPU қызметіне vLLM (OpenAI-мен үйлесімді API)
pip install vllm
python -m vllm.entrypoints.openai.api_server \
--model meta-llama/Llama-3.1-8B-Instruct \
--host 10.0.0.5 \
--port 8000 \
--tensor-parallel-size 1 \
--max-model-len 8192 \
--gpu-memory-utilization 0.90 \
--served-model-name llama3-8b
# OpenAI-мен үйлесімді клиентпен тексеру
curl http://10.0.0.5:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model": "llama3-8b", "messages": [{"role": "user", "content": "Hello"}]}'
# 3-нұсқа: CPU немесе GPU-ға llama.cpp сервері (жад шығыны ең аз)
sudo apt install -y build-essential cmake libcurl4-openssl-dev
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
# GPU қолдауымен жинау (CUDA)
cmake -B build -DGGML_CUDA=ON
# Немесе AVX-512-мен тек CPU:
cmake -B build -DLLAMA_AVX512=ON
cmake --build build --config Release -j $(nproc)
# GGUF пішіміндегі модельге қызмет көрсету
./build/bin/llama-server \
--model /models/llama-3.1-8b-instruct-q4_k_m.gguf \
--host 10.0.0.5 \
--port 8080 \
--ctx-size 8192 \
--n-gpu-layers 35 \
--parallel 4
Қандай қызмет көрсету ортасын таңдау керек
Жоғарыдағы командалар бір салмақтарға қызмет көрсетудің екі жолын көрсетеді, ал таңдау сапа туралы емес: олардың бәрі бір модельді жібереді. Ол екінші сұраныс бірінші бітпей келгенде не болатыны туралы:
| Орта | Қатарлас сұраныстар | Қайда жақсы жұмыс істейді | Қашан таңдау керек |
|---|---|---|---|
| Ollama | Кезекте, бір-бірден | CPU немесе бір GPU | Ішкі құралдар, бір мезгілде бір пайдаланушы, бәрінен тез көтеріледі |
| llama.cpp | Кезекте, шағын партиямен | CPU, GGUF салмақтары | GPU мүлдем жоқ немесе түнгі пакеттік жұмыс |
| vLLM | Үздіксіз пакеттеу | Тек GPU | Көп пайдаланушы бір GPU-ды бөліседі және өткізу қабілеті маңызды |
| TGI | Үздіксіз пакеттеу | Тек GPU | Сіз Hugging Face стегінде әлдеқашан жұмыс істеп жүрсіз |
Айырма көрінгеннен үлкен. Бір мезгілде бір сұранысқа қызмет көрсететін GPU өмірінің көп бөлігін жадты күтуге жібереді, сондықтан пакеттейтін орта модельге еш өзгеріс енгізбей сол картада бірнеше есе көп пайдаланушыға қызмет көрсете алады. Сондықтан төмендегі CPU және GPU цифрлары басқа масштабтағы бір өлшем емес, жұмыстың әртүрлі пішіні.
Күтілетін өнімділік көрсеткіштері
RTX 4090-дағы (24 ГБ VRAM) vLLM, Llama 3.1 8B FP16:
- Бір сұранысқа генерация - секундына 80-120 токен
- Пакеттік өткізу қабілеті (8 қатарлас сұраныс) - жиыны секундына 400-700 токен
- Бірінші токенге дейінгі уақыт - 150-300 мс
A100 80 ГБ-тағы vLLM, Llama 3.1 70B INT4:
- Бір сұранысқа генерация - секундына 25-40 токен
- Пакеттік өткізу қабілеті (4 қатарлас) - жиыны секундына 100-180 токен
- Бірінші токенге дейінгі уақыт - 300-600 мс
CPU-дағы llama.cpp (16 vCPU), 8B Q4_K_M:
- Генерация жылдамдығы - секундына 18-30 токен
- Бірінші токенге дейінгі уақыт - 800 мс-тен 2 с-қа дейін
Бұл осы кластағы жабдыққа күтілетін шамалар, өз зертханамыздағы өлшемдер емес. Оларды есептеудің бастау нүктесі деп санап, өз жүктемеңізді өлшеңіз: нақты цифрлар провайдерден гөрі сіздің деректеріңізге, сұраныстарыңызға және баптауыңызға әлдеқайда күштірек байланысты.
Түйін
LLM-ді ЕО бұлт инфрақұрылымында өз бетінше хостингілеу - продакшенде GDPR-ға сай AI-ға апаратын ең сенімді жол. Модель өлшемін сапа талабы мен бюджет бойынша таңдаңыз, VRAM қажеттілігін азайту үшін кванттауды қолданыңыз және GPU-да продакшен қызметіне vLLM, CPU-дағы икемділікке llama.cpp алыңыз. DCXV LLM-ді талапқа сай масштабта жіберуге керек GPU серверлерін және деректерді ЕО ішінде сақтауды береді.
