Еуропадағы Ollama үшін бұлт сервері: ЕО ішінде жеке AI нұсқаулығы

Еуропадағы Ollama үшін бұлт сервері: ЕО ішінде жеке AI нұсқаулығы

Еуропадағы Ollama үшін бұлт сервері: ЕО ішінде жеке AI нұсқаулығы

Ollama - жергілікті LLM көтерудің ең жылдам жолы: бір команда орындау ортасын орнатады, модельді жүктейді және OpenAI-мен үйлесімді API жариялайды. Еуропалық командалар үшін Ollama-ны ЕО бұлт серверінде іске қосу бүкіл AI инференсінің ЕО юрисдикциясында қалуын және GDPR талаптарының орындалуын білдіреді, ал әзірлеушілер басқарылатын сервистің қарапайымдылығын алады.

Бұл нұсқаулық DCXV-нің ЕО бұлт серверінде Ollama-ны қалай орналастыру керегін, әртүрлі жүктемеге қандай модель пайдалану керегін және қандай өнімділік күту керегін баяндайды.

Ollama-ны ЕО бұлт серверінде неге іске қосу керек

Ollama-ны әзірлеушілердің ноутбуктерінде жергілікті іске қосу сынауға жарайды, бірақ продакшендегі AI мүмкіндіктеріне сервер керек: тұрақты қолжетімділік, GPU-мен жеделдету, бірнеше сервиске ортақ қатынас және қосымшаларыңыз сенімді жүгіне алатын тұрақты API нүктелері.

Нақ ЕО хостингі маңызды, себебі Ollama қосымшаларыңызға инференс нүктесі болып тұрады. Пайдаланушыларыңыздың әр сұранысы осы сервер арқылы өтеді. GDPR бойынша, егер мұндай сұраныстар дербес деректерді қамтыса - ал нақты қосымшалардың көпшілігінде қамтиды - инференс ЕО юрисдикциясындағы инфрақұрылымда болуы керек. Ollama орнатылған DCXV-нің ЕО бұлт сервері сізге деректерді АҚШ инфрақұрылымына ешқашан бағыттамайтын, талапқа сай жеке AI нүктесін береді.

Тапсырмаңызға келетін модельді таңдау

Ollama жүздеген модельді қолдайды. ЕО ішіндегі продакшен орналастырулары үшін:

  • llama3.1:8b - чатқа, қысқаша баяндауға, сұрақ-жауапқа ең жақсы әмбебап нұсқа. CPU-да да, GPU-да да жұмыс істейді. Q4-те 4-5 ГБ VRAM.
  • llama3.1:70b - сапасы GPT-4-ке жуық. 40 ГБ және одан көп VRAM керек. A100 немесе H100 серверлерінде қолданыңыз.
  • mistral:7b - жылдам, ұқыпты, құрылымдалған шығысқа және функция шақыруға тамаша келеді.
  • nomic-embed-text - RAG құбырларына эмбеддинг модельі. CPU-ға қолайлы, 274 МБ.
  • codellama:13b - код жасау және талдау. 16 ГБ бір GPU-да жақсы жүреді.
  • phi3:mini - Microsoft-тың 3,8B модельі. CPU-да өте жылдам, сыныптауға пайдалы.

Ollama үшін серверге қойылатын ең аз талаптар

  • Тек CPU (шағын модельдер, 7B Q4) - 8 vCPU, 16 ГБ RAM, 100 ГБ NVMe SSD
  • CPU-дағы продакшен (қатарлас сұраныстар, 7B Q4) - 16 vCPU, 32 ГБ RAM, 200 ГБ NVMe SSD
  • Бастапқы GPU (FP16-дағы 7B-13B) - 4 vCPU, 16 ГБ RAM, 16-24 ГБ VRAM, 200 ГБ NVMe
  • GPU-дағы продакшен (34B және одан үлкен модельдер) - 8 vCPU, 64 ГБ RAM, 40-80 ГБ VRAM, 500 ГБ NVMe

Ұсынылатын DCXV конфигурациясы

DCXV бұлт серверлері жеке желісі бар Tier III деңгейіндегі ЕО инфрақұрылымында жұмыс істейді. Продакшендегі Ollama үшін:

  • CPU сервері, 16 vCPU / 32 ГБ RAM - 7B модельдерін секундына 18-28 токенмен береді, ішкі құралдарға және пакеттік тапсырмаларға келеді
  • GPU сервері, 16-24 ГБ VRAM - 7B-13B модельдерін секундына 80-120 токенмен береді, пайдаланушы көретін мүмкіндіктерге келеді
  • GPU сервері, 80 ГБ VRAM - 70B модельдерін секундына 25-40 токенмен береді, продакшен API-ларына GPT-4 класы

ЕО дата-орталықтарында Ollama-ға дайын GPU немесе CPU даналарын жинау үшін sales@dcxv.com адресіне жазыңыз.

Жылдам орнатуға арналған командалар

# Ubuntu 22.04-ке Ollama орнату
curl -fsSL https://ollama.com/install.sh | sh

# Орнатуды тексеру
ollama --version

# Ollama қызметін іске қосу (орнатқаннан кейін өзі іске қосылады)
sudo systemctl status ollama
# Керек модельдерді жүктеу
ollama pull llama3.1:8b          # 4,7 ГБ - жалпы мақсаттағы
ollama pull mistral:7b           # 4,1 ГБ - жылдам, құрылымдалған шығыс
ollama pull nomic-embed-text     # 274 МБ - RAG-қа эмбеддингтер
ollama pull codellama:13b        # 7,4 ГБ - кодпен жұмыс

# Жүктелген модельдердің тізімі
ollama list

# Жылдам тексеру
ollama run llama3.1:8b "In one sentence, what is GDPR?"
# Ollama-ны жеке желіде жұмыс істеуге баптау
# /etc/systemd/system/ollama.service файлын түзетіңіз
# [Service] астына қосыңыз:
# Environment="OLLAMA_HOST=0.0.0.0:11434"
# Environment="OLLAMA_NUM_PARALLEL=4"       # қатарлас сұраныстар
# Environment="OLLAMA_MAX_LOADED_MODELS=2"  # жадта ұсталатын модельдер

sudo systemctl daemon-reload
sudo systemctl restart ollama

# API қосымша серверінен қолжетімді екенін тексеру
curl http://10.0.0.5:11434/api/tags
# Қосымшаңыздан OpenAI-мен үйлесімді API-ды пайдалану
# Қолжетімді модельдердің тізімі
curl http://10.0.0.5:11434/v1/models

# Чаттағы жауап (OpenAI SDK-нің орнына тікелей қойылады)
curl http://10.0.0.5:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "llama3.1:8b",
    "messages": [
      {"role": "system", "content": "You are a helpful assistant."},
      {"role": "user", "content": "Summarize GDPR Article 5 in 3 bullet points."}
    ]
  }'

# RAG-қа эмбеддингтер
curl http://10.0.0.5:11434/v1/embeddings \
  -H "Content-Type: application/json" \
  -d '{"model": "nomic-embed-text", "input": "EU data residency requirements"}'
# Қосымша: Ollama-ны кері проксимен жабу (nginx)
sudo apt install -y nginx

cat > /etc/nginx/sites-available/ollama << 'EOF'
server {
    listen 443 ssl;
    server_name ai.yourdomain.eu;

    location / {
        proxy_pass http://127.0.0.1:11434;
        proxy_set_header Host $host;
        # Продакшен үшін осында авторизация тақырыбын тексеруді қосыңыз
    }
}
EOF

sudo ln -s /etc/nginx/sites-available/ollama /etc/nginx/sites-enabled/
sudo nginx -t && sudo systemctl reload nginx

Қандай кванттауды жүктеу керек

Жоғарыдағы әр модель бірнеше жинақта шығады, ал тег бастапқы салмақтардың қай бөлігі сізге жететінін шешеді. ollama pull llama3.1:8b сізге Q4_K_M береді - жоғарыдағы командалардағы сол 4,7 ГБ - және бұл әдепкі таңдау көбіне дұрыс:

Жинақ 8B модельге керегі Немен төлейсіз Қашан жүктеу керек
Q4_K_M шамамен 4,7 ГБ Чатта немесе қысқаша баяндауда байқалатын азымен Әдепкі, және жұмыстың көбіне дұрыс
Q5_K_M шамамен 5,7 ГБ Байқайтын дерлік ештеңемен Жад бос және сіз оны бәрібір қалайсыз
Q8_0 шамамен 8,5 ГБ Атауға тұрарлық ештеңемен Әр жолы талдануға тиіс құрылымдалған шығыс
fp16 шамамен 16 ГБ Ештеңемен, бұл бастапқы салмақтар Эталонмен салыстыру немесе қосымша үйрету

Жоспарлауды файл өлшемі бойынша емес, файл өлшемі мен контекст терезесінің қосындысы бойынша жүргізу керек. Контексті 32k болған 4,7 ГБ модель KV кешіне қосымша екі-үш гигабайт сұрауы мүмкін, "16 ГБ артығымен жетеді" деген машинадағы 7B модельдің своп-қа кетуі осылай болады.

Күтілетін өнімділік көрсеткіштері

CPU сервері (16 vCPU), llama3.1:8b Q4_K_M:

  • Бір сұранысқа генерация - секундына 18-28 токен
  • Қатарлас сұраныстар (OLLAMA_NUM_PARALLEL=4) - сұранысқа секундына 6-10 токен
  • Эмбеддинг өткізу қабілеті (nomic-embed-text) - секундына 250-400 вектор

GPU сервері (16 ГБ VRAM), llama3.1:8b FP16:

  • Бір сұранысқа генерация - секундына 80-120 токен
  • Қатарлас сұраныстар (4 параллель) - сұранысқа секундына 50-80 токен
  • Бірінші токенге дейінгі уақыт - 100-250 мс

GPU сервері (24 ГБ VRAM), mistral:7b FP16:

  • Бір сұранысқа генерация - секундына 100-150 токен
  • Құрылымдалған JSON шығысының кешігуі - әдетте 200-400 мс

Бұл осы кластағы жабдыққа күтілетін шамалар, өз зертханамыздағы өлшемдер емес. Оларды есептеудің бастау нүктесі деп санап, өз жүктемеңізді өлшеңіз: нақты цифрлар провайдерден гөрі сіздің деректеріңізге, сұраныстарыңызға және баптауыңызға әлдеқайда күштірек байланысты.

Түйін

DCXV-нің ЕО бұлт серверіндегі Ollama командаңызға GDPR сақталған жеке AI нүктесін береді, оны басқару кез келген басқа сервисті басқарудан қиын емес. Орнату бес минуттан аз уақыт алады, модельдер бір командамен жүктеледі, ал OpenAI-мен үйлесімді API OpenAI SDK-де жұмыс істейтін кез келген қосымшаның кодты түзетусіз жұмыс істейтінін білдіреді. ЕО дата-орталығында CPU немесе GPU серверін көтеру үшін DCXV-ге жазыңыз.

Жаңа бұлттық серверге SSH арқылы қалай қосылу керек
sshtutorialcloud

Жаңа бұлттық серверге SSH арқылы қалай қосылу керек

Сервер дайын, ал панельде IP, логин және құпиясөз бар. Міне, SSH арқылы алғашқы қосылу, ең жиі кездесетін төрт қате және алғашқы он минут.

Windows серверіне қашықтағы жұмыс үстелі арқылы қалай қосылу керек
rdpwindowstutorialcloud

Windows серверіне қашықтағы жұмыс үстелі арқылы қалай қосылу керек

Сізде мекенжай, пайдаланушы аты және құпиясөз бар. Оларды өз экраныңыздағы Windows жұмыс үстеліне қалай айналдыруға болады - ПК, Mac немесе телефоннан, қадам-қадаммен.

Еуропадағы Stable Diffusion үшін бұлт сервері: GPU баптау
cloudaigpu

Еуропадағы Stable Diffusion үшін бұлт сервері: GPU баптау

Stable Diffusion-ге қандай GPU жабдығы қажет, ең танымал екі интерфейсті қалай көтеру керек және ЕО ішінде сурет жасаудың қандай жылдамдығын күтуге болады.

Еуропада LLM хостингіне арналған бұлт сервері: AI және GDPR нұсқаулығы
cloudaigpu

Еуропада LLM хостингіне арналған бұлт сервері: AI және GDPR нұсқаулығы

LLM-ді продакшенде хостингілеуге қандай жабдық қажет, модель өлшемі мен кванттау деңгейін қалай таңдау керек және ЕО бұлтында қандай қызмет көрсету фреймворктары жақсы жұмыс істейді.

Claude Code, Codex және Grok CLI-ды өз бұлттық серверіңізде іске қосыңыз
cloudaivps

Claude Code, Codex және Grok CLI-ды өз бұлттық серверіңізде іске қосыңыз

Debian немесе Ubuntu бұлттық серверін Claude Code, Codex және Grok CLI сияқты жасанды зерде агенттеріне арналған құм жәшігіне айналдырыңыз. Кез келген жерден, тіпті телефоннан код жазыңыз.