DeepSeek V4: модель MoE на 1,6T с контекстом 1M на сервере в ЕС
DeepSeek V4 - самое способное семейство открытых языковых моделей, доступное на апрель 2026 года. Серия выходит в двух вариантах: DeepSeek-V4-Pro (1,6T параметров, 49B активных) и DeepSeek-V4-Flash (284B параметров, 13B активных), и оба поддерживают окно контекста в один миллион токенов. Для европейского бизнеса собственный хостинг DeepSeek V4 на облачном сервере в ЕС означает доступ к передовым возможностям AI при полном соблюдении требований GDPR к месту хранения данных.
Это руководство описывает, что DeepSeek V4 приносит архитектурно, как запустить его локально на инфраструктуре GPU DCXV и какой производительности ждать в разных режимах рассуждения.
Что нового в DeepSeek V4
DeepSeek V4 приносит три архитектурных улучшения по сравнению с V3.2:
- Гибридное внимание (CSA и HCA) - объединяет Compressed Sparse Attention и Heavily Compressed Attention, чтобы резко снизить стоимость длинного контекста. На 1M токенов V4-Pro требует лишь 27% операций инференса и 10% кеша KV по сравнению с V3.2.
- Гиперсвязи с ограничением на многообразии (mHC) - усиливают остаточные связи и повышают устойчивость распространения сигнала между слоями, не жертвуя выразительностью модели.
- Оптимизатор Muon - заменяет AdamW ради более быстрой сходимости и лучшей устойчивости обучения в масштабе.
Обе модели предобучены более чем на 32T токенов и дообучены двухэтапным конвейером: выращивание предметных экспертов (SFT и RL с GRPO), затем дистилляция по текущей политике, чтобы собрать экспертизу в одну модель.
Варианты модели и точность
| Модель | Всего параметров | Активных | Контекст | Точность |
|---|---|---|---|---|
| DeepSeek-V4-Flash-Base | 284B | 13B | 1M | FP8 Mixed |
| DeepSeek-V4-Flash | 284B | 13B | 1M | FP4 + FP8 Mixed |
| DeepSeek-V4-Pro-Base | 1.6T | 49B | 1M | FP8 Mixed |
| DeepSeek-V4-Pro | 1.6T | 49B | 1M | FP4 + FP8 Mixed |
FP4 + FP8 Mixed означает, что параметры экспертов MoE идут в точности FP4, а большинство остальных - в FP8, что заметно снижает требования к VRAM без серьёзной потери качества.
Три режима рассуждения
И Pro, и Flash поддерживают три режима инференса, которые вы выбираете во время работы:
- Non-think - быстрые интуитивные ответы для рутинных задач. Вывод сразу начинается со сводки
</think>. - Think High - осознанный логический разбор. Медленнее, но точнее. Использует полный блок
<think>перед сводкой. - Think Max - максимальное усилие рассуждения, лучший выбор для математических доказательств, трудных задач с кодом и сложных агентских задач. Требует особого системного запроса и окна контекста не менее 384K.
Главное из бенчмарков
DeepSeek-V4-Pro-Max получает лучший рейтинг Codeforces среди всех проверенных моделей - 3206, впереди GPT-5.4 (3168) и Gemini-3.1-Pro (3052). На LiveCodeBench у него 93,5% Pass@1. На SWE-Verified он решает 80,6% реальных задач с GitHub.
В задачах на знания V4-Pro-Max достигает 90,1% на GPQA Diamond и 87,5% на MMLU-Pro. Вариант Flash в режиме Think Max набирает сопоставимо с Pro на большинстве задач на рассуждение при доле затрат на VRAM.
Требования к оборудованию для собственного хостинга
- V4-Flash (284B, FP4+FP8) - примерно 150-180 ГБ на хранение всех весов. Нужно несколько A100 80 ГБ или H100 в тензорном параллелизме. Минимум для Flash - 2 карты A100 80 ГБ.
- V4-Pro (1,6T, FP4+FP8) - нужны 8 карт A100 80 ГБ или равноценная многоузловая схема с GPU. Практичнее для организаций, которые держат выделенные кластеры инференса.
Для большинства европейских компаний практичный выбор - V4-Flash: рассуждение сопоставимо с Pro в режиме Think Max, оборудование стоит гораздо меньше, а контекст всё те же 1M токенов.
Команды для быстрой установки
# Загрузка DeepSeek-V4-Flash с HuggingFace
pip install huggingface_hub transformers
python -c "
from huggingface_hub import snapshot_download
snapshot_download(
repo_id='deepseek-ai/DeepSeek-V4-Flash',
local_dir='/models/deepseek-v4-flash',
ignore_patterns=['*.md']
)
"
# Кодирование сообщений через входящий в поставку скрипт
# Клонируйте репозиторий модели, чтобы получить утилиты кодирования
git clone https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash /models/deepseek-v4-flash
# Используйте входящий в поставку помощник кодирования
python3 << 'EOF'
import sys
sys.path.insert(0, '/models/deepseek-v4-flash/encoding')
from encoding_dsv4 import encode_messages, parse_message_from_completion_text
messages = [
{"role": "user", "content": "Summarize GDPR Article 5 in 3 bullet points."}
]
# Non-think mode - fast response
prompt = encode_messages(messages, thinking_mode="non-thinking")
print("Non-think prompt length:", len(prompt))
# Think High mode - analytical response
prompt_think = encode_messages(messages, thinking_mode="thinking")
print("Think prompt length:", len(prompt_think))
EOF
# Обслуживание через vLLM (рекомендуется для продакшена)
pip install vllm
python -m vllm.entrypoints.openai.api_server \
--model /models/deepseek-v4-flash \
--host 10.0.0.5 \
--port 8000 \
--tensor-parallel-size 2 \
--max-model-len 131072 \
--gpu-memory-utilization 0.90 \
--served-model-name deepseek-v4-flash
# Проверка API
curl http://10.0.0.5:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash",
"messages": [{"role": "user", "content": "What is GDPR?"}],
"temperature": 1.0,
"top_p": 1.0
}'
# Для режима Think Max - задайте окно контекста не менее 384K и особый системный запрос
curl http://10.0.0.5:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{"role": "system", "content": "Think step by step. Use maximum reasoning effort."},
{"role": "user", "content": "Prove that sqrt(2) is irrational."}
],
"temperature": 1.0,
"top_p": 1.0,
"max_tokens": 32768
}'
Рекомендуемые параметры инференса
Команда DeepSeek рекомендует для локального развёртывания temperature = 1.0 и top_p = 1.0. Для режима Think Max задайте окно контекста не менее 384K токенов, чтобы цепочка рассуждений уложилась целиком.
Запуск DeepSeek V4 на инфраструктуре DCXV в ЕС
Серверы с GPU от DCXV в дата-центрах ЕС уровня Tier III - практичный путь к собственному хостингу DeepSeek V4 с соблюдением требований GDPR к месту хранения данных. Рекомендуемые конфигурации:
- 2 карты A100 80 ГБ - свободно держат V4-Flash в FP8. Справляются с режимами Think High и Think Max. Подходят для внутренних корпоративных инструментов и сервисов API в ЕС.
- 8 карт A100 80 ГБ - нужны для V4-Pro. Держат полную модель на 1,6T параметров в FP4+FP8. Для организаций, которым нужно качество передовой модели при полном контроле над данными.
Напишите на sales@dcxv.com, чтобы обсудить конфигурации с несколькими GPU под развёртывание DeepSeek V4.
Итог
DeepSeek V4 - самый сильный выпуск открытой модели в 2026 году: V4-Pro-Max получает лучший рейтинг Codeforces и почти передовые показатели в бенчмарках на рассуждение и агентские задачи. Архитектура гибридного внимания делает контекст в 1M токенов практичным, а не только технически возможным. Для европейских организаций, которые не могут отправлять запросы в размещённые в США API, собственный хостинг V4-Flash на инфраструктуре GPU DCXV в ЕС даёт рассуждение класса GPT-4 при полном соблюдении GDPR.
