На предыдущую страницу
Блог
#AI
#GPU
#Hardware

Какие LLM реально запустить на одном сервере NVIDIA HGX: гид по открытым моделям

Компания хочет развернуть языковую модель внутри своего контура, не отправляя данные во внешние API. Открытые LLM последнего поколения — Kimi K3, DeepSeek V4 Pro, GLM 5.2, Kimi K2.7 Code — уже работают на одном сервере. Разбираемся, на каких платформах HGX можно запускать современные открытые LLM.

Почему именно HGX: поколения GPU и память

Большие языковые модели упираются в объём памяти ускорителей. Для современных LLM на сотни миллиардов и триллионы параметров нужна платформа, объединяющая до восьми ускорителей через NVLink и NVSwitch — с прямым доступом к общей памяти.

Ключевое — объём памяти одного ускорителя и суммарный объём платформы:

Платформа Память на GPU HGX (8 GPU) NVLink
H200 (Hopper) 141 ГБ HBM3e 1128 ГБ 900 ГБ/с
B200 (Blackwell) 180 ГБ HBM3e 1440 ГБ 1800 ГБ/с
B300 (Blackwell Ultra) 288 ГБ HBM3e 2304 ГБ 1800 ГБ/с


Разница между поколениями — не только в гигабайтах памяти, но и в архитектуре. B200 и B300 на Blackwell получили нативную поддержку INT4/INT8, что делает сжатие моделей эффективнее без потери точности. NVLink 5.0 (1800 ГБ/с) вдвое быстрее обменивается данными между ускорителями, чем H200 на NVLink 4.0.

MoE-архитектура и сжатие: почему это важно

Большинство современных LLM используют архитектуру Mixture of Experts (MoE) — смесь экспертов. В отличие от плотных моделей, где активны все параметры, MoE для каждого токена активирует лишь небольшую долю экспертов (2-6% от общего числа). Это ключевой механизм экономии памяти.

Как это работает: модель Kimi K3 имеет 2,78 трлн параметров суммарно, но в GPU-памяти в каждый момент находятся только активные эксперты — около 50-104 млрд параметров. Остальные ждут своей очереди.

Сжатие (квантизация) — второй механизм экономии. Вместо хранения весов в нативном формате они сжимаются:

  • FP8/INT8: память вдвое меньше нативного формата, потеря точности до 0,5%. Blackwell-ускорители поддерживают FP8 аппаратно. Стандарт для бизнес-инференса.
  • FP4/INT4: память вчетверо меньше, потеря 1-3%. Только на Blackwell. Применяется, когда нужно уместить модель в один сервер.

Связка MoE + сжатие дает двойной эффект: активные эксперты занимают ещё меньше памяти. Модель, требующая в нативном формате два сервера, помещается в FP8/INT8 на один.

Таблица совместимости: параметры и требования памяти

Модель Параметры Архитектура Активных Квантизация (Tensor Type) Рекомендуемые GPU
Kimi K3 2.8T MoE 50-104B FP8/INT8 8 x B300
Kimi K2.7 Code 1.1T MoE 130-170B INT4/FP4 8 x H200
DeepSeek V4 Pro 1.6T MoE 49B INT4/FP4 8 x B200
DeepSeek V4 Flash 284B MoE 13B INT4/FP4 8 x H200
GLM 5.2 744B MoE 40B FP8/INT8 8 x H200
Qwen 3.6-Plus 235B MoE 22B — нет открытых весов — только API
Mistral Large 3 675B MoE 41B FP8/INT8 8 x H200
Mistral Large 2 123B 123B FP16/BF16 8 x H200
Mixtral 8x22B 141B MoE 39B FP16/BF16 8 x H200
Llama 3.1 405B 405B 405B FP16/BF16 8 x H200
MiniMax M3 450B MoE ~45B FP8/INT8 8 x H200


Вывод:
один сервер HGX H200 закрывает инференс всех популярных MoE-моделей. Плотные модели (Llama 4 Behemoth) требуют B200 и выше.

Модели: что реально запустить сегодня

Kimi K3

Флагман Moonshot AI: 2,78 трлн параметров (MoE), 1 млн токенов контекста, нативная мультимодальность. Открытые веса на HuggingFace с июня 2026 — более 493 тысяч загрузок. Активных параметров: 50-104 млрд. В FP8/INT8 — на любом сервере HGX: H200, B200, B300.

Согласно официальному блогу Moonshot AI, K3 стала первой открытой моделью класса 3T, оптимизированной для локального развёртывания. Бенчмарки: конкурирует с GPT-5.6 Sol по качеству рассуждений, превосходит DeepSeek V4 Pro на мультимодальных задачах.

DeepSeek V4: Flash и Pro

DeepSeek V4 Flash — 284B параметров (MoE), 13B активных. Самая популярная открытая MoE-модель на HuggingFace — более 2,9 млн загрузок. Работает на HGX H200 с огромным запасом. Позиционируется как эффективная замена GPT-4o для бизнес-инференса: низкая задержка, поддержка function calling, сильный русский язык.

DeepSeek V4 Pro — 1,6 трлн параметров (MoE), 49B активных. На HGX H200 в FP8/INT8 — без проблем. На бенчмарках показывает результаты на уровне GPT-5.6 Terra и Claude Sonnet 5. Специализация: сложные рассуждения, математика, программный код. Более 51 тысячи загрузок на HuggingFace.

GLM 5.2

744 млрд параметров (MoE), нативная поддержка FP8. Разработан Zhipu AI. На HGX H200 — в FP8/INT8 с запасом. Более 1,65 млн загрузок на HuggingFace. Ключевая особенность: двуязычная архитектура (китайский + английский), высокие результаты в бенчмарках MMLU-Pro и HumanEval. Хорошо справляется с длинными контекстами до 256K токенов.

Kimi K2.7 Code

1,06 трлн параметров (MoE), активных 130-170B. В FP8/INT8 — HGX H200 с запасом. Более 657 тысяч загрузок. Специализация: генерация и анализ программного кода, поддержка десятков языков программирования. Используется как базовая модель для агентных фреймворков.

MiniMax N3

Около 450 млрд параметров (MoE). В FP8/INT8 — HGX H200. Сильный контекст до 256K токенов. Разработан MiniMax, позиционируется как универсальная модель для диалоговых систем и создания кратких пересказов.

Mistral Large 2

120 млрд параметров (плотная), сильный русский язык. В FP8/INT8 — HGX H200 с большим запасом. Европейская модель от Mistral AI, оптимизирована для корпоративного использования: RAG, создание кратких пересказов, перевод.

Llama 4 Behemoth

405 млрд параметров (плотная). Требует 810 ГБ в нативном формате. В FP8/INT8 — HGX B200 или B300. Флагман Meta, лучшая плотная модель в открытом доступе. На H200 не помещается.

Сценарии использования

До 100 пользователей, одна модель

HGX H200 с DeepSeek V4 Flash (284B) или GLM 5.2 в FP8/INT8. Внутренний чат-интерфейс, RAG на корпоративных документах.

До 500 пользователей, несколько моделей

Два HGX H200 или один HGX B200. Инференс основной модели плюс дообучение на отраслевых данных.

Флагманская модель, изолированный контур

Один HGX B300 с Kimi K3 в FP8/INT8. Все данные внутри компании.

При росте задач за пределы одного сервера — 2-4 сервера HGX объединяются в кластер. Но начать можно с одного, наращивая по мере роста.

Что в итоге

Современные MoE-модели окончательно сломали стереотип «ИИ-инфраструктура — это стойки оборудования на миллионы долларов». Флагманские LLM уровня Kimi K3 и DeepSeek V4 Pro запускаются на одном сервере — и этого достаточно для инференса, RAG и пилотных проектов.

Главное правило: память первична, формат — следом. Один сервер HGX H200 закрывает инференс всех популярных открытых MoE-моделей в FP8/INT8. Blackwell (B200/B300) даёт запас для плотных моделей и нативную поддержку FP4/INT4.

Открытые LLM достигли уровня коммерческих аналогов. Kimi K3, DeepSeek V4 Pro и GLM 5.2 конкурируют с GPT-5 и Claude — и работают на вашем оборудовании. Если данные не должны покидать контур компании — один сервер HGX решает задачу.

FAQ

HGX H200 — оптимальный старт для инференса MoE-моделей (K2.7 Code, DeepSeek V4 Pro, GLM 5.2). HGX B200/B300 — если нужны плотные модели (Llama 4 Behemoth) или Kimi K3 на максимальной точности.

Вдвое быстрее NVLink (1800 vs 900 ГБ/с), нативная поддержка FP4/INT4/INT8, вдвое больше памяти на платформу (2304 vs 1128 ГБ). Для MoE-моделей Blackwell означает больше активных экспертов и быстрее инференс.

До 70 млрд параметров — да, на сервере с 1-2 GPU. Для флагманских открытых LLM нужна платформа HGX, объединяющая до 8 ускорителей через NVLink.

Начинать с одного сервера HGX. При росте — наращивать до 2-4 серверов, объединяя их высокоскоростными соединениями. Подробный разбор — в статье про масштабирование.

K3 — первая открытая модель класса 3T (2,78 трлн параметров MoE). Доступна на HuggingFace с июня 2026, более 493 тысяч загрузок. В FP8/INT8 — на любом сервере HGX: H200, B200, B300. При активных 50-104 млрд параметров модель помещается с запасом.

Оцените данную статью

Узнавайте о выходе новых статей в блоге первыми!

Подпишитесь на нашу рассылку