На предыдущую страницу
Блог

Какие LLM реально запустить на одном сервере NVIDIA HGX: гид по открытым моделям

Компания хочет развернуть языковую модель внутри своего контура, не отправляя данные во внешние API. Открытые LLM последнего поколения — Kimi K3, DeepSeek V4 Pro, GLM 5.2, Kimi K2.7 Code — уже работают на одном сервере. Разбираемся, под какую модель какая платформа HGX нужна.

Почему именно HGX: поколения GPU и память

Большие языковые модели упираются в объём памяти ускорителей. Для современных LLM на сотни миллиардов и триллионы параметров нужна платформа, объединяющая до восьми ускорителей через NVLink и NVSwitch — с прямым доступом к общей памяти.

Ключевое — объём памяти одного ускорителя и суммарный объём платформы:

Платформа Память на GPU HGX (8 GPU) NVLink на GPU
H200 (Hopper) 141 ГБ HBM3e 1128 ГБ 900 ГБ/с
B200 (Blackwell) 180 ГБ HBM3e 1440 ГБ 1800 ГБ/с
B300 (Blackwell Ultra) 288 ГБ HBM3e 2304 ГБ 1800 ГБ/с

Разница между поколениями — не только в гигабайтах памяти, но и в архитектуре. B200 и B300 на Blackwell получили нативную поддержку INT4/INT8, что делает сжатие моделей эффективнее без потери точности. NVLink 5.0 (1800 ГБ/с на каждый ускоритель) вдвое быстрее обменивается данными между GPU, чем H200 на NVLink 4.0.

MoE-архитектура и сжатие: что на что влияет

Большинство современных LLM используют архитектуру Mixture of Experts (MoE) — смесь экспертов. В отличие от плотных моделей, где для каждого токена работают все параметры, MoE активирует лишь небольшую долю экспертов — обычно 2-6% от общего числа.

Здесь важно не перепутать два разных эффекта. Активные параметры определяют скорость: модель на 2,78 трлн параметров с 104 млрд активных считает примерно как модель на 104 млрд, а не как на 2,78 трлн. Но занимает она в памяти все 2,78 трлн. Причина в том, что маршрутизатор может направить любой токен к любому эксперту, поэтому веса всех экспертов должны быть в видеопамяти одновременно.

Выгрузка редко используемых экспертов в оперативную память возможна — например, через параметр cpu_offload_gb в vLLM, — но обмен идёт по PCIe и заметно увеличивает задержку. Для интерактивного сервиса это обычно неприемлемо.

Сжатие (квантизация) — единственный механизм, который реально уменьшает требуемый объём памяти. Вместо хранения весов в нативном формате они сжимаются:

  • FP8/INT8: около 1 байта на параметр, вдвое меньше нативного FP16, потеря точности до 0,5%. Blackwell-ускорители поддерживают FP8 аппаратно. Стандарт для бизнес-инференса.
  • FP4/INT4: около 0,5 байта на параметр, вчетверо меньше FP16, потеря 1-3%. Нативно только на Blackwell. Применяется, когда нужно уместить крупную модель в один сервер.

К объёму весов добавляются накладные расходы среды выполнения и KV-кэш под контекст — в сумме обычно ещё 15-20% и выше, в зависимости от длины контекста и размера пакета запросов. Поэтому при расчёте стоит оставлять запас, а не рассчитывать на полное заполнение видеопамяти.

Как память влияет на выбор модели

Все расчёты — для инференса в FP8/INT8, порядка 1 байта на параметр от общего числа параметров. Нативный формат не рассматриваем: он неэффективен по памяти.

Модель Всего параметров Активных Нужно в FP8 H200 (1128 ГБ) B200 (1440 ГБ) B300 (2304 ГБ)
Kimi K3 2,78T MoE 50-104B ~2,8 ТБ нет нет нет, нужен FP4 или 2 сервера
DeepSeek V4 Pro 1,6T MoE 49B ~1,6 ТБ нет нет да
Kimi K2.7 Code 1,06T MoE 130-170B ~1,1 ТБ на пределе да да
GLM 5.2 744B MoE ~750 ГБ да да да
MiniMax N3 ~450B MoE ~450 ГБ да да да
Llama 4 Behemoth 405B dense 405B ~405 ГБ да да да
DeepSeek V4 Flash 284B MoE 13B ~284 ГБ да да да
Mistral Large 2 120B dense 120B ~120 ГБ да да да

Что из этого следует. Один сервер HGX H200 закрывает инференс моделей примерно до 900 млрд параметров в FP8 — это GLM 5.2, DeepSeek V4 Flash, MiniMax N3, Llama 4 Behemoth и Mistral Large 2, причём с запасом под KV-кэш. Модели на триллион и выше требуют либо Blackwell с FP4, либо двух серверов в связке.

Переход на FP4 меняет картину: там же Kimi K3 занимает около 1,4 ТБ и помещается на B300, а DeepSeek V4 Pro — около 800 ГБ и входит даже в B200. Но FP4 нативно поддерживается только на Blackwell, на H200 этот путь закрыт.

Модели: что реально запустить сегодня

Kimi K3

Флагман Moonshot AI: 2,78 трлн параметров (MoE), 1 млн токенов контекста, нативная мультимодальность. Открытые веса на HuggingFace с июня 2026. Активных параметров: 50-104 млрд.

По объёму памяти: в FP8 требует около 2,8 ТБ и на один сервер не помещается. Практичный путь — FP4 на HGX B300, где модель занимает порядка 1,4 ТБ и остаётся место под контекст. На H200 модель не запускается: там нет ни нужного объёма, ни нативного FP4.

Согласно официальному блогу Moonshot AI, K3 стала первой открытой моделью класса 3T, оптимизированной для локального развёртывания. По бенчмаркам конкурирует с GPT-5.6 Sol в задачах на рассуждение и превосходит DeepSeek V4 Pro на мультимодальных задачах.

DeepSeek V4: Flash и Pro

DeepSeek V4 Flash — 284 млрд параметров (MoE), 13 млрд активных. Самая популярная открытая MoE-модель на HuggingFace. В FP8 занимает около 284 ГБ и работает на HGX H200 с большим запасом. Позиционируется как эффективная замена GPT-4o для бизнес-инференса: низкая задержка, поддержка function calling, сильный русский язык.

DeepSeek V4 Pro — 1,6 трлн параметров (MoE), 49 млрд активных. В FP8 требует около 1,6 ТБ: на H200 и B200 не помещается, на B300 входит. В FP4 занимает порядка 800 ГБ и доступна на B200 и B300. На бенчмарках показывает результаты на уровне GPT-5.6 Terra и Claude Sonnet 5. Специализация: сложные рассуждения, математика, программный код.

GLM 5.2

744 млрд параметров (MoE), нативная поддержка FP8. Разработан Zhipu AI. В FP8 занимает около 750 ГБ — помещается на HGX H200 с запасом порядка 380 ГБ под KV-кэш. Ключевая особенность: двуязычная архитектура (китайский и английский), высокие результаты в бенчмарках MMLU-Pro и HumanEval. Хорошо справляется с контекстом до 256K токенов.

Пожалуй, самый практичный вариант, если нужна сильная модель именно на одном H200.

Kimi K2.7 Code

1,06 трлн параметров (MoE), активных 130-170 млрд. В FP8 требует около 1,1 ТБ — формально это укладывается в 1128 ГБ H200, но свободной памяти под KV-кэш почти не остаётся, поэтому для рабочей нагрузки с длинным контекстом нужен B200 или B300. Специализация: генерация и анализ программного кода, поддержка десятков языков программирования. Используется как базовая модель для агентных фреймворков.

MiniMax N3

Около 450 млрд параметров (MoE). В FP8 занимает порядка 450 ГБ, работает на HGX H200. Сильный контекст до 256K токенов. Разработан MiniMax, позиционируется как универсальная модель для диалоговых систем и создания кратких пересказов.

Mistral Large 2

120 млрд параметров (плотная), сильный русский язык. В FP8 — около 120 ГБ, то есть HGX H200 с очень большим запасом, хватит и на несколько параллельных сервисов. Европейская модель от Mistral AI, оптимизирована для корпоративного использования: RAG, создание кратких пересказов, перевод.

Llama 4 Behemoth

405 млрд параметров (плотная). В нативном FP16 требует около 810 ГБ, в FP8 — порядка 405 ГБ, что помещается на HGX H200. Флагман Meta, одна из сильнейших плотных моделей в открытом доступе. Плотная архитектура означает, что все параметры работают на каждом токене: по скорости модель тяжелее MoE сопоставимого объёма памяти, зато требует меньше видеопамяти при том же качестве.

Сценарии использования

До 100 пользователей, одна модель

HGX H200 с DeepSeek V4 Flash (284B) или GLM 5.2 в FP8/INT8. Внутренний чат-интерфейс, RAG на корпоративных документах.

До 500 пользователей, несколько моделей

Два HGX H200 или один HGX B200. Инференс основной модели плюс дообучение на отраслевых данных.

Флагманская модель, изолированный контур

Один HGX B300 с Kimi K3 в FP4 или с DeepSeek V4 Pro в FP8. Все данные внутри компании. Если требуется именно Kimi K3 в FP8 без сжатия до FP4 — нужны два сервера в связке.

При росте задач за пределы одного сервера 2-4 сервера HGX объединяются в кластер. Начать можно с одного, наращивая по мере роста — кластерные конфигурации на базе NVIDIA SuperPOD проектируются под уже измеренный профиль нагрузки.

Что в итоге

Современные MoE-модели заметно сдвинули порог входа: флагманские открытые LLM больше не требуют стойки оборудования, многие из них разворачиваются на одном сервере — и этого достаточно для инференса, RAG и пилотных проектов.

Главное правило: память считается от общего числа параметров, а не от активных. Активные параметры определяют скорость, общее число — сколько видеопамяти нужно. Один сервер HGX H200 в FP8 закрывает модели примерно до 900 млрд параметров: GLM 5.2, DeepSeek V4 Flash, Llama 4 Behemoth, Mistral Large 2. Blackwell (B200 и B300) даёт объём под модели на триллион и выше плюс нативный FP4, который ещё вдвое снижает требования к памяти.

Открытые LLM достигли уровня коммерческих аналогов. Kimi K3, DeepSeek V4 Pro и GLM 5.2 конкурируют с GPT-5 и Claude — и работают на вашем оборудовании. Если данные не должны покидать контур компании, платформа NVIDIA HGX решает задачу. А если развернуть модель внутри контура не требуется, те же модели доступны через ИИ как сервис по единому API, без закупки оборудования.

FAQ

Столько, сколько занимают все её параметры, а не только активные. Маршрутизатор может отправить любой токен к любому эксперту, поэтому веса всех экспертов должны находиться в видеопамяти одновременно. Активные параметры влияют на скорость вычислений, а не на объём памяти. Практический расчёт: в FP8 около 1 байта на параметр от общего числа, плюс 15-20% на накладные расходы и KV-кэш под контекст.
HGX H200 подходит для моделей до примерно 900 млрд параметров в FP8: GLM 5.2, DeepSeek V4 Flash, Llama 4 Behemoth, Mistral Large 2. HGX B200 и B300 нужны для моделей на триллион параметров и выше, а также если планируется FP4 — он поддерживается нативно только на Blackwell.
Вдвое больше памяти на платформу (2304 против 1128 ГБ), вдвое быстрее NVLink (1800 против 900 ГБ/с на каждый ускоритель) и нативная поддержка FP4/INT4. Для крупных MoE-моделей это решающие параметры: объём определяет, поместится ли модель вообще, а скорость NVLink влияет на эффективность тензорного параллелизма внутри сервера.
Да, но только на HGX B300 и в FP4. При 2,78 трлн параметров модель в FP8 требует около 2,8 ТБ и не помещается ни в один из односерверных вариантов. В FP4 она занимает порядка 1,4 ТБ и входит в 2304 ГБ B300 с запасом под контекст. На H200 модель не запускается: не хватает объёма и нет нативной поддержки FP4.
Модели до 70 млрд параметров — да, на сервере с одним-двумя GPU. Для флагманских открытых LLM нужна платформа HGX, объединяющая до восьми ускорителей через NVLink: только так набирается достаточный суммарный объём видеопамяти и достаточная скорость обмена между картами для тензорного параллелизма.
Технически да: в vLLM есть параметр cpu_offload_gb, который позволяет держать часть весов в памяти CPU и подгружать их на GPU по мере надобности. Но обмен идёт по PCIe, и задержка вырастает существенно. Для пакетной обработки это иногда допустимо, для интерактивного сервиса — почти никогда. Загрузка отдельных экспертов по требованию в vLLM не поддерживается: все веса должны быть в памяти GPU или CPU уже на старте.
Начинать с одного сервера HGX, при росте наращивать до 2-4 серверов, объединяя их высокоскоростными соединениями. Перед переходом стоит собрать профиль нагрузки: точность вычислений, длину контекста, размер пакета запросов, целевое время ответа. Без этих параметров нельзя корректно посчитать нужное число серверов.
Оцените данную статью

Узнавайте о выходе новых статей в блоге первыми!

Подпишитесь на нашу рассылку