Компания хочет развернуть языковую модель внутри своего контура, не отправляя данные во внешние API. Открытые LLM последнего поколения — Kimi K3, DeepSeek V4 Pro, GLM 5.2, Kimi K2.7 Code — уже работают на одном сервере. Разбираемся, на каких платформах HGX можно запускать современные открытые LLM.
Почему именно HGX: поколения GPU и память
Большие языковые модели упираются в объём памяти ускорителей. Для современных LLM на сотни миллиардов и триллионы параметров нужна платформа, объединяющая до восьми ускорителей через NVLink и NVSwitch — с прямым доступом к общей памяти.
Ключевое — объём памяти одного ускорителя и суммарный объём платформы:
| Платформа | Память на GPU | HGX (8 GPU) | NVLink |
| H200 (Hopper) | 141 ГБ HBM3e | 1128 ГБ | 900 ГБ/с |
| B200 (Blackwell) | 180 ГБ HBM3e | 1440 ГБ | 1800 ГБ/с |
| B300 (Blackwell Ultra) | 288 ГБ HBM3e | 2304 ГБ | 1800 ГБ/с |
Разница между поколениями — не только в гигабайтах памяти, но и в архитектуре. B200 и B300 на Blackwell получили нативную поддержку INT4/INT8, что делает сжатие моделей эффективнее без потери точности. NVLink 5.0 (1800 ГБ/с) вдвое быстрее обменивается данными между ускорителями, чем H200 на NVLink 4.0.
MoE-архитектура и сжатие: почему это важно
Большинство современных LLM используют архитектуру Mixture of Experts (MoE) — смесь экспертов. В отличие от плотных моделей, где активны все параметры, MoE для каждого токена активирует лишь небольшую долю экспертов (2-6% от общего числа). Это ключевой механизм экономии памяти.
Как это работает: модель Kimi K3 имеет 2,78 трлн параметров суммарно, но в GPU-памяти в каждый момент находятся только активные эксперты — около 50-104 млрд параметров. Остальные ждут своей очереди.
Сжатие (квантизация) — второй механизм экономии. Вместо хранения весов в нативном формате они сжимаются:
- FP8/INT8: память вдвое меньше нативного формата, потеря точности до 0,5%. Blackwell-ускорители поддерживают FP8 аппаратно. Стандарт для бизнес-инференса.
- FP4/INT4: память вчетверо меньше, потеря 1-3%. Только на Blackwell. Применяется, когда нужно уместить модель в один сервер.
Связка MoE + сжатие дает двойной эффект: активные эксперты занимают ещё меньше памяти. Модель, требующая в нативном формате два сервера, помещается в FP8/INT8 на один.
Таблица совместимости: параметры и требования памяти
| Модель | Параметры | Архитектура | Активных | Квантизация (Tensor Type) | Рекомендуемые GPU |
| Kimi K3 | 2.8T | MoE | 50-104B | FP8/INT8 | 8 x B300 |
| Kimi K2.7 Code | 1.1T | MoE | 130-170B | INT4/FP4 | 8 x H200 |
| DeepSeek V4 Pro | 1.6T | MoE | 49B | INT4/FP4 | 8 x B200 |
| DeepSeek V4 Flash | 284B | MoE | 13B | INT4/FP4 | 8 x H200 |
| GLM 5.2 | 744B | MoE | 40B | FP8/INT8 | 8 x H200 |
| Qwen 3.6-Plus | 235B | MoE | 22B | — нет открытых весов | — только API |
| Mistral Large 3 | 675B | MoE | 41B | FP8/INT8 | 8 x H200 |
| Mistral Large 2 | 123B | 123B | FP16/BF16 | 8 x H200 | |
| Mixtral 8x22B | 141B | MoE | 39B | FP16/BF16 | 8 x H200 |
| Llama 3.1 405B | 405B | 405B | FP16/BF16 | 8 x H200 | |
| MiniMax M3 | 450B | MoE | ~45B | FP8/INT8 | 8 x H200 |
Вывод: один сервер HGX H200 закрывает инференс всех популярных MoE-моделей. Плотные модели (Llama 4 Behemoth) требуют B200 и выше.
Модели: что реально запустить сегодня
Kimi K3
Флагман Moonshot AI: 2,78 трлн параметров (MoE), 1 млн токенов контекста, нативная мультимодальность. Открытые веса на HuggingFace с июня 2026 — более 493 тысяч загрузок. Активных параметров: 50-104 млрд. В FP8/INT8 — на любом сервере HGX: H200, B200, B300.
Согласно официальному блогу Moonshot AI, K3 стала первой открытой моделью класса 3T, оптимизированной для локального развёртывания. Бенчмарки: конкурирует с GPT-5.6 Sol по качеству рассуждений, превосходит DeepSeek V4 Pro на мультимодальных задачах.
DeepSeek V4: Flash и Pro
DeepSeek V4 Flash — 284B параметров (MoE), 13B активных. Самая популярная открытая MoE-модель на HuggingFace — более 2,9 млн загрузок. Работает на HGX H200 с огромным запасом. Позиционируется как эффективная замена GPT-4o для бизнес-инференса: низкая задержка, поддержка function calling, сильный русский язык.
DeepSeek V4 Pro — 1,6 трлн параметров (MoE), 49B активных. На HGX H200 в FP8/INT8 — без проблем. На бенчмарках показывает результаты на уровне GPT-5.6 Terra и Claude Sonnet 5. Специализация: сложные рассуждения, математика, программный код. Более 51 тысячи загрузок на HuggingFace.
GLM 5.2
744 млрд параметров (MoE), нативная поддержка FP8. Разработан Zhipu AI. На HGX H200 — в FP8/INT8 с запасом. Более 1,65 млн загрузок на HuggingFace. Ключевая особенность: двуязычная архитектура (китайский + английский), высокие результаты в бенчмарках MMLU-Pro и HumanEval. Хорошо справляется с длинными контекстами до 256K токенов.
Kimi K2.7 Code
1,06 трлн параметров (MoE), активных 130-170B. В FP8/INT8 — HGX H200 с запасом. Более 657 тысяч загрузок. Специализация: генерация и анализ программного кода, поддержка десятков языков программирования. Используется как базовая модель для агентных фреймворков.
MiniMax N3
Около 450 млрд параметров (MoE). В FP8/INT8 — HGX H200. Сильный контекст до 256K токенов. Разработан MiniMax, позиционируется как универсальная модель для диалоговых систем и создания кратких пересказов.
Mistral Large 2
120 млрд параметров (плотная), сильный русский язык. В FP8/INT8 — HGX H200 с большим запасом. Европейская модель от Mistral AI, оптимизирована для корпоративного использования: RAG, создание кратких пересказов, перевод.
Llama 4 Behemoth
405 млрд параметров (плотная). Требует 810 ГБ в нативном формате. В FP8/INT8 — HGX B200 или B300. Флагман Meta, лучшая плотная модель в открытом доступе. На H200 не помещается.
Сценарии использования
До 100 пользователей, одна модель
HGX H200 с DeepSeek V4 Flash (284B) или GLM 5.2 в FP8/INT8. Внутренний чат-интерфейс, RAG на корпоративных документах.
До 500 пользователей, несколько моделей
Два HGX H200 или один HGX B200. Инференс основной модели плюс дообучение на отраслевых данных.
Флагманская модель, изолированный контур
Один HGX B300 с Kimi K3 в FP8/INT8. Все данные внутри компании.
При росте задач за пределы одного сервера — 2-4 сервера HGX объединяются в кластер. Но начать можно с одного, наращивая по мере роста.
Что в итоге
Современные MoE-модели окончательно сломали стереотип «ИИ-инфраструктура — это стойки оборудования на миллионы долларов». Флагманские LLM уровня Kimi K3 и DeepSeek V4 Pro запускаются на одном сервере — и этого достаточно для инференса, RAG и пилотных проектов.
Главное правило: память первична, формат — следом. Один сервер HGX H200 закрывает инференс всех популярных открытых MoE-моделей в FP8/INT8. Blackwell (B200/B300) даёт запас для плотных моделей и нативную поддержку FP4/INT4.
Открытые LLM достигли уровня коммерческих аналогов. Kimi K3, DeepSeek V4 Pro и GLM 5.2 конкурируют с GPT-5 и Claude — и работают на вашем оборудовании. Если данные не должны покидать контур компании — один сервер HGX решает задачу.
FAQ
HGX H200 — оптимальный старт для инференса MoE-моделей (K2.7 Code, DeepSeek V4 Pro, GLM 5.2). HGX B200/B300 — если нужны плотные модели (Llama 4 Behemoth) или Kimi K3 на максимальной точности.
Вдвое быстрее NVLink (1800 vs 900 ГБ/с), нативная поддержка FP4/INT4/INT8, вдвое больше памяти на платформу (2304 vs 1128 ГБ). Для MoE-моделей Blackwell означает больше активных экспертов и быстрее инференс.
До 70 млрд параметров — да, на сервере с 1-2 GPU. Для флагманских открытых LLM нужна платформа HGX, объединяющая до 8 ускорителей через NVLink.
Начинать с одного сервера HGX. При росте — наращивать до 2-4 серверов, объединяя их высокоскоростными соединениями. Подробный разбор — в статье про масштабирование.
K3 — первая открытая модель класса 3T (2,78 трлн параметров MoE). Доступна на HuggingFace с июня 2026, более 493 тысяч загрузок. В FP8/INT8 — на любом сервере HGX: H200, B200, B300. При активных 50-104 млрд параметров модель помещается с запасом.