На предыдущую страницу
Blog

GPU-серверы для AI в Узбекистане. Как выбрать ускоритель под AI, ML и HPC

Когда AI-проект выходит за пределы пилота, одним из первых ограничений становится вычислительная инфраструктура. Языковой модели не хватает видеопамяти, обучение занимает слишком много времени, а несколько команд конкурируют за один ускоритель.

Собственный GPU-сервер или облако

Компания может приобрести собственный GPU-сервер или арендовать вычислительные ресурсы в облаке. Поставка оборудования может занимать от двух до четырёх месяцев, тогда как облачная GPU-инфраструктура уже готова к работе и позволяет быстрее перейти к тестированию и запуску нагрузки.

На этом этапе компании начинают искать GPU-серверы и сравнивать доступные модели. Однако выбрать просто самую новую или мощную карту недостаточно. Инференс, обучение, компьютерное зрение и виртуальные рабочие места предъявляют разные требования к памяти, скорости обмена данными и способу предоставления ресурсов.

В статье разберём, какие GPU доступны для корпоративных проектов, чем они отличаются и как подобрать конфигурацию под фактическую нагрузку.

Что влияет на выбор GPU

GPU выбирают по профилю задачи. Для предварительного расчёта нужно знать размер модели, режим работы, объём контекста, количество параллельных запросов и требования к задержке.

Первым ограничением часто становится объём видеопамяти. В неё загружаются веса модели, KV-кеш, рабочий контекст и промежуточные данные. Если памяти недостаточно, модель приходится распределять между несколькими ускорителями или частично выгружать в оперативную память сервера. Пропускная способность PCIe в десятки раз ниже, чем у видеопамяти: например, PCIe 4.0 x16 даёт около 32 ГБ/с в одном направлении против 4,8 ТБ/с у HBM3e на H200. При частичной выгрузке данных генерация токенов может существенно замедляться, а шина — стать узким местом. Для production-нагрузок с жёсткими требованиями к задержке такой режим может быть непригоден.

Пропускная способность памяти влияет на скорость чтения весов и обработку запросов. Этот параметр особенно важен при инференсе крупных языковых моделей. При этом prefill — обработка промпта — как правило, сильнее зависит от вычислительной производительности, а генерация токенов часто ограничивается пропускной способностью памяти. Это разные профили нагрузки.

Для многоускорительных конфигураций имеет значение скорость обмена между GPU. Если модель распределена по нескольким картам, итоговая производительность зависит от используемого межсоединения между GPU, например NVLink и NVSwitch, а в многоузловой конфигурации — также от сети вычислительного кластера.

Также нужно определить формат доступа. Для тестов может хватить профиля vGPU. Для production-нагрузок с требованиями к аппаратной изоляции и выделенным ресурсам обычно используют полный ускоритель или MIG-backed vGPU. Для обучения крупнейших моделей применяют платформы NVIDIA HGX.

Сценарий Главное ограничение Подходящий класс решения
Инференс LLM Видеопамять, контекст, задержка RTX PRO 6000 Blackwell Server Edition, NVIDIA H200
Обучение и дообучение Память, объём данных, время расчёта NVIDIA A100, A800
Обучение крупных LLM Обмен между GPU, совокупный объём памяти HGX H200
Компьютерное зрение Количество потоков, FPS, разрешение RTX PRO 6000
Виртуальные рабочие места Плотность пользователей, vGPU NVIDIA A16
HPC Тип вычислений, память, масштабирование H200, HGX H200

Почему объём видеопамяти проверяют первым

Объём памяти задаёт верхнюю границу модели, которую можно запустить на одном ускорителе. При этом размер файла с весами не равен итоговому потреблению VRAM. Нужно учитывать контекст, KV-кеш, число активных запросов и точность хранения весов. Снижение точности уменьшает объём памяти, занимаемый весами, но итоговая экономия VRAM зависит от формата квантизации и параметров запуска модели.

Для разработки и лёгкого инференса не всегда требуется полная карта. NVIDIA RTX PRO 6000 Blackwell Server Edition оснащена 96 ГБ физической видеопамяти. Через NVIDIA vGPU этот объём можно предоставлять виртуальным машинам в виде профилей, включая конфигурации на 12, 24, 48 и 96 ГБ.

Профиль на 12 ГБ может подойти для разработки и проверки гипотез. Конфигурацию на 24 ГБ можно использовать для инференса моделей среднего размера и RAG-сценариев. Профиль на 48 ГБ подходит для более крупных LLM, мультимодальных задач и параллельной обработки. Профиль на 96 ГБ или полный ускоритель используют для тяжёлого инференса, вычислений и профессиональной графики.

NVIDIA H200 содержит 141 ГБ памяти HBM3e на одном ускорителе. Два ускорителя дают 282 ГБ совокупной видеопамяти, однако память остаётся физически распределённой между GPU. Чтобы запустить модель, которая не помещается на одной карте, её распределяют между ускорителями с помощью тензорного или другого вида параллелизма. NVLink ускоряет обмен данными между GPU. Такая конфигурация подходит для крупных моделей и сервисов с большим контекстом.

Покупать максимальный объём памяти заранее не всегда рационально. Конфигурацию лучше выбирать после теста модели с рабочим контекстом, нужной точностью и ожидаемым числом запросов.

Когда одного ускорителя недостаточно

Несколько GPU используют по двум причинам. Первая связана с размером модели. Вторая возникает, когда один ускоритель не обеспечивает нужную пропускную способность.

Простая установка нескольких карт в сервер не превращает их в единую вычислительную систему. Производительность зависит от того, как ускорители обмениваются данными. При медленной передаче часть времени уходит на синхронизацию, а не на расчёты.

Для таких нагрузок используют NVIDIA HGX. В этой архитектуре ускорители связаны через NVLink и NVSwitch. Система работает как единый вычислительный узел.

NVIDIA HGX H200 объединяет восемь ускорителей H200 SXM5. Общий объём памяти составляет около 1,1 ТБ HBM3e. Платформа рассчитана на обучение LLM, масштабный инференс и высокопроизводительные вычисления.

HGX не нужен для каждого AI-проекта. Корпоративный ассистент, система поиска по документам или сервис компьютерного зрения часто работают на одном GPU или его виртуальном профиле. HGX выбирают после того, как задача упирается в память, обмен между ускорителями или время выполнения.

Какие GPU доступны для проектов в Узбекистане

В портфеле ITGLOBAL.COM для проектов в Узбекистане представлены пять моделей графических ускорителей. Линейка включает решения для пилотов, промышленного инференса, обучения LLM, VDI, компьютерного зрения и HPC.

Модель Конфигурация Основное назначение
NVIDIA H200 141 ГБ HBM3e Обучение LLM, масштабный инференс, HPC
NVIDIA RTX PRO 6000 Blackwell 96 ГБ GDDR7 с ECC Инференс, RAG, графика, компьютерное зрение
NVIDIA A100 и A800 40 и 80 ГБ; поддержка MIG ML, глубокое обучение, рекомендательные системы
NVIDIA A16 4 GPU × 16 ГБ GDDR6, 64 ГБ суммарно VDI и виртуальные рабочие места

NVIDIA H200 для крупных моделей

H200 выбирают, когда основным ограничением становится объём памяти или скорость работы с ней. Один ускоритель содержит 141 ГБ HBM3e.

Карта подходит для инференса крупных моделей, дообучения LLM, научных расчётов и обработки больших массивов данных. Несколько H200 можно объединить для моделей, которые не помещаются на одном GPU.

NVIDIA RTX PRO 6000 Blackwell для универсальных проектов

RTX PRO 6000 Blackwell Server Edition оснащена 96 ГБ памяти GDDR7 с ECC. Она подходит для дообучения моделей, RAG, мультимодального AI, компьютерного зрения и профессиональной графики.

Карту можно разделить на профили с разным объёмом VRAM. Компания может начать с небольшой конфигурации для теста, а затем увеличить ресурсы без перехода на другой класс оборудования.

RTX PRO 6000 занимает позицию между массовыми GPU и специализированными HGX-системами. Она закрывает большинство корпоративных AI-сценариев, где не нужны HBM3e и обмен через NVLink.

NVIDIA A100 и A800 для зрелых ML-нагрузок

A100 (40 и 80 ГБ) и A800 (80 ГБ) построены на архитектуре NVIDIA Ampere. Эти ускорители применяются в проектах, которые уже протестированы и оптимизированы под данное поколение GPU.

Они подходят для обучения нейросетей, инференса, рекомендательных систем и обработки данных. При обучении к весам добавляются градиенты, состояния оптимизатора и активации — суммарное потребление видеопамяти может в несколько раз превышать объём, необходимый только для хранения весов модели. Поддержка MIG позволяет разделять карту на независимые инстансы с выделенной памятью и вычислительными блоками.

NVIDIA A16 для виртуальных рабочих мест

A16 разработана для VDI и графических корпоративных приложений. Её архитектура рассчитана на высокую плотность виртуальных рабочих мест.

Ускоритель подходит инженерам, дизайнерам и сотрудникам, которые используют профессиональные приложения через удалённый рабочий стол. Вычислительные ресурсы распределяются между несколькими пользователями через vGPU.

Как использовать один GPU для нескольких задач

Полный ускоритель может простаивать, если нагрузка не использует все его ресурсы. Для разделения GPU применяют vGPU, MIG и MIG-backed vGPU.

Time-slicing vGPU поочерёдно предоставляет ускоритель нескольким виртуальным машинам. Этот вариант подходит для разработки и нагрузок без жёстких требований к задержке. При одновременной активности ВМ они конкурируют за вычислительные ресурсы.

MIG делит физический GPU на аппаратно изолированные экземпляры. Каждый экземпляр получает собственные вычислительные блоки и память. MIG изолирует вычисления GPU и видеопамять, но общие ресурсы сервера — CPU, RAM, сеть и диски — могут стать узким местом.

MIG-backed vGPU объединяет аппаратную изоляцию MIG с управлением через платформу виртуализации. Виртуальная машина получает выделенную часть ускорителя и работает с ней как с обычным GPU. Этот режим подходит сервисам с требованиями к SLA и стабильной задержке.

Выбор механизма разделения зависит от характера нагрузки. Для разработки и нерегулярного инференса подходит time-slicing. Для production-сервисов с предсказуемой нагрузкой разумнее использовать MIG или MIG-backed vGPU.

Аренда GPU или собственное оборудование

Стоимость собственного GPU-сервера складывается не из одной карты. Компании потребуются серверная платформа, накопители, сеть, электропитание и система охлаждения. Инфраструктуру нужно разместить, настроить и обслуживать.

Оборудование также устаревает быстрее обычных серверных компонентов. При изменении модели или профиля нагрузки купленная конфигурация может перестать соответствовать проекту.

Аренда GPU снимает капитальные затраты на закупку. Провайдер отвечает за оборудование, мониторинг, замену компонентов и подготовку инфраструктуры. Команда получает вычислительные ресурсы и занимается моделью.

На старте можно использовать профиль RTX PRO 6000 для разработки. После подтверждения гипотезы можно увеличить профиль, перейти на полный GPU или выбрать H200. Для многоускорительного обучения доступна платформа NVIDIA HGX.

Локальная площадка в Ташкенте позволяет размещать данные внутри страны, когда это предусмотрено политиками компании или требованиями проекта.

Почему ассортимент GPU влияет на выбор провайдера

AI-проект редко остаётся в исходной конфигурации. После пилота растёт число пользователей, увеличивается контекст, меняются модели и требования к времени ответа.

Если у провайдера доступна одна модель GPU, команде приходится подстраивать архитектуру под оборудование. Например, квантизировать модель сильнее, чем планировалось, распределять её между неподходящими картами или переносить сервис после выхода в production.

Широкая линейка позволяет менять конфигурацию внутри одной инфраструктуры. Пилот можно запустить на vGPU-профиле на базе RTX PRO 6000 Blackwell Server Edition с 12 или 24 ГБ выделенной видеопамяти. При росте нагрузки можно перейти на профиль 48 ГБ или использовать полный ускоритель с 96 ГБ GDDR7. Для моделей, которым требуется больший объём и более высокая пропускная способность памяти, подходит NVIDIA H200. Для многоускорительного обучения в пределах одного вычислительного узла можно использовать HGX H200, а для распределённого обучения между несколькими узлами — кластер на базе HGX H200 с высокоскоростной сетью.

Что проверить при выборе провайдера

Нужно уточнить доступные профили памяти, поддержку MIG и vGPU, варианты выделенных серверов, наличие HGX и возможность увеличить ресурсы без полной перестройки среды.

Оцените данную статью

Subscribe to our mailing