Перейти к содержимому

Кейс · Серверы и СХД

GPU-сервер для обучения ML-моделей в аналитическом центре

Аналитический центр в Новосибирске обучал модели на рабочих станциях — ночные прогоны занимали 14 часов. После поставки двухпроцессорного GPU-сервера время сократилось до 1,5 часа.

0
позиций в поставке
0
дней до поставки
0%
экономия клиента
0
сумма проекта, ₽

Коротко о проекте

Что поставили

шт.
шт.
шт.
шт.
шт.
шт.
шт.

Аналитический центр в Новосибирске специализировался на прогнозной аналитике для промышленных заказчиков: завод, химкомбинат, нефтесервисная компания — все они передавали исторические данные и получали модели поведения оборудования, прогнозы спроса и сценарии оптимизации. Команда из 12 специалистов по данным работала в тесном взаимодействии с заказчиками, и каждый новый контракт требовал итерационного обучения моделей — несколько прогонов в день с разными гиперпараметрами. На практике это означало, что вечером датасайентист запускал задачу, а утром приходил к результатам. Цикл «обучить — оценить — скорректировать» растягивался на двое суток вместо нескольких часов.

Конкурентная среда менялась быстро: заказчики начинали сравнивать скорость получения результатов между несколькими аналитическими компаниями. Центр рисковал проигрывать в тендерах не по качеству моделей, а по срокам пилотов.

Задача клиента

Сократить время обучения ML-моделей до 2 часов без потери точности, консолидировать вычислительные мощности в единый управляемый узел и уложиться в бюджет 5 млн руб. включая НДС. Оборудование должно было встать в действующую стойку 42U и подключиться к 10GbE-сети без перекладки кабельной инфраструктуры. Дополнительное требование руководства — возможность горизонтального расширения количества GPU в будущем без замены материнской платы: планировалось дооснащение ещё двумя ускорителями через год.

Ограничения и требования

Клиент работал исключительно по безналичному расчёту с НДС — это условие автоматически исключало физических поставщиков и серый импорт. Оборудование требовалось в рабочем состоянии не позже чем через две недели: в этот срок центр должен был сдать промежуточный результат федеральному заказчику по действующему контракту. Задержка грозила штрафными санкциями. Ещё одно ограничение — уровень энергопотребления: серверное помещение центра имело выделенную мощность 20 кВт, поэтому конфигурацию требовалось вписать в допустимый бюджет электроэнергии с учётом действующего оборудования.

Что предложили

Мы предложили двухпроцессорную платформу на базе Intel Xeon Gold с четырьмя ускорителями NVIDIA в конфигурации NVLink. Такая топология позволяет ускорителям обмениваться данными напрямую по шине NVLink с пропускной способностью 600 ГБ/с — без обращения к CPU и системной шине, что критично при обучении моделей с большими тензорами. 512 ГБ оперативной памяти DDR5 исключали узкое место при загрузке больших датасетов в память перед подачей на GPU. Хранение данных — пара NVMe-накопителей 3,84 ТБ в RAID 1 на аппаратном RAID-контроллере PCIe Gen4: скорость последовательного чтения датасета превышала 12 ГБ/с. Для защиты от потери питания предложили ИБП 3000 ВА. Серверная стойка — стандартная 42U, совместимая с действующим шкафом клиента.

Состав поставки по подсистемамЭтапы и сроки

День 1–2: получение запроса, уточнение конфигурации с технической командой центра — проверка совместимости GPU с действующим фреймворком TensorFlow и требованиями CUDA. День 3–4: согласование спецификации и выставление счёта. День 5: оплата и резервирование позиций на складе. День 6–10: комплектация заказа, тестовый прогон синтетических ML-задач на стенде, измерение потребления. День 11: упаковка и документы. День 12–13: отгрузка и транспортировка. День 14: получение на складе клиента в Новосибирске. Итого 14 календарных дней от первого контакта — в рамках критического срока.

Результат

После монтажа и настройки силами IT-специалистов центра первый прогон ML-модели на реальном датасете занял 1 час 28 минут вместо прежних 14 часов — ускорение в 9,5 раза. Семь рабочих станций были выведены из эксплуатации: потребление электроэнергии в машинном зале снизилось на 38%, что составило около 85 000 руб. в год экономии на электричестве. Центр выполнил обязательства перед федеральным заказчиком в срок и получил высокую оценку за оперативность. Цикл «обучить — оценить — скорректировать» сократился с двух суток до полутора часов: теперь за рабочий день датасайентист успевает сделать 4–5 итераций вместо одной. Общая стоимость поставки составила 4 750 000 руб. с НДС — на 250 000 руб. ниже первоначального бюджета за счёт оптимизации конфигурации.

Почему выбрали нас

Клиент обратился в ВИСТЛАН после того, как двое других поставщиков не смогли подтвердить наличие GPU на складе и предложили срок 4–6 недель. Мы подтвердили наличие в день обращения и выставили счёт в течение часа. Параллельно провели технический аудит совместимости: GPU сертифицированы под действующую версию CUDA и операционную систему центра. Работаем с юрлицами с 2006 года, оплата строго по счёту с НДС, закрывающие документы — в полном комплекте оригиналами.

Технические детали внедрения

После доставки оборудования IT-команда центра выполнила монтаж в стойку самостоятельно за один рабочий день. Сервер был подключён к 10GbE-сети через SFP+-порт и интегрирован в действующую инфраструктуру без настройки дополнительных VLAN. Для GPU была установлена актуальная версия CUDA Toolkit и cuDNN, совместимая с используемой версией TensorFlow. Датасеты объёмом до 800 ГБ хранились непосредственно на NVMe-массиве: время загрузки датасета в оперативную память сократилось с 18 минут до 2,3 минуты. Первый прогон боевой задачи — обучение модели прогнозирования временного ряда промышленного оборудования на датасете 650 ГБ — занял 1 час 28 минут. До этого аналогичная задача на семи рабочих станциях в параллельном режиме занимала 14 часов.

Особого внимания заслуживает вопрос охлаждения. GPU под нагрузкой выделяют значительное тепло: суммарное тепловыделение четырёх ускорителей достигало 1,4 кВт. Серверное помещение центра имело кондиционер на 5 кВт, что с запасом перекрывало нагрузку. Температура GPU в штатном режиме работы не превышала 78 °C — в пределах нормы. Система мониторинга Prometheus + Grafana, развёрнутая командой, отслеживала температуру, потребление и утилизацию GPU в реальном времени.

Для защиты данных датасетов настроена политика репликации: каждые 6 часов изменённые файлы копируются на отдельный SATA SSD резервного сервера по rsync. Это обеспечивает RPO не более 6 часов для подготовленных датасетов без необходимости дополнительной СХД.

Дополнительные эффекты

Помимо ускорения обучения, консолидация вычислений в один узел дала побочные преимущества. Управление конфигурациями и зависимостями значительно упростилось: вместо поддержки семи разных окружений на рабочих станциях — единая среда на сервере с Docker-контейнерами. Версионирование экспериментов через MLflow стало возможным без усилий по синхронизации результатов между машинами. Специалисты по данным начали запускать задачи удалённо через Jupyter Lab, не занимая при этом собственные рабочие места. Это освободило время для аналитической работы вместо ожидания результатов прогонов.

Оговорка: кейс носит иллюстративный характер. Наименования вендоров, точные конфигурации и итоговые цифры согласовываются индивидуально и зависят от актуального наличия на складе.

Частые вопросы

Можно ли дообучить сервер дополнительными GPU позже?

Да, шасси имеет свободные слоты PCIe. Расширение возможно без замены платформы.

Как осуществляется оплата серверного оборудования?

Выставляем счёт с НДС 20%. Оплата по безналу. Закрывающие документы — оригиналы почтой.

Поставляете ли вы оборудование в Новосибирск?

Да, доставляем по всей России транспортными компаниями или курьером — по договорённости.

Что входит в гарантию?

Гарантия производителя 3 года NBD. При отказе компонента — замена на следующий рабочий день.

Нужна ли серверная комната?

Стойка 42U вписывается в серверный шкаф или отдельный технический отсек. Требования — стандартные: 19", 220 В, температура до +25 °С.

Посчитайте свою экономию

При подборе под задачу и спец-ценах от производителя экономия по этому кейсу — 18%. Двигайте бюджет и смотрите вашу выгоду.

Ваш бюджет на оборудование1 000 000
100 тыс ₽20 млн ₽
Ваша экономия
180 000
Итого к оплате
820 000
Подобрать решение под мою задачу

Оценка ориентировочная. Точную цену и срок подтвердит менеджер.

Нужно похожее решение?

Опишите задачу — подберём оборудование с оптовыми ценами, сроками и наличием. Регистрация не нужна.

Кейс приведён для примера, данные обезличены. Состав, цены, сроки и экономия носят справочный характер, не являются публичной офертой и не гарантируют аналогичный результат — каждый проект рассчитывается индивидуально, наличие и цены подтверждаются при оформлении заказа.