Аналитический центр в Новосибирске специализировался на прогнозной аналитике для промышленных заказчиков: завод, химкомбинат, нефтесервисная компания — все они передавали исторические данные и получали модели поведения оборудования, прогнозы спроса и сценарии оптимизации. Команда из 12 специалистов по данным работала в тесном взаимодействии с заказчиками, и каждый новый контракт требовал итерационного обучения моделей — несколько прогонов в день с разными гиперпараметрами. На практике это означало, что вечером датасайентист запускал задачу, а утром приходил к результатам. Цикл «обучить — оценить — скорректировать» растягивался на двое суток вместо нескольких часов.
Конкурентная среда менялась быстро: заказчики начинали сравнивать скорость получения результатов между несколькими аналитическими компаниями. Центр рисковал проигрывать в тендерах не по качеству моделей, а по срокам пилотов.
Задача клиентаСократить время обучения ML-моделей до 2 часов без потери точности, консолидировать вычислительные мощности в единый управляемый узел и уложиться в бюджет 5 млн руб. включая НДС. Оборудование должно было встать в действующую стойку 42U и подключиться к 10GbE-сети без перекладки кабельной инфраструктуры. Дополнительное требование руководства — возможность горизонтального расширения количества GPU в будущем без замены материнской платы: планировалось дооснащение ещё двумя ускорителями через год.
Ограничения и требованияКлиент работал исключительно по безналичному расчёту с НДС — это условие автоматически исключало физических поставщиков и серый импорт. Оборудование требовалось в рабочем состоянии не позже чем через две недели: в этот срок центр должен был сдать промежуточный результат федеральному заказчику по действующему контракту. Задержка грозила штрафными санкциями. Ещё одно ограничение — уровень энергопотребления: серверное помещение центра имело выделенную мощность 20 кВт, поэтому конфигурацию требовалось вписать в допустимый бюджет электроэнергии с учётом действующего оборудования.
Что предложилиМы предложили двухпроцессорную платформу на базе Intel Xeon Gold с четырьмя ускорителями NVIDIA в конфигурации NVLink. Такая топология позволяет ускорителям обмениваться данными напрямую по шине NVLink с пропускной способностью 600 ГБ/с — без обращения к CPU и системной шине, что критично при обучении моделей с большими тензорами. 512 ГБ оперативной памяти DDR5 исключали узкое место при загрузке больших датасетов в память перед подачей на GPU. Хранение данных — пара NVMe-накопителей 3,84 ТБ в RAID 1 на аппаратном RAID-контроллере PCIe Gen4: скорость последовательного чтения датасета превышала 12 ГБ/с. Для защиты от потери питания предложили ИБП 3000 ВА. Серверная стойка — стандартная 42U, совместимая с действующим шкафом клиента.
Состав поставки по подсистемам- Вычисление: 1× двухпроцессорный сервер, 2× Intel Xeon Gold, 512 ГБ RAM DDR5 ECC
- Ускорение: 4× GPU NVIDIA A-серии, мостики NVLink, система охлаждения
- Хранение: 2× NVMe 3,84 ТБ PCIe Gen4, аппаратный RAID-контроллер
- Сеть: 1× 10GbE SFP+ коммутатор 8 портов, патч-корды DAC
- Питание и защита: 1× ИБП 3000 ВА онлайн-типа, 2× резервных блока питания сервера
- Монтаж: серверная стойка 42U, кабельные органайзеры 1U × 3 шт., рельсы для сервера
День 1–2: получение запроса, уточнение конфигурации с технической командой центра — проверка совместимости GPU с действующим фреймворком TensorFlow и требованиями CUDA. День 3–4: согласование спецификации и выставление счёта. День 5: оплата и резервирование позиций на складе. День 6–10: комплектация заказа, тестовый прогон синтетических ML-задач на стенде, измерение потребления. День 11: упаковка и документы. День 12–13: отгрузка и транспортировка. День 14: получение на складе клиента в Новосибирске. Итого 14 календарных дней от первого контакта — в рамках критического срока.
РезультатПосле монтажа и настройки силами IT-специалистов центра первый прогон ML-модели на реальном датасете занял 1 час 28 минут вместо прежних 14 часов — ускорение в 9,5 раза. Семь рабочих станций были выведены из эксплуатации: потребление электроэнергии в машинном зале снизилось на 38%, что составило около 85 000 руб. в год экономии на электричестве. Центр выполнил обязательства перед федеральным заказчиком в срок и получил высокую оценку за оперативность. Цикл «обучить — оценить — скорректировать» сократился с двух суток до полутора часов: теперь за рабочий день датасайентист успевает сделать 4–5 итераций вместо одной. Общая стоимость поставки составила 4 750 000 руб. с НДС — на 250 000 руб. ниже первоначального бюджета за счёт оптимизации конфигурации.
Почему выбрали насКлиент обратился в ВИСТЛАН после того, как двое других поставщиков не смогли подтвердить наличие GPU на складе и предложили срок 4–6 недель. Мы подтвердили наличие в день обращения и выставили счёт в течение часа. Параллельно провели технический аудит совместимости: GPU сертифицированы под действующую версию CUDA и операционную систему центра. Работаем с юрлицами с 2006 года, оплата строго по счёту с НДС, закрывающие документы — в полном комплекте оригиналами.
Технические детали внедренияПосле доставки оборудования IT-команда центра выполнила монтаж в стойку самостоятельно за один рабочий день. Сервер был подключён к 10GbE-сети через SFP+-порт и интегрирован в действующую инфраструктуру без настройки дополнительных VLAN. Для GPU была установлена актуальная версия CUDA Toolkit и cuDNN, совместимая с используемой версией TensorFlow. Датасеты объёмом до 800 ГБ хранились непосредственно на NVMe-массиве: время загрузки датасета в оперативную память сократилось с 18 минут до 2,3 минуты. Первый прогон боевой задачи — обучение модели прогнозирования временного ряда промышленного оборудования на датасете 650 ГБ — занял 1 час 28 минут. До этого аналогичная задача на семи рабочих станциях в параллельном режиме занимала 14 часов.
Особого внимания заслуживает вопрос охлаждения. GPU под нагрузкой выделяют значительное тепло: суммарное тепловыделение четырёх ускорителей достигало 1,4 кВт. Серверное помещение центра имело кондиционер на 5 кВт, что с запасом перекрывало нагрузку. Температура GPU в штатном режиме работы не превышала 78 °C — в пределах нормы. Система мониторинга Prometheus + Grafana, развёрнутая командой, отслеживала температуру, потребление и утилизацию GPU в реальном времени.
Для защиты данных датасетов настроена политика репликации: каждые 6 часов изменённые файлы копируются на отдельный SATA SSD резервного сервера по rsync. Это обеспечивает RPO не более 6 часов для подготовленных датасетов без необходимости дополнительной СХД.
Дополнительные эффектыПомимо ускорения обучения, консолидация вычислений в один узел дала побочные преимущества. Управление конфигурациями и зависимостями значительно упростилось: вместо поддержки семи разных окружений на рабочих станциях — единая среда на сервере с Docker-контейнерами. Версионирование экспериментов через MLflow стало возможным без усилий по синхронизации результатов между машинами. Специалисты по данным начали запускать задачи удалённо через Jupyter Lab, не занимая при этом собственные рабочие места. Это освободило время для аналитической работы вместо ожидания результатов прогонов.
Оговорка: кейс носит иллюстративный характер. Наименования вендоров, точные конфигурации и итоговые цифры согласовываются индивидуально и зависят от актуального наличия на складе.