Компания-разработчик корпоративного ПО для управления промышленными предприятиями в Санкт-Петербурге обслуживает 35 корпоративных клиентов по всей России. Ключевые конкурентные преимущества — высокая доступность системы и SLA 99,9% по договорам. Компания арендует офис в бизнес-центре на Петроградской стороне и содержит собственный мини-ЦОД: 4 физических сервера на VMware vSphere 8, 62 виртуальные машины клиентов, два NAS-массива суммарной ёмкостью 240 ТБ, коммутаторы и средства защиты сети. Физического дежурного в офисе нет с 21:00 до 09:00 и в выходные дни — команда DevOps работает удалённо.
За 12 месяцев случились два критических инцидента. Первый: отключение электроснабжения на 4 минуты в воскресенье ночью — устаревший ИБП 2000 ВА исчерпал батарею за 3,5 минуты; гипервизор обесточен, три виртуальные машины с базами данных 1С клиентов повреждены. Восстановление заняло 4 часа; три клиента получили штрафы по SLA на сумму 240 000 рублей. Второй инцидент через 6 месяцев: просадка напряжения во время деловой встречи — сервер перезагрузился, час рабочего времени четырёх разработчиков потерян. Руководство решило: вопрос с питанием решать немедленно и правильно.
Задача клиентаCTO компании сформулировал задачу: два ИБП в конфигурации N+1, автономия достаточная для graceful shutdown всех 62 VM при длительном отключении, облачный мониторинг без VPN в офис (команда работает из разных городов), горячая замена батарей без привлечения подрядчика, интеграция с VMware vSphere 8 для автоматического останова VM.
Ограничения и требованияНагрузка мини-ЦОД: 4 сервера VMware (суммарно 3,4 кВт в обычном режиме, до 4,1 кВт в пиковой нагрузке) + 2 NAS-массива (0,9 кВт) + коммутаторы, UTM-файервол и KVM (0,4 кВт). Итого 4,7 кВт пиковая нагрузка. Стойка 24U — свободны 8U. Требования к времени graceful shutdown: по SLA клиентов, сохранение данных VM должно занимать не более 10 минут. 62 VM при параллельном останове в 8 группах — 8 × 1,5 мин = 12 минут. Требуемая автономия с запасом — не менее 15 минут при 100% нагрузке.
Что предложилиДва ИБП 5000 ВА / 5000 Вт online в параллельной конфигурации N+1. Суммарная мощность 10 кВА; при пиковой нагрузке 4,7 кВт загрузка 47% — один ИБП несёт нагрузку как горячий резерв. При отказе основного — мгновенный переход без прерывания питания.
Расчёт автономии: к каждому ИБП подключено по два батарейных модуля 96 В / 28 А·ч (горячая замена). Суммарная ёмкость: 4 × 96 × 28 × 0,85 = 9 139 Вт·ч. При пиковой нагрузке 4,7 кВт: 9 139 / 4 700 × 60 = 117 минут (1,95 часа). Graceful shutdown начинается при 40% остатке батарей — то есть примерно через 70 минут работы от батарей. К этому моменту все 62 VM успевают остановиться за 12 минут, данные сохранены, гипервизор выключается штатно.
Облачный мониторинг через встроенный Ethernet-порт ИБП: телеметрия (нагрузка, напряжение, ёмкость батарей, температура, события) отправляется в облачный портал производителя каждые 30 секунд. Настроены push-уведомления в Telegram-канал DevOps-команды: переход на батарею → немедленный алерт; ёмкость ниже 60% → предупреждение; начало graceful shutdown → критический алерт. Вся команда из любой точки мира видит состояние мини-ЦОД в режиме реального времени.
Лицензия ПО graceful shutdown для VMware vSphere настроена: при ёмкости батарей 40% агент начинает последовательный останов VM в 8 группах приоритетности (сначала тестовые среды, затем dev, затем БД клиентов). Сами серверы VMware выключаются последними — уже когда все VM остановлены.
Управляемые PDU с мониторингом на розетку дают CTO возможность видеть потребление каждого сервера и при необходимости удалённо выключить неиспользуемые виртуальные хосты для снижения нагрузки при длительной работе от батарей.
Состав поставки- 2 × ИБП стоечный 2U 5000 ВА / 5000 Вт, online, облачный мониторинг, Ethernet
- 4 × батарейный модуль 2U, 96 В / 28 А·ч, горячая замена
- 2 × PDU управляемая 1U, 8×C13 + 2×C19, мониторинг на розетку, SNMP
- 2 × лицензия ПО graceful shutdown VMware vSphere / Hyper-V
- 2 × USB-кабель A–B для резервного подключения
- 6 × кабель силовой C19–C20, 2 м
День 1: онлайн-консультация с CTO — опросный лист по нагрузке, версии VMware, требованиям к уведомлениям. День 2: спецификация и счёт. День 3: оплата. Дни 4–5: комплектация и проверка лицензий. День 5: отгрузка. День 6 (следующий рабочий день): прибытие в Санкт-Петербург. Монтаж и настройка graceful shutdown — 4 часа. Тест облачного мониторинга и Telegram-уведомлений — 30 минут.
РезультатЧерез 23 дня после ввода в эксплуатацию произошло отключение на 9 минут. Graceful shutdown не понадобился — батарей хватило с огромным запасом. Все 62 VM продолжали работать. При восстановлении питания ИБП автоматически перешёл обратно на сеть. Облачный портал зафиксировал событие; команда получила уведомление в Telegram через 12 секунд после начала работы от батарей и уведомление о восстановлении питания через 9 минут.
Через полтора года после ввода в эксплуатацию произошло более серьёзное отключение — 67 минут. Graceful shutdown сработал штатно: через 70 минут работы от батарей все 62 VM остановлены за 11 минут, гипервизор выключен. Ни одной потери данных. При восстановлении питания серверы поднялись автоматически за 14 минут. Клиенты не заметили инцидента. SLA 99,9% сохранён.
Почему выбрали насCTO выбрал ВИСТЛАН за наличие лицензий graceful shutdown для VMware в стоке — многие поставщики их не держат. Менеджер разобрался в специфике VMware vSphere 8 и предложил правильную модель ИБП с нативной интеграцией через агент. Полный комплект доставлен за 5 дней — в 2 раза быстрее альтернативных предложений. Общая экономия — 9%.
Архитектура высокой доступности для небольшого мини-ЦОДДля небольшой IT-компании важно строить отказоустойчивость не только на уровне электропитания, но и на уровне всей инфраструктуры. Установка ИБП в конфигурации N+1 стала поводом для комплексного аудита архитектуры высокой доступности мини-ЦОД.
По итогам аудита выявлено и исправлено: серверы VMware были сконфигурированы без vSphere HA — при отказе физического хоста VM не перезапускались автоматически. После включения vSphere HA и настройки правил допуска мини-ЦОД получил реальную защиту не только от сбоев питания, но и от отказа физического сервера. Настройка vMotion позволила живую миграцию VM при плановом обслуживании серверов без останова. Резервное копирование на внешний NAS-ресурс в другом здании настроено через Veeam Backup по расписанию каждые 4 часа.
Таким образом, проект по установке ИБП вырос в комплексный проект повышения доступности сервисов. Стоимость дополнительных работ (настройка vHA, vMotion, Veeam) силами собственного системного администратора — около 40 часов рабочего времени. Результат: мини-ЦОД перешёл с уровня доступности «лучшее усилие» на уровень 99,9% с документированными RPO и RTO по каждому сервису.
Graceful Shutdown: настройка порядка останова VMПравильная настройка порядка останова виртуальных машин при graceful shutdown — отдельная инженерная задача. В мини-ЦОД компании-разработчика 62 VM разделены на 8 групп приоритетности: группа 1 — тестовые и dev-окружения (останавливаются первыми), группы 2–4 — серверы приложений клиентов с низким приоритетом, группы 5–6 — серверы приложений с высоким приоритетом, группа 7 — серверы баз данных (останавливаются предпоследними с форсированным коммитом транзакций), группа 8 — серверы мониторинга и логирования (останавливаются последними). Между группами — пауза 90 секунд для завершения зависимых процессов. Суммарное время останова 62 VM: 8 групп × 90 с + 8 × 60 с (среднее время останова группы) = 720 + 480 = 1200 с = 20 минут. При автономии 117 минут — комфортный запас в 5,8 раза.
Оговорка: кейс описывает типовой проект; наименование компании и точные параметры изменены в целях конфиденциальности. Реальные результаты зависят от конфигурации объекта.