Построение резервного ЦОД — задача, в которой цена ошибки при выборе оборудования измеряется часами простоя бизнеса и штрафами регулятора. Казанская страховая компания с федеральной лицензией получила предписание надзорного органа: документально подтверждённое и протестированное RTO при переходе на резервную площадку — не более 15 минут. Без выполнения этого требования компания не могла пройти плановую инспекцию. Действующая ИТ-инфраструктура располагалась только на одной площадке, что являлось прямым нарушением требований непрерывности деятельности страховщиков. На момент обращения к нам оставалось 6 недель до инспекции — жёсткие временны́е рамки для проектирования, поставки и тестирования полноценного резервного ЦОД. Действующий ИТ-директор страховщика принял решение не тратить время на тендерные процедуры и обратился напрямую к проверенному поставщику серверного оборудования.
Задача клиентаСоздать резервный ЦОД, зеркально повторяющий основную площадку по составу оборудования: 6 серверов виртуализации, All-Flash СХД с синхронной репликацией данных, идентичная сетевая фабрика. Полное переключение всех сервисов страховщика на резервную площадку — не более 15 минут при ручном или автоматическом failover. Оборудование — только новое с действующей гарантией производителя: подержанное и восстановленное исключено требованием ИБ-службы страховой компании. Полный пакет документов для надзорного органа обязателен.
Ограничения и требования- Площадка резервного ЦОД — арендованная серверная в 40 км от главного офиса, трёхфазный ввод 32А.
- Канал связи между площадками — 10 Гбит/с DWDM с задержкой 0,3 мс: достаточно для синхронной репликации СХД при требовании RTT не более 5 мс.
- Нестандартные стойки 47U на резервной площадке вместо стандартных 42U — учтено при заказе рельс и кабельных лотков.
- Две партии с интервалом 5 дней: сначала основная площадка (доукомплектование), затем резервная.
- Полный пакет документов для инспекции надзорного органа: сертификаты, паспорта, УПД, декларации о происхождении.
Платформа на процессорах AMD EPYC 9354 (32 ядра, 3,25 ГГц) — высокое число ядер снижает стоимость лицензий VMware при лицензировании по сокетам. Шесть идентичных узлов дают суммарно 384 ядра на площадку — достаточно для 150+ ВМ страховых сервисов с запасом при резервировании 25% ресурсов под одновременный отказ двух узлов. All-Flash СХД на 24 NVMe-слота U.2 с двумя активными контроллерами 25GbE обеспечивает задержку I/O менее 200 мкс — идентичная производительность на обеих площадках при failover критична для АБС страховщика.
Синхронная репликация на уровне СХД: каждая операция записи подтверждается контроллерами на обеих площадках перед возвратом подтверждения приложению. При задержке DWDM-канала 0,3 мс дополнительная латентность приложений составляет менее 1 мс — незаметна для пользователей. RPO = 0: ни одна подтверждённая транзакция не теряется при отказе основной площадки. Для менее критичных томов настроена асинхронная репликация с RPO 15 минут — это снижает нагрузку на канал без ущерба для восстановимости данных.
Сетевая фабрика — четыре коммутатора 25GbE по два на каждую площадку в стеке с MLAG: каждый сервер подключён двумя портами 25GbE, что обеспечивает агрегацию канала и отказоустойчивость при потере одного коммутатора. Репликационный трафик СХД изолирован в отдельный VLAN с гарантированной полосой 5 Гбит/с — не конкурирует с пользовательским LAN. Управляемые PDU с дистанционным переключением питания позволяют перезагружать зависший сервер резервного ЦОД без физического присутствия — особенно важно при нахождении площадки в 40 км от главного офиса.
Документационное обеспечение для инспекции надзорного органа — самостоятельная задача. Проверяющие требуют полный пакет: технические паспорта каждой единицы оборудования с действующим сроком гарантии производителя, сертификаты соответствия, декларации о стране происхождения, схему резервирования с описанием порядка переключения, протокол последнего учебного тестирования failover с подписями ответственных лиц. Для нашей поставки полный документационный пакет на каждую позицию сформирован заранее — ИТ-команда страховщика передала его проверяющим в первый же день инспекции без единого запроса дополнительных документов.
Мониторинг состояния резервного ЦОД в режиме 24/7 реализован через IPMI-интерфейсы всех шести серверов и SNMP-агенты ИБП: ИТ-команда в главном офисе видит статус питания, температуру, состояние дисков и утилизацию ресурсов резервной площадки в единой консоли мониторинга. При любом отклонении от нормы — перегреве стойки, просадке напряжения, деградации диска в СХД — ответственный сотрудник получает алерт немедленно. Автоматическая проверка актуальности репликации СХД запускается каждые 6 часов: скрипт сверяет контрольные блоки данных на обеих площадках и при любом расхождении формирует критический алерт. Это гарантирует, что в момент реального инцидента репликация будет актуальной, а не зависшей с необнаруженным расхождением данных, о котором никто не узнал бы до самого failover.
Состав поставки по подсистемам- Вычисление: 6 серверов 2U AMD EPYC 9354, 512 ГБ DDR5 ECC, 2×25GbE SFP28 на каждый узел.
- Хранение: 2 All-Flash СХД 2U (по одной на площадку), 24×NVMe U.2 3,84 ТБ, синхронная репликация через выделенный VLAN.
- Сеть: 4 коммутатора 25GbE 32-port SFP28 + 32 трансивера SR OM4 100 м.
- Питание: 2 ИБП 20 кВА трёхфазных он-лайн, 4 управляемые PDU 32А трёхфазные.
- Стойки: 2 стойки 19" 47U с системой кабель-менеджмента.
- День 1–2: Раздельные спецификации на обе площадки с учётом нестандартных стоек 47U, единый счёт с НДС, подтверждение оплаты.
- День 3–8: Параллельная сборка двух партий, прошивка, тест на стенде, подготовка документационного пакета для надзорного органа.
- День 9–10: Отгрузка первой партии (основная площадка), доставка в Казань.
- День 11–14: Отгрузка и доставка второй партии (резервная площадка), приёмка, подписание всех документов.
Через 10 дней после приёмки ИТ-команда страховщика провела учебное переключение по регламенту надзорного органа: принудительное отключение питания основной площадки. Все 87 ВМ перешли на резервный ЦОД за 12 минут — требование RTO 15 минут выполнено с запасом 3 минуты. RPO = 0 подтверждён: ни одна подтверждённая транзакция не потеряна. Страховая компания прошла плановую инспекцию без единого замечания по ИТ-инфраструктуре.
Экономия к бюджету составила 10% — результат консолидации двух лотов в один заказ и оптовых цен на партию от 6 серверов. Управляемые PDU с дистанционным переключением позволяют перезагружать серверы резервной площадки из любой точки мира, исключив из операционных процессов плановые поездки для обслуживания в 40 км от офиса.
Спустя два месяца сработал первый реальный тест надёжности: плановые регламентные работы энергетиков на основной площадке с частичным отключением питания. Система автоматически перешла на резервный ЦОД за 9 минут, пользователи не заметили переключения. Возврат на основную площадку после восстановления питания прошёл за 7 минут в плановом режиме — без потери данных и без участия дежурного специалиста на резервной площадке. Плановые ежеквартальные проверки failover включены в утверждённый регламент ИТ-службы страховщика — результаты каждой плановой проверки фиксируются в журнале надёжности и хранятся в течение трёх лет для предъявления при следующей надзорной инспекции.
Почему выбрали нас- Опыт поставок оборудования для резервных ЦОД страховых компаний с требованиями надзорного органа с 2006 года.
- Полный пакет документов для инспекций ЦБ РФ: сертификаты, паспорта, УПД, декларации о происхождении — сформирован заранее, без запросов со стороны заказчика.
- Параллельная комплектация двух площадок без задержек — обе партии готовы одновременно. Сборка и тест каждой партии идут параллельно, что не увеличивает общий срок поставки по сравнению с однолотовым заказом.
- Оптовые цены на партии от 6 серверов, единый счёт с НДС, работа с юрлицами финансового сектора с 2006 года. Знаем специфику требований страхового рынка и надзорных процедур ЦБ РФ по непрерывности деятельности.
Данные приведены справочно и не являются публичной офертой. Актуальные цены, наличие и сроки поставки уточняйте при оформлении заказа.