Региональный интернет-провайдер в Ростове-на-Дону за полтора года увеличил абонентскую базу с 80 000 до 224 000 пользователей — рост на 180%. Основным драйвером стала экспансия в частный сектор и заключение договоров с тремя крупными жилыми комплексами. Биллинговая система работала на двух серверах 2018 года выпуска под управлением проприетарного ПО биллинга на СУБД PostgreSQL, подключённых к гибридной СХД.
Рост нагрузки вывел утилизацию CPU на 94% в часы пик — это означало, что серверы работали на пределе без запаса для пиковых всплесков. Трижды за квартал система давала задержки начисления: абонентам выставлялись корректировки и повторные списания. Жалобы в ФАС от абонентов и предписание от регулятора заставили ускорить решение вопроса.
Задача клиентаУстранить перегрузку биллинговой инфраструктуры без замены действующего ПО — переход на новую версию был запланирован на следующий год. Снизить утилизацию CPU до 50–60% и время транзакции до менее 50 мс. При этом не допустить простоя в переходный период: биллинг работает 24/7. Бюджет — 4 млн руб., срок поставки — 2 недели.
Ограничения и требованияБиллинговое ПО работало на конкретной версии RHEL и требовало совместимости платформы: смена архитектуры CPU исключалась. Существующая стойка в ЦОД была занята — новое оборудование должно было войти в не более 10U дополнительного пространства. Платёж — по счёту с НДС. Миграция данных — строго в плановое ночное окно обслуживания 01:00–05:00.
Что предложилиДва четырёхпроцессорных сервера 2U с 1 ТБ RAM и новую all-flash СХД 2U с 24 SSD SAS 3,84 ТБ — итого 77 ТБ нетто при RAID 5. Переход на all-flash был принципиальным: биллинговые транзакции — это OLTP-нагрузка с тысячами мелких случайных операций ввода-вывода в секунду. Гибридная СХД давала латентность 5–15 мс из-за обращений к HDD; all-flash — стабильные 0,3–0,5 мс. Подключение СХД через Fibre Channel 32G — новые HBA и FC-коммутатор. Переход на 4-процессорную платформу увеличивал количество ядер в 2,7 раза при совместимой архитектуре, что позволяло не трогать ПО.
Состав поставки по подсистемам- Вычисление: 2× сервер 2U, 4-процессорный, 4× Intel Xeon Platinum, 1 ТБ RAM ECC
- All-flash СХД: массив 2U, 24× SSD SAS 3,84 ТБ 12G, двойной контроллер
- Сеть хранения: FC-коммутатор 32G 8-портовый, 4× HBA FC 32G
- Питание: модульный ИБП 20 кВА (дополнительный модуль к действующему)
- Размещение: стойка 42U (замена существующей под новые размеры оборудования)
День 1–3: аудит действующей конфигурации — проверка совместимости платформы с RHEL и ПО биллинга, получение подтверждения от вендора ПО. День 4–6: выставление счёта, согласование закупки. День 7–12: комплектация, тест IOPS all-flash СХД на стенде — результат 480 000 IOPS при 4 КБ блоке. День 13: доставка в Ростов-на-Дону.
РезультатПосле ввода в эксплуатацию утилизация CPU упала с 94% до 41% — запас более 50% для пиковых всплесков. Время транзакции биллинга сократилось с 340 мс до 18 мс. За последующие 9 месяцев не было ни одного инцидента с некорректным начислением. Провайдер закрыл предписание ФАС и прекратил получать жалобы абонентов по вопросам биллинга. Итоговая стоимость — 3 900 000 руб. с НДС.
Почему выбрали насCTO провайдера нашёл ВИСТЛАН через рекомендацию коллеги из другого регионального оператора. Ключевым фактором стала готовность подобрать совместимую платформу под действующее биллинговое ПО, а не предлагать стандартный каталог без проверки. ВИСТЛАН получил официальное подтверждение от вендора ПО ещё до выставления счёта.
Детали перехода и риски миграцииКлючевым риском миграции был перенос БД биллинга без потери транзакций. Провайдер использовал PostgreSQL с репликацией streaming. Схема перехода: на новых серверах развернули реплику существующей БД в режиме read-only за 2 дня до переключения; в плановое ночное окно промотировали реплику в master за 12 секунд — точно в рамках 4-часового окна обслуживания. Биллинговые задания, которые выполнялись в момент переключения, завершились с задержкой 15 секунд — это технический простой, который не попал ни в одну метрику SLA.
All-flash СХД показала ожидаемые характеристики с первого дня. Тест fio непосредственно перед вводом в эксплуатацию показал 480 000 IOPS при блоке 4 КБ и латентности 0,28 мс — это примерно в 60 раз лучше, чем давала гибридная СХД. Транзакции СУБД, которые ранее ожидали I/O 5–15 мс, теперь получали данные за 0,3–0,5 мс. Это и стало главным источником снижения латентности биллинга с 340 до 18 мс.
FC-коммутатор 32G потребовал обновления зонирования: старые зоны FC с именами, содержащими MAC-адреса старых HBA, были переписаны под WWN новых HBA 32G. Операцию выполнил сетевой инженер провайдера за 40 минут — без остановки сервиса, так как зонирование менялось онлайн.
Мониторинг после внедренияПровайдер настроил Zabbix-мониторинг для новой инфраструктуры: утилизация CPU, IOPS СХД, латентность транзакций биллинга, температура компонентов. Порог оповещения по CPU установлен на 70% — это даёт запас 30% до критической зоны. За девять месяцев эксплуатации порог срабатывал только дважды — в дни акционных подключений, когда одновременно подключалось 8 000+ новых абонентов. Оба раза пик длился не более 20 минут и обошёлся без инцидентов.
Плановое развитие инфраструктурыПосле успешной модернизации биллинга провайдер поставил следующую задачу: перенести инфраструктуру AAA-сервера (RADIUS) с устаревшего оборудования на новую платформу. Опыт сотрудничества с ВИСТЛАН при модернизации биллинга дал основание для повторного обращения. Новый запрос включал два сервера под RADIUS Freeradius + PostgreSQL с той же концепцией: all-flash СХД для «горячей» БД сессий. Этот проект был реализован спустя 4 месяца после биллингового. Сейчас обе системы — биллинг и AAA — работают на инфраструктуре, поставленной ВИСТЛАН, суммарно обслуживая более 224 000 абонентов в режиме 24/7 без инцидентов. IT-инфраструктура провайдера прошла путь от «вечно перегруженной» до «с запасом» менее чем за год.
Оговорка: кейс носит иллюстративный характер. Совместимость с конкретным ПО проверяется индивидуально.