Геораспределённый отказоустойчивый ИТ‑контур в двух ЦОД EFSOL для розничной сети формата 24/7
Профиль клиента
Отрасль Розничная торговля (offline + online)
Масштаб Сеть из более чем 20 торговых точек, центральный склад, интернет-магазин
Режим работы Магазины и склад: 8:00–23:00. Онлайн-канал: 24/7. Ночные служебные обмены данными
Учётные системы 1С:Предприятие (клиент-серверный режим), Клеверенс, система лояльности
Цель проекта
Исключить простои бизнеса, обеспечить непрерывную работу касс и актуальность остатков
Бизнес-задача
Перед командой стояла задача обеспечить непрерывность критичных для бизнеса процессов и убрать любые сценарии, при которых клиент может остаться без обслуживания на кассе или потерять заказ в онлайне:
- исключить простой магазинов и формирование очередей за счёт постоянной доступности касс и учётной системы;
- сохранить удовлетворённость покупателей — никакого «торможения» УС, корректная работа системы лояльности;
- поддерживать актуальные остатки товаров в режиме online — единая картина по всей сети и складу;
- обеспечить целостность ночных обменов между служебными сервисами без влияния на дневной контур.
Предпосылки решения
Доступность и производительность учётной системы, актуальность данных и непрерывность работы вспомогательных сервисов задают жёсткие требования к архитектуре. Многоканальные продажи (магазины + онлайн) фактически переводят бизнес в режим 24/7: даже короткое окно недоступности означает потерю выручки и репутации. Использование централизованной учётной системы обеспечивает актуальность остатков в любой момент времени, но одновременно повышает требования к отказоустойчивости центрального контура — он становится единой точкой, от которой зависят все каналы продаж.
Что входит в периметр критически важных сервисов?
Общий контур учета: Учетная система на платформе 1С:Предприятие
Розничная торговля:
- Розничные точки с рабочим местом кассира
- Сервисы маркировки
- Складская логистика для онлайн заказов и внутри сети
Работа склада с программным обеспечением Кливеренс и терминалами сбора данных
Обмены, источник актуальности Обмен с сайтом и маркетплейсам, через которые строится онлайн розница
Ключевые риски, которые требовалось закрыть
Отсутствие возможности оперативного восстановления учётной системы, риск падения канала связи между магазином и центральной инфраструктурой, риск физической потери оборудования в локации размещения (пожар, отключение питания, авария ЦОДа).
Реализация
В рамках обследования выявлены критические точки и предложено комплексное решение — геораспределённый отказоустойчивый кластер с парой узлов в каждом из двух независимых ЦОД EFSOL (ЦОД‑1 и ЦОД‑2). На уровне инфраструктуры использован стандартный стек Microsoft — Windows Server Failover Cluster, AD, IIS, TS Broker. На стороне магазинов добавлен резервный канал связи на базе LTE.
Геораспределение как основа схемы
Это не локальный кластер с резервной копией, а единый кластер, узлы которого физически расположены в разных дата‑центрах. Отказ одного ЦОД целиком — питание, охлаждение, магистральный канал, физический инцидент — не приводит к остановке учётной системы: нагрузка автоматически продолжается на узлах второго ЦОД.
Особенности кластерной схемы
Все ключевые роли реализованы как кластер с парой узлов в разных ЦОД. Ниже — состав:
- SQL‑серверы — единое хранилище данных, синхронизированное между ЦОД‑1 и ЦОД‑2; кластер Microsoft SQL Server с единым виртуальным IP и базой данных. При сбое основного узла запросы автоматически переводятся на узел во втором ЦОД.
- Серверы 1С:Предприятия — отказоустойчивый кластер 1С:Предприятия.
- Веб‑сервер (IIS) — ферма IIS с узлами в обоих ЦОД, с балансировкой между ними.
- Терминальный сервер — терминальные серверы в обоих ЦОД. Служба распределителя терминальных сессий (TS Broker) обеспечивает переключение пользовательских сессий между узлами.
- Контроллеры домена — две виртуальные машины — по одной в каждом ЦОД — с распределенными ролями AD. Аутентификация и групповые политики продолжают работать при отказе любого узла.
- Маршрутизаторы — кластерные пары маршрутизаторов с разнесением устройств по ЦОД‑1 и ЦОД‑2 и дублирующими сетевыми соединениями между дата‑центрами.
Дополняющие элементы
- Канал на точках продаж — Основной интернет‑канал в каждой точке + резервный LTE‑канал с регламентом действий для персонала.
- Регламент обменов — Ночные обмены между служебными сервисами разнесены по окнам и приоритетам, чтобы не пересекаться с операциями онлайн‑магазина.
- Мониторинг и резервное копирование — Контроль доступности всех ролей кластера и каналов связи с алертами. Ежедневные задания backup с регулярной проверкой восстановления.
Рис. 1 — Схема реализации розничного контура 24/7
Результаты
Проведена комплексная модернизация ИТ‑инфраструктуры. Цель «Исключить простои компании» достигнута: снижены риски потери выручки и лояльности клиентов, сокращены трудозатраты на сопровождение учётной системы и инфраструктуры за счёт уменьшения количества потенциальных точек отказа.
Целевые показатели после внедрения
| Показатель | До проекта | После проекта |
|---|---|---|
| Доступность критичных сервисов (1С, кассы, лояльность) | ≈ 98–99% (с заметными простоями) | целевая 99,9%+ (≤ ~8 ч/год) |
| RTO — время восстановления | Часы (ручной разбор инцидента) | Минуты (автоматический failover) |
| RPO — потеря данных | До дня (последний backup) | Секунды/минуты (общее хранилище кластера + журналы) |
| Связность магазин ↔ центр | Один канал, риск простоя точки | Основной канал + LTE‑резерв |
| Защита от отказа ЦОД | Отсутствует (одна площадка) | Геокластер: ЦОД‑1 ↔ ЦОД‑2, авто‑переключение |
| Актуальность остатков | С запаздыванием по обменам | Online по всей сети и складу |
| Трудозатраты на поддержку | Высокие (множество ручных операций) | Снижены за счёт типизации и мониторинга |
Таблица 1 – Целевые показатели после внедрения
Итоги проекта
Проведя анализ проекта, можно говорить о возможности применить внедренные решения и подходы к любой розничной сети или онлайн торговли, где критична непрерывность работы.
Доступность — это архитектура, а не «железо»
Бизнес‑требование «работать 24/7» переводит инфраструктуру из задачи «обеспечить доступ» в задачу «обеспечить непрерывность». Это другая проектная плоскость: не один сервер, а пара контуров с понятными ролями, регламентом переключения и проверяемой доступностью
Риск остановки бизнеса минимизирован
Дублирование 1С‑кластера и СУБД в двух ЦОД исключает простой при отказе одного из контуров и даёт окно для планового обслуживания без остановки бизнеса.
Понятный софт — Стандартный стек Microsoft (Failover Cluster, TS Broker, AD) закрывает отказоустойчивость без сторонних балансировщиков и решений.
Это упрощает поддержку и даёт админам предсказуемое поведение.
Учения – обязательное требование к эксплуатации системы
Без регулярных учений, любая архитектура деградирует, а проблема обнаруживается в момент реального инцидента. Система мониторинга исключает “сюрпризы” с недоступностью сервисов, а регулярно проводимые учения позволяют подтверждать работу и соответствие архитектуры системы, требованиям бизнеса.
