Logo GH

Планирование смен

1) Цели и рамки

Планирование смен обеспечивает непрерывную готовность платформы к инцидентам и пикам трафика без выгорания команд. Цели:
  • гарантировать покрытие SLO-критичных процессов (депозиты, ставки/сеттл, выводы, KYC/AML);
  • сократить MTTA/MTTR в любое время суток;
  • соблюдать трудовое законодательство и внутренние политики (выходные/перерывы/ночные).

2) Роли и уровни поддержки

L1 (NOC/Operations): первичный триаж, запуск runbook, эскалации.
L2 (Domain On-Call): Payments, Games/Core, Data/Infra — глубокая диагностика и фиксы.
L3 (SRE/Platform/Dev): изменения конфигураций, патчи, аварийные релизы.
IC/CL (Incident Commander / Comms Lead): руководит инцидентом и коммуникациями.
Duty Manager (по смене): подтверждает staffing, риски, freeze-окна.

3) Модели смен и ротаций

3.1 24×7 покрытие

8×3 (три восьмичасовые): Day (08:00–16:00), Swing (16:00–00:00), Night (00:00–08:00). Проста в управлении, требует больше сотрудников.
12×2 (две двенадцатичасовые): Day (08:00–20:00), Night (20:00–08:00). Меньше хендоверов, выше риск усталости — использовать с ограничениями.
Follow-the-sun: EU → AMER → APAC, минимальные ночные; требует распределенной команды.

3.2 Шаблоны ротаций (пример)

Panama/Pitman (2-2, 3-2, 2-3): чередование 12-часовых с длительными выходными (требует строгого контроля усталости).
4-on/4-off (12h): 4 дня по 12 ч, 4 выходных; подходит для L1 при хорошей автоматизации.
5×8 (классика): для L2/L3 + дежурство on-call ночами/выходные.

3.3 Дежурства on-call

Primary/Secondary: у каждого домена есть первичный и вторичный on-call.
Shadow-on-call: обучение новых инженеров под крылом Primary.

4) Расчет штата и “усадки” (shrinkage)

4.1 Базовая формула FTE

Требуемые FTE на роль:

FTE = (coverage hours per week/productive FTE hours per week) × (1 + shrinkage)

Где shrinkage включает отпуск/больничные/обучение/1:1/ретро/админ-время (обычно 20–35%).

Пример (L1 24×7, 8-часовые):
  • 168 ч покрытия / 35 продуктивных ч/нед ≈ 4.8
  • При shrinkage 30% → 4.8 × 1.3 ≈ 6.2 FTE (округляем до 7 для устойчивости).

4.2 План по пикам

Добавьте коэффициент пика для событий (топ-матчи, турниры): +10–25% FTE в календарные окна. Используйте исторические графики алертов/трафика.

5) Покрытие SLO и окна риска

Выстройте матрицу критичных часов (локальное «прайм-тайм» GEO/методов оплаты).
Установите минимальный состав на слот (например, Night: L1×2, L2-Payments×1 on-call, L2-Games×1 on-call, IC по ротации).
Для релизов/миграций назначайте release guard (доп. L2/SRE) на период и +60 мин пост-мониторинга.

6) Хендоверы (передача смены)

Структура 10–15 минут:

1. Статус SLO/алертов и открытых инцидентов.

2. Плановые работы в окне + риски.

3. Блокеры/ожидания (провайдеры PSP/KYC, регламент).

4. Согласованные комм-планы (статус-страница, партнеры).

5. Проверка состава смены и контактов on-call.

Чек-лист хендовера должен быть в wiki/боте; протокол — в вар-руме или сменном канале.

7) Календарь и замены

Горизонт планирования: 8–12 недель; замены — не позже чем за 2 недели (кроме форс-мажора).
Freeze-периоды: крупные события/праздники — запрет отпусков для ключевых ролей (компенсируется позже).
Buddy-rule: замена только инженером того же домена/квалификации или с доп. shadow.

8) Интеграции с платформой

Алертинг: маршрутизация по активной смене и доменам (P1→pager+вар-рум).
Инцидент-бот: команды `/rota`, `/whoisoncall`, авто-упоминания IC/CL.
Релизы: CAB синхронизирован с расписанием смен; релизы вне покрытия — запрещены.
Статус-страница: CL из активной смены подтвержден в боте.

9) Устойчивость и здоровье команды

Трудовые нормы: ночные/выходные — доплаты и отгулы; максимум ночных подряд (например, ≤3).
Перерывы: каждые 2–3 часа короткий перерыв; при 12h — обязательные два длинных.
Fatigue-watch: лимит часов/нед., правило “не больше N P1 за смену на одного”.
Психологическая поддержка: дебриф после тяжелых P1, комп-тайм.

10) Мульти-регион и follow-the-sun

Разделите бренды/тенанты по регионам (EU/LATAM/APAC) с локальными L1 и доменными L2.
Региональные IC эскалируют к глобальному IC при кросс-региональных инцидентах.
Ежедневный кросс-регионный хендовер (15 мин) с передачей рисков и работ.

11) Политики и RACI

Policy “Shift & On-Call”: кто, как и когда заступает; замены; опоздания; резерв.
SoD/доступы: IC/CL/финансовые операции — раздельные роли; JIT-повышения только через бот.
RACI: у каждой смены — IC (A), Duty Manager (A/R), L1/L2 (R), Compliance/Sec (C), руководство (I).

12) Инструменты и данные

Единый календарь (с атрибутами: домен, регион, контакт, резерв).
Дашборды нагрузки смен: алерты/час, инциденты/тип, релизы/окна.
Отчеты справедливости (fair-share): покрытие ночей/выходных по людям.
Интеграция с HR/PTO, чтобы shrinkage считалcя автоматически.

13) Метрики качества (KPI/KRI)

Coverage Rate: % часов с полным составом.
MTTA/MTTR по слотам: день/вечер/ночь.
Handover Defects: кол-во недостающих пунктов чек-листа.
Pager Fatigue: алертов/чел/нед.; ночные вызовы (цель — ↓).
Replacement SLA: % закрытых смен заменой ≤ 48 ч до начала.
Training Coverage: доля смен с shadow-слотом для новых операторов.
Fair-Share Index: равномерность ночей/выходных по сотрудникам.

14) Дорожная карта внедрения (4–8 недель)

Нед. 1–2: собрать историю алертов/пиков, определить SLO-критичные окна; выбрать модель (8×3 или follow-the-sun), посчитать FTE и shrinkage.
Нед. 3–4: опубликовать Policy “Shift & On-Call”, включить хендовер-чек-лист, запустить общий календарь и команды бота `/whoisoncall`, `/handover`.
Нед. 5–6: отладить эскалации и замены, добавить fair-share отчеты, синхронизировать CAB/релизы со сменами, ввести freeze-окна.
Нед. 7–8: ретро по выгоранию и качеству хендоверов, коррекция состава ночных, запуск shadow-программы и сертификации IC/CL.

15) Шаблоны и артефакты

Shift Rota (пример для EU, Киевское время):
СлотВремяL1L2-Payments (on-call)L2-Games (on-call)ICCL
Day08:00–16:00211по ротациипо ротации
Swing16:00–00:00211по ротациипо ротации
Night00:00–08:00211по ротациипо ротации

Handover Checklist (10 пунктов): SLO, инциденты, работы, риски, релизы, провайдеры, доступы, статус-страницы, открытые тикеты, staffing.
Replacement SOP: как оформить замену, критерии допуска, контакт резерва.
Freeze Calendar: события/праздники и запреты на PTO/релизы.

16) Антипаттерны

Один on-call на все без доменного разделения.
12-часовые ночи подряд без ограничений и перерывов.
Релизы в часах без IC/CL/CL-доступности.
Хендовер “на устном слове”, без чек-листа и записей.
Игнор shrinkage → хронический недокомплект.
Нулевая shadow-программа → хрупкость и SPOF по людям.

Итог

Планирование смен — это инженерная задача: расчет FTE и shrinkage, честная ротация и охрана здоровья, строгие хендоверы и интеграция с алертингом/ChatOps/CAB. Такой каркас обеспечивает предсказуемое 24×7 покрытие SLO, быстрые реакции на инциденты и устойчивость бизнеса без выгорания команд.

Contact

Свяжитесь с нами

Обращайтесь по любым вопросам или за поддержкой.Мы всегда готовы помочь!

Telegram
@Gamble_GC
Начать интеграцию

Email — обязателен. Telegram или WhatsApp — по желанию.

Ваше имя необязательно
Email необязательно
Тема необязательно
Сообщение необязательно
Telegram необязательно
@
Если укажете Telegram — мы ответим и там, в дополнение к Email.
WhatsApp необязательно
Формат: +код страны и номер (например, +380XXXXXXXXX).

Нажимая кнопку, вы соглашаетесь на обработку данных.