轮班计划
1)目标和框架
轮班计划确保平台对事件和交通高峰的持续准备,而无需团队倦怠。目标是:- 保证覆盖SLO关键流程(存款,利率/设置,结论,KYC/AML);
- 在一天中的任何时间减少MTTA/MTTR;
- 遵守劳动法和国内政策(周末/休息时间/夜间)。
2)角色和支持级别
L1(NOC/Operations):主要三重奏,运行运行手册,升级。
L2(域名呼叫):Payments、Games/Core、Data/Infra-深度诊断和虚构。
L3 (SRE/Platform/Dev):配置更改、修补程序、紧急版本。
IC/CL(事件指挥官/Comms Lead):负责事件和通信。
Duty Manager(按更改):确认状态、风险、冻结窗口。
3)轮班和轮换模式
3.1 24 × 7个覆盖范围
8 × 3(三个八小时):Day (08:00-16:00), Swing (16:00-00:00), Night (00:00-08:00)。管理简单,需要更多的员工。
12 × 2(两个十二小时):Day (08:00-20:00), Night (20:00-08:00)。更少的hendovers,更高的疲劳风险-与限制使用。
追随太阳:EU → AMER → APAC,最低夜晚;需要一个分布式命令。
3.2轮换模式(示例)
Panama/Pitman (2-2,3-2,2-3):将12小时与长周末交替(需要严格的疲劳控制)。
4-on/4-off(12 h):4天,12小时,4个周末;适用于自动化L1。
5 × 8(经典):对于L2/L3+夜间/周末通话值班。
3.3电话值班
Primary/Secondary:每个域都有主要和次要呼叫。
通话影子:在Primary机翼下培训新工程师。
4)状态计算和"收缩"(shrinkage)
4.1 FTE基本公式
角色所需的FTE:
FTE = (coverage hours per week/productive FTE hours per week) × (1 + shrinkage)
其中shrinkage 包括休假/住院/培训/1:1/复古/管理时间(通常为20-35%)。
示例(L1 24 × 7,8小时):- 168小时/35生产小时/奈德≈ 4。8
- 在shrinkage中,30% → 4。8 × 1.3 ≈ 6.2 FTE(四舍五入至7以实现可持续性)。
4.2高峰计划
在日历窗口中添加事件(顶级比赛、锦标赛)的峰值系数:+10-25% FTE。使用历史的标量/流量图形。
5)SLO覆盖和风险窗口
排列关键时钟矩阵(本地"黄金时段"GEO/支付方法)。
将最小阵容设置为插槽(例如:Night: L1 × 2、L2-Payments × 1呼叫、L2-Games × 1呼叫、IC轮换)。
对于发布/迁移,为该期间和+60分钟后监控分配释放后卫(dop. L2/SRE)。
6)Hendovers(轮班转移)
结构10-15分钟:1.SLO/警报和公开事件的状态。
2.窗口中的计划工作+风险。
3.锁定/等待(PSP/KYC提供商,法规)。
4.商定的通讯计划(状态页面,合作伙伴)。
5.检查轮班组成和呼叫联系人。
Hendover的支票清单必须在wiki/bot中;协议-在var rum或更换通道中。
7)日历和更换
规划视野:8-12周;更换-不迟于2周(不可抗力除外)。
Freeze时期:主要事件/假期-主要角色的假期禁令(以后补偿)。
Buddy-rule:仅由工程师替换相同的域/资格或多波影。
8)与平台集成
Alerting:通过活动交换和域(P1→pager+var-rum)进行路由。
事件机器人:命令"/rota","/whoisoncall",自动参考IC/CL。
发行版:CAB与轮班时间表同步;超出覆盖范围-禁止发布。
状态页面:CL from active shift已在机器人中确认。
9)团队的复原力和健康
劳动标准:夜间/周末-附加费和休假;连续夜间最多(如≤3)。
休息时间:每2-3小时短暂休息一次;12h是强制性的两个长。
Fatigue-watch:时限/奈德,规则"每班不超过N P1"。
心理支持:重度P1后脱发,综合时间。
10)多区域与追随太阳
按地区(EU/LATAM/APAC)与本地L1和L2 域共享品牌/tenant。
在跨区域事件中,区域IC升级为全球IC。
每日跨区域hendover(15分钟),风险和工作转移。
11)政治家和RACI
策略"Shift&On-Call":谁,如何以及何时求情;更换;迟到;准备金。
SoD/可用性:IC/CL/财务交易-分开角色;仅通过机器人进行JIT升级。
RACI:每个班次都有IC (A)、Duty Manager (A/R)、L1/L2 (R)、Compliance/Sec (C)、Guide (I)。
12)工具和数据
统一日历(具有属性:域,区域,联系人,备份)。
换档载荷码:Alerts/hour,事件/类型,版本/窗口。
公平报告(公平分享):覆盖人们的夜晚/周末。
与HR/PTO集成以自动考虑shrinkage。
13)质量指标(KPI/KRI)
Coverage Rate:全阵容小时百分比。
按插槽排列的MTTA/MTTR:白天/晚上/晚上。
Handover Defects:缺失的支票点。
Pager Fatigue:alerts/chel/ned.;夜间通话(目标是↓)。
替代SLA:开球前48小时≤关闭班次的百分比。
培训覆盖:为新运营商提供带阴影插槽的班次份额。
公平分享指数:员工的夜晚/周末均匀性。
14)实施路线图(4-8周)
奈德。1-2:收集标量/峰值的历史,确定SLO关键窗口;选择一个模型(8 × 3或follow-the-sun),计算FTE和shrinkage。
奈德。3-4:发布Policy "Shift&On-Call"、启用分页清单、运行共享日历和机器人命令"/whoisoncall"、"/handover"。
奈德。5-6:调试升级和替换,添加公平共享报告,将SAV/版本与更改同步,输入冻结窗口。
奈德。7-8:复古的倦怠和弯腰质量,调整夜间阵容,启动影子程序和IC/CL认证。
15)模板和工件
Shift Rota(基辅时间EU的示例):Handover Checklist (10点):SLO、事件、工作、风险、发布、提供商、访问、状态页面、打开的滴答声、堆栈。
Replacement SOP:如何安排更换,入场条件,备份联系人。
Freeze Calendar:活动/假期和RTO/发行禁令。
16)反模式
在没有域分离的情况下进行一次呼叫。
连续12小时没有限制和休息。
时钟发行没有IC/CL/CL可用性。
Hendover"口语",没有支票单和记录。
无视shrinkage →慢性缺陷。
零影子程序→脆弱性和人类的SPOF。
底线
轮班计划是一项工程任务:FTE和shrinkage计算,诚实的轮换和健康保护,严格的转换以及与Alerting/ChatOps/CAB的集成。这种框架提供了可预测的24 × 7 SLO覆盖范围,对事件的快速反应以及业务可持续性,而无需团队倦怠。