运营和管理→运营责任文化
运营责任文化
1)为什么需要它
技术提供工具,但可靠性是由人及其行为创造的。运营责任文化使平台可预测,加快灾难恢复,减少"噪音",并将事件转化为改进的燃料。
目标是:- 对"什么是可靠性"以及谁负责它的统一理解。
- 透明的业务角色、职责和权力。
- 一个安全的环境来讨论错误和快速调整。
- SLO,反应时间和操作成本的节奏性改善。
2)原则(文化的核心)
1.You build it — you run it.该团队拥有从代码到计算机的域质量。
2.SLO-first.通过对SLO和错误预算的影响来评估解决方案。
3.Blameless & factual.没有指控的验尸官,只有事实,数据和行动。
4.Small & reversible.小变化,ficheflagi,金丝雀,快速回滚。
5.Safety to speak up.每个人都可以在没有恐惧的情况下举起"红旗"。
6.Evidence over opinions.数据和人工制品比意见和地位更重要。
7.Continuously learn.事件→假设→实验→标准。
3)角色和所有权
域所有者(Payments/Bets/Games/KYC):SLO,电通话,改进路线图,错误预算。
事件经理(轮换):响应协调,时间线,通信质量。
SRE/平台:可靠性工具(可观察性,Alerta,Ficheflagi,金丝雀)。
团队领导/EM:期望,能力发展,遵守仪式。
业务摊贩:商定SLO/优先级,接受风险/权衡。
4)SLO作为责任合同
真理的唯一来源:确定指标,窗口,异常。
错误预算:明确的风险界限→发布/实验的门。
SLO语言讨论: "这个版本会吞噬预算的20%?».
每季度一次审核:与产品和业务协作。
5)呼叫和事件准备
明确的期望:反应时间,通道,权力("停止起重机"权利)。
培训:事件模拟,影子值班,DR演习。
工件:实时运行手册",升级矩阵,升级模式。
照顾人:轮班负荷,补偿,轮换,"无英雄"政策。
- 访问和VPN已验证。
- 通知渠道和备用联系人是可行的。
- Runbook ≤ 30天前更新。
- DR参与过去90天。
6)运营中的通信
单一模式:事件的简短更新,轮班之间的"handover"包。
决策宣传:关键权衡是书面记录的。
图表上的注释:版本,ficheflagi,提供程序窗口。
所有SLO面板:状态和错误预算的透明度。
[HH: MM] P2 Games latency ↑ p99 to 420 ms (base + 28%). Canary rolled back.
ETA of the next update: 20 min. Owner: squad-games. Next steps: tuning the breaker, checking provider Y.
7)Postmortham无指控
事实和时间线:谁,何时,做什么,基于什么数据。
系统原因:过程,工具,接口而不是"罪魁祸首"。
截止日期行动:纠正和预防。
吸取教训:标准,支票单,运行手册更新。
Impact: <metrics/revenue/users>
Timeline: <UTC+TZ>
Root cause: <system cause, not personalities>
Fix now: <3 actions + owners + ETA>
Prevent: <3 process/tool improvements>
Signals to watch: <SLO/metrics>
8)仪式和节奏
每周行动回顾(30分钟):SLO,事件,异同,行动进展。
每月可靠性回顾:课程、趋势、标准更新。
季度可靠性评论:修订SLO/预算,整合到路线图中。
Game-days/Chaos:计划中的故障和操纵器练习场景。
9)动机,增长和轨迹
能力:电话、事件管理、可观察性、SLO工程、FinOps。
职业水平:对可靠性贡献的期望(主动性,验尸后,指导)。
非物质动机:认可,改进的作者,季度的"可靠性冠军"。
物质:电汇补偿,SLO-KPI成就奖金。
10)政策和行为规范(片段)
停止起重机政策:- 当SLO威胁时,任何电子呼叫都可以暂停发布/指关节。
- 一旦消除了风险,将对决定进行记录和审查。
- Ficheflags和金丝雀的重大变化。
- 根据SLO指标进行的自动驾驶;→暂停/回滚偏差。
- 所有关键信息都在共享渠道中,没有私人解决方桉。
- 对于P1/P2事件,ETS(待定时间到状态)是必需的。
11)文化度量(KPI成熟)
SLO Coverage:具有正式描述的SLO/Alert的关键路径的比例。
事件前检测率:在退化阶段截获的事件比例。
MTTR/MTTD:每个街区的动态。
更改失败率:发行后回滚/回归。
Postmortem Action SLA:按时关闭的动作比例。
警报致命性索引:每通话/班次的变量。
Handoff Quality Score:轮班之间的传输质量。
心理安全脉冲:简短的定期调查(匿名)。
12)实施支票
- 已定义域、所有者、呼叫和SLO。
- 采用了停止起重机、验尸和通讯政策。
- 提升了SLO面板和版本注释。
- 仪式已经启动:每周Ops评论和模式趋势。
- 开发了验尸模式和动作跟踪器。
- 举行了第一场比赛日/DR演习。
- 定制KPI文化和每月审查。
13)反模式
英雄崇拜:我们在最后一刻保存而不是系统修复。
人的错:寻找"罪魁祸首"而不是原因。
隐藏解决方案:私人聊天,"口头安排"。
大型夜间发行:没有旗帜和金丝雀。
没有行动的指标:有报告,没有解决办法。
溷乱的趋势:没有模板和接收确认。
14)工具和文物(最低限度)
所有者的SLO/Alert目录。
Runbook存储库(按域、更新≥每月)。
Template: mortem, hendover,事件升级,退化计划。
Панели: SLO Overview, Incidents, Change Safety, Providers.
行动追踪器:与SLA和业主统一反击。
15)嵌入到HR路径
Onbording: SLO、on-col、Postmortems培训。
绩效评估:对可靠性和文化的贡献是绩效评论的一部分。
指导:影子值班,配对事件管理。
脉搏调查:季度安全/倦怠评估。
16)30/60/90-启动计划
30天:- 分配域所有者和呼叫,根据SLO (p95,成功率)提交最小值。
- 采用"停止起重机"和验尸策略,批准模式。
- 每周推出行动评论和手仪式。
- 进行2 场比赛/DR练习,举起SLO和Change Safety面板。
- 在1-2项关键服务上嵌入金丝雀和SLO自动登机口。
- 运行文化指标(MTTR、Action SLA、Pulse Poll等)。
- 趋势分析,SLO/预算更新,将改进整合到路线图中。
- 引入"可靠性冠军"和指导计划。
- 根据结果调整仪式和政策。
17)模板(片段)
验尸政策(conspect):
scope: P1/P2 and repeated P3 timeline: ≤72 hours format: impact, timeline, root cause, actions (now/prevent), owners/due dates review: monthly on Reliability Review blameless: specifying personalities only as a fact of time stamp
Hendover标准(标题):
SLO summary Incidents and ETAs Providers and quotas Releases/Canaries Risks/observations Action items
要发布的定义就绪:
- Ficheflags/canary set up
- SLO alerts and annotations included
- Rollback plan and "safe mode" defined
- Provider windows considered
- Responsible on-call confirmed
18) FAQ
问:如何衡量"文化",而不仅仅是技术?
答:输入脉冲调查(心理安全),后验尸行动SLA,公共决策份额,HQS分手。
问:如何处理"英雄主义"?
答:感谢但记录系统性的变化,所以不需要英雄主义。在表演中考虑预防和改进,而不仅仅是"壮举"。
问:如何说服企业文化价值观?
答:显示链接:MTTR/Change Failure Rate下降→转换/收入增加,罚款和隔夜分页减少,可预测发布。