इन्फ्रास्ट्रक्चर टीम की भू
1) पूरी तस्वीर: क्यों विशेषज्ञ
भविष्यवाणी और गति: स्पष्ट मालिक "ग्रे क्षेत्रों" को कम करते हैं।
विश्वसनीयता और सुरक्षा: डोमेन (K8s, नेटवर्क, डीबी, सुरक्षा) द्वारा जिम्मेदारी का वितरण।
अर्थशास्त्र: FinOps मूल्य को खपत से अलग करता है और "नाइन की कीमत" का प्रबंधन करता है।
डेवलपर अनुभव: एक उत्पाद के रूप में मंच - स्व-सेवा, टेम्पलेट, कैटलॉग।
2) प्रमुख भूमिकाएँ और जिम्मेदारियाँ
3) जिम्मेदारी की सीमाएं (स्वामित्व की सीमाएं)
प्लेटफ़ॉर्म L3-L7 प्लेटफ़ॉर्म सेवाओं (K8s, ग्रिड, अवलोकन) के स्तर का मालिक है, लेकिन व्यावसायिक तर्क न
एसआरई प्रत्येक विशिष्ट उत्पाद टीम मीट्रिक के बजाय विश्वसनीयता प्रक्रिया (एसएलओ/घटनाओं/पोस्टमार्टम) का मालिक है।
रिलीज/डिलीवरी गणना के यांत्रिकी का मालिक है, लेकिन "क्या" के लिए जिम्मेदारी फीचर कमांड के साथ है।
DBRE समूहों/डेटा नीतियों का मालिक है, और स्कीमा/माइग्रेशन उत्पाद टीम (DBRE मानकों के अनुसार) के स्वामित्व में हैं।
SecOps नीतियों और नियंत्रणों का मालिक है, और कार्यान्वयन डोमेन मालिकों के साथ साझा किया जाता है।
4) ऑपरेशनल मॉडल
1. केंद्रीकृत मंच - तेज शुरुआत, अड़ चन जोखिम।
2. एक उत्पाद (PaaP) के रूप में प्लेटफ़ॉर्म - सेल्फ-सर्विस टेम्पलेट, कैटलॉग, सेवाओं का "आंतरिक बाज़ार"।
3. फेडरेशन/गिल्ड - विशेषज्ञ उत्पाद डोमेन (अध्याय/एम्बेडेड एसआरई/डीबीआरई) में एम्बेडेड हैं।
4. मैट्रिक्स - केंद्र के रणनीतिक मानक + डोमेन में निष्पादन।
सिफारिश: बुनियादी जरूरतों के लिए PaaP को जोड़ें और महत्वपूर्ण डोमेन के लिए एम्बेडेड करें।
5) इंटरफेस और ओएलए (आंतरिक समझौते)
सेवा निर्देशिका: "सेवा के रूप में क्या उपलब्ध है" (K8s नेमस्पेस, डेटाबेस क्लस्टर, कतार, एसएलओ डैशबोर्ड, अलर्ट प्रोफ़ाइल)।
ओएलए (ऑपरेशनल लेवल एग्रीमेंट): प्रतिक्रिया तिथियां, जिम्मेदारी एरेनास, एस्केलेशन पॉइंट।
प्लेटफ़ॉर्म सेवाओं के एसएलओ कार्ड: उपलब्धता, एपीआई विलंबता, टेम्पलेट से तैनाती का समय।
उदाहरण OLA (टुकड़ा):yaml service: "Kubernetes Namespace Provisioning"
owner: "Platform"
request_channel: "Service Catalog"
targets:
response_time: "≤ 15 min"
delivery_time: "≤ 1 hour (without manual approvals)"
scope:
includes: "quota, RBAC, secrets integration"
excludes: "business configs, database migrations"
escalation: "#plat-ops-oncall"
6) RACI: कौन करता है
किंवदंती: R - परफॉर्म करता है, A - जवाब देता है, C - परामर्श, I - सूचित।
7) केपीआई और भूमिका द्वारा प्रदर्शन मैट्रिक्स
प्लेटफ़ॉर्म: सेवा प्रावधान,% स्व-सेवा, DevEx NPS के लिए नेतृत्व समय।
एसआरई: एमटीटीआर/एमटीटीडी, एसएलओ निष्पादन, प्लेबुक कवरेज, ऑटो-शमन शेयर।
CloudOps/NetOps: परिधि अपटाइम, चेंज रनटाइम, कॉन्फ़िगरेशन की घटनाएँ।
DBRE: RPO/RTO, वसूली की सफलता, प्रतिकृति अंतराल p95।
रिलीज: कैनरी रिलीज का प्रतिशत, रोलबैक की दर, वातावरण का समय।
अवलोकन: संकेतों की पूर्णता, अनुरोधों का प्रतिक्रिया समय/डैशबोर्ड, शोर-विरोधी अनुपात।
SecOps: महत्वपूर्ण CVE, MTTD/MTTR सुरक्षा घटनाओं, गुप्त प्रबंधक कवरेज के लिए समापन समय।
FinOps: प्रति सेवा लागत/RPS, सही बचत, सटीकता भविष्यवाणी।
8) ऑनबोर्डिंग और डेवेक्स
स्टार्ट पैक: Terraform/Helm templates, CI/CD पाइपलाइनें, "हैलो, सर्विस" चेकलिस्ट।
डॉकिंग पोर्टल: मानक, उदाहरण, "लाइव" डैशबोर्ड, सेल्फ-सर्विस बटन।
कार्यशालाएं/कार्यालय के घंटे: भूमिका द्वारा (SRE 101, SecOps 101, DBRE 101)।
वृद्धि नीति: रात में और जब टिकट पर्याप्त हो तो किसे कॉल करना चाहिए।
9) डेटा स्वामित्व और पहुंच की सीमाएं
IAM बीमा: रोल मालिक, एक्सेस लाइफ, JIT (बस-इन-टाइम) एक्सेस।
रहस्य: केंद्रीकृत गुप्त प्रबंधक, रोटेशन, ईएनवी/रेपो में रहस्यों का निषेध।
डेटा स्वामित्व: उत्पाद डोमेन के स्कीमा/डेटा का मालिक है; DBRE "पोत" (समूह और नीतियां) का मालिक है।
10) प्रक्रियाएं: घटनाएं, परिवर्तन, रिलीज
घटनाएं: आईसी/युद्ध-कक्ष/पोस्टमॉर्टम (घटनाएं और एसआरई प्लेबुक देखें)।
परिवर्तन प्रबंधन: जोखिम-आधारित, कम जोखिम के लिए तेज लेन, केवल उच्च जोखिम के लिए सीएबी।
रिलीज: बजट त्रुटियों को जलाते समय प्रगतिशील वितरण, फ्रीज नियम।
11) भूमिका द्वारा चेकलिस्ट (निचोड़)
प्लेटफ़ॉर्
- प्रत्येक प्लेटफॉर्म सेवा के लिए सेवा निर्देशिका और एसएलए
- IaC + पॉलिसी टेम्पलेट्स (OPA/Conftest)
SRE
- शीर्ष रास्तों के एसएलओ-कार्ड, बर्न-रेट अलर्ट, प्लेबुक
- मासिक गलत बजट रिपोर्ट
डीबीआरई
- डीआर अभ्यास, वसूली परीक्षण, आरपीओ/आरटीओ पर हस्ताक्षर
- प्रवासन और अनुक्रमण नीतियां
Secops
- कमजोरियों और पैच विंडो की ट्राइएज
- डीएलपी/पीआईआई नियंत्रण, ऑडिट एक्सेस
रिलीज़
- डिफ़ॉल्ट कैनरी चरण, ऑटो-रोलबैक
- झंडे और किल-स्विच की सुविधा
अवलोकन क्षमता
- मेट्रिक्स/लेबल मानक, बजट डैशबोर्ड
- एंटी-शोर (कोरम, मल्टी-विंडो), एसएलओ विजेट
फिनोप्स
- चार्जबैक/शोबैक, सही सिफारिशें
- "लागत प्रति 9", पूर्वानुमान
12) संगठन विरोधी पैटर्न
"DevOps एक आदमी है": "सामान्यवादियों" का अधिभार, डोमेन मालिकों की कमी।
"प्लेटफ़ॉर्म = टिकट कार्यालय": सभी मैनुअल टिकट के माध्यम से, कोई स
"SRE = ड्यूटी पर अग्निशामक": SLO और प्राधिकरण के बिना।
"स्टॉपकॉक के रूप में सुरक्षा": बाद में समावेश, "डिजाइन द्वारा रेलिंग" के बजाय।
"अवलोकन = सुंदर रेखांकन": कार्रवाई योग्य-अलर्ट और एसएलओ के बिना।
"केवल रिपोर्ट के बारे में FinOps": सिफारिशों और ऑटो-राइटसाइज़िंग के बिना।
13) कलाकृतियाँ पैटर्न
प्लेटफ़ॉर्म सेवा कार्ड टैम्पलेट
yaml service: "Managed PostgreSQL"
owner: "DBRE"
plan: "S, M, L"
slo:
availability: "99. 95 %/quarter"
rpo: "≤ 5 min"
rto: "≤ 15 min"
interfaces:
request: "Service Catalog → Postgres"
incidents: "#dbre-oncall"
changes: "Change Policy L2"
security:
secrets: "Vault"
access: "JIT/RBAC"
finops:
pricing: "по vCPU/GB/IOPS"
limits: "quota per tenant"
रिलीज के लिए मिनी आरएसीआई
yaml release:
strategy: canary
R: Release/Delivery
A: Product Owner
C: SRE, SecOps
I: Platform
14) कार्यान्वयन योजना (4 पुनरावृत्ति)
1. मानकीकरण (2-3 सप्ताह): रोल मैप, सर्विस कैटलॉग, आरएसीआई, ओएलए, एस्केलेशन चैनल।
2. DevEx (3-4 सप्ताह): सेवा कैटलॉग, CI/CD टेम्पलेट, टेराफॉर्म मॉड्यूल, बेसिक SLO/डैशबोर्ड।
3. विश्वसनीयता और सुरक्षा (4-6 सप्ताह): घटना प्लेबुक, डीआर ड्रिल, डब्ल्यूएएफ/डीएलपी, गुप्त प्रबंधक।
4. FinOps और अनुकूलन (निरंतर): चार्जबैक, राइटसाइज़िंग, "लागत प्रति 9", ऑटो-नीतियां।
15) मिनी-एफएक्यू
SRE - प्लेटफ़ॉर्म में या उत्पादों में कहाँ रखें?
हाइब्रिड: मंच में रणनीतिक एसआरई, महत्वपूर्ण डोमेन में एम्बेडेड-एसआरई।
एसएलओ सेवाओं का मालिक कौन है?
उत्पाद टीमें। SRE कार्यप्रणाली, टूलिंग और प्रक्रिया नियंत्रण प्रदान करता है
"छाया आईटी" से कैसे बचें?
सेवा कैटलॉग, स्पष्ट ओएलए, तेज स्व-सेवा और पारदर्शी मूल्य निर्धारण (शोबैक/चार्जबैक)।
कुल
एक मजबूत बुनियादी ढांचा समारोह स्पष्ट भूमिकाएं + इंटरफेस और मैट्रिक्स पर मंच + समझौतों के लिए एक उत्पाद दृष्टिको RACI और OLA पर कब्जा करें, स्व-सेवा और मानक दें, प्रत्येक भूमिका के KPI के खिलाफ प्रदर्शन को मापें, और नियमित रूप से DevEx, SLO और लागत में सुधार करें। इससे परिचालन जोखिम कम होंगे, रिलीज में तेजी आएगी और बुनियादी ढांचे की भविष्यवाणी की जा सकेगी।