感谢您发送咨询!我们的团队成员将很快与您联系。
感谢您发送预订!我们的团队成员将很快与您联系。
课程时长 35 小时
课程大纲
SRE反模式
- 识别低效实践
- 认识反模式对可靠性的影响
- 最佳实践和纠正替代方案
将SLO作为客户满意度的代理指标
- 定义服务级别指标(SLI)和服务级别目标(SLO)
- 管理错误预算,平衡创新与可靠性
- 理解分布式系统的局限性
构建安全可靠的系统
- 设计容错和弹性
- 将安全性融入可靠性工程
- 可扩展性和数据保护策略
全栈可观测性
- 仪器化和指标收集
- 分布式追踪和合成监控
- 可观测性驱动的开发
平台工程和AIOps
- 以平台为中心的工程方法
- SRE中的自动化和编排
- 利用DataOps和运营智能
SRE中的事件管理
- 事件响应中的角色和责任
- 应用OODA等框架
- 自动化修复和AI/ML辅助解决
混沌工程
- 弹性测试的原则和策略
- 规划和执行“游戏日”演练
- 从受控故障实验中学习
SRE作为DevOps的纯粹形式
- 将SRE融入DevOps工作流
- 文化对齐和协作实践
- 通过SRE推动组织转型
课后练习
- 大规模系统设计案例研究
- 高级仪器化和监控场景
- 实际可靠性问题解决
复习和考试准备
- DevOps Institute SRE从业者教学大纲的最终复习
- 样题和模拟测试
- 考试策略和建议
总结和后续步骤
要求
- 理解核心站点可靠性工程原则
- 具备DevOps实践和相关工具的经验
- 熟悉系统监控、事件管理和自动化
目标受众
- 寻求DevOps Institute SRE从业者认证的SRE专业人士
- 希望扩展至可靠性相关角色的DevOps工程师
- 负责可靠性战略和执行的运营领导者
客户评论 (2)
Craig在培训中非常投入,始终确保我们保持专注,将示例调整到我们的日常活动中,并在被提问时总是提供答案,即使信息未在演示中提及。
Ecaterina Ioana Nicoale - BOOKING HOLDINGS ROMANIA SRL
课程 - DevOps Foundation®
机器翻译
培训师的高度承诺和专业知识
Jacek - Softsystem
课程 - DevOps Engineering Foundation (DOEF)®
机器翻译