联系我们
 课程时长 35 小时

课程大纲

SRE反模式

  • 识别低效实践
  • 认识反模式对可靠性的影响
  • 最佳实践和纠正替代方案

将SLO作为客户满意度的代理指标

  • 定义服务级别指标(SLI)和服务级别目标(SLO)
  • 管理错误预算,平衡创新与可靠性
  • 理解分布式系统的局限性

构建安全可靠的系统

  • 设计容错和弹性
  • 将安全性融入可靠性工程
  • 可扩展性和数据保护策略

全栈可观测性

  • 仪器化和指标收集
  • 分布式追踪和合成监控
  • 可观测性驱动的开发

平台工程和AIOps

  • 以平台为中心的工程方法
  • SRE中的自动化和编排
  • 利用DataOps和运营智能

SRE中的事件管理

  • 事件响应中的角色和责任
  • 应用OODA等框架
  • 自动化修复和AI/ML辅助解决

混沌工程

  • 弹性测试的原则和策略
  • 规划和执行“游戏日”演练
  • 从受控故障实验中学习

SRE作为DevOps的纯粹形式

  • 将SRE融入DevOps工作流
  • 文化对齐和协作实践
  • 通过SRE推动组织转型

课后练习

  • 大规模系统设计案例研究
  • 高级仪器化和监控场景
  • 实际可靠性问题解决

复习和考试准备

  • DevOps Institute SRE从业者教学大纲的最终复习
  • 样题和模拟测试
  • 考试策略和建议

总结和后续步骤

要求

  • 理解核心站点可靠性工程原则
  • 具备DevOps实践和相关工具的经验
  • 熟悉系统监控、事件管理和自动化

目标受众

  • 寻求DevOps Institute SRE从业者认证的SRE专业人士
  • 希望扩展至可靠性相关角色的DevOps工程师
  • 负责可靠性战略和执行的运营领导者

客户评论 (2)

即将举行的公开课程

课程分类