联系我们

课程大纲

引言

  • SRE如何结合传统IT与软件开发。
  • 自动化与可观测性的需求
  • 软件工程师与系统管理员的角色对比。
  • 站点可靠性工程师与DevOps工程师的区别。

IT系统概述

  • 本地部署与云端系统架构。

SRE原则与实践概述

  • 基础设施即代码。
  • 容器化与编排的作用(Docker, Kubernetes等)。
  • 持续集成、持续部署与持续交付。
  • 可观测性。

评估IT系统

  • 盘点团队与组织资源。
  • 映射系统与流程。
  • 评估SRE的潜在影响。
  • 软件工程团队的角色。
  • 运维团队的角色。
  • 管理层的作用。

维持系统可靠性

  • 描述与度量服务所需的可靠性。
  • 理解服务等级目标(SLOs)。
  • 理解服务等级指标(SLIs)和服务等级协议(SLAs)。
  • 运用错误预算。
  • 制定SLO。

优化系统管理

  • 搭建开发环境。
  • 评估SRE工具。
  • 优先自动化任务。
  • 编写软件。

部署“基础设施即代码”

  • 测试与迭代代码。
  • 构建反脆弱系统。
  • 从失败中学习。

监控系统

  • 观察系统性能。
  • SRE工具与技术。

SRE的未来

要求

  • 对IT基础设施有一般性了解。
  • 对软件开发过程有基本认识。
  • 具备任意语言的编程或脚本编写经验。

受众群体

  • 开发人员
  • 系统管理员
  • 软件架构师
  • DevOps工程师
  • IT经理
 21 小时

客户评论 (7)

即将举行的公开课程

课程分类