联系我们
 课程时长 14 小时

课程大纲

AIOps简介

  • 什么是AIOps及其重要性
  • 传统监控与AIOps驱动的可观测性对比
  • AIOps架构与关键组件

收集与规范化运维数据

  • 可观测性数据类型:指标、日志与追踪
  • 从多源(服务器、容器、云)摄取数据
  • 使用代理与导出器(Prometheus、Beats、Fluentd)

数据关联与异常检测

  • 时间序列关联与统计方法
  • 使用机器学习模型进行异常检测
  • 检测分布式系统中的事件

告警与噪音抑制

  • 设计智能告警规则与阈值
  • 抑制、去重与告警分组
  • 与Alertmanager、Slack、PagerDuty或Opsgenie集成

根本原因分析与可视化

  • 使用仪表板可视化指标并检测趋势
  • 探索事件与时间线以进行根本原因分析
  • 使用分布式追踪工具跨层追踪问题

自动化与修复

  • 从事件触发自动化脚本或工作流
  • 与ITSM系统集成(ServiceNow、Jira)
  • 应用场景:自愈、扩展、流量重路由

开源与商业AIOps平台

  • 工具概览:Prometheus、Grafana、ELK、Moogsoft、Dynatrace
  • 选择AIOps平台的评估标准
  • 演示并动手实践选定的技术栈

总结与后续步骤

要求

  • 理解IT运维与系统监控概念
  • 有监控工具或仪表板的使用经验
  • 熟悉基本的日志与指标格式

目标学员

  • 负责基础设施与应用运维的团队
  • 网站可靠性工程师(SRE)
  • IT监控与可观测性团队

即将举行的公开课程

课程分类