感谢您发送咨询!我们的团队成员将很快与您联系。
感谢您发送预订!我们的团队成员将很快与您联系。
课程时长 14 小时
课程大纲
AIOps简介
- 什么是AIOps及其重要性
- 传统监控与AIOps驱动的可观测性对比
- AIOps架构与关键组件
收集与规范化运维数据
- 可观测性数据类型:指标、日志与追踪
- 从多源(服务器、容器、云)摄取数据
- 使用代理与导出器(Prometheus、Beats、Fluentd)
数据关联与异常检测
- 时间序列关联与统计方法
- 使用机器学习模型进行异常检测
- 检测分布式系统中的事件
告警与噪音抑制
- 设计智能告警规则与阈值
- 抑制、去重与告警分组
- 与Alertmanager、Slack、PagerDuty或Opsgenie集成
根本原因分析与可视化
- 使用仪表板可视化指标并检测趋势
- 探索事件与时间线以进行根本原因分析
- 使用分布式追踪工具跨层追踪问题
自动化与修复
- 从事件触发自动化脚本或工作流
- 与ITSM系统集成(ServiceNow、Jira)
- 应用场景:自愈、扩展、流量重路由
开源与商业AIOps平台
- 工具概览:Prometheus、Grafana、ELK、Moogsoft、Dynatrace
- 选择AIOps平台的评估标准
- 演示并动手实践选定的技术栈
总结与后续步骤
要求
- 理解IT运维与系统监控概念
- 有监控工具或仪表板的使用经验
- 熟悉基本的日志与指标格式
目标学员
- 负责基础设施与应用运维的团队
- 网站可靠性工程师(SRE)
- IT监控与可观测性团队