感谢您发送咨询!我们的团队成员将很快与您联系。
感谢您发送预订!我们的团队成员将很快与您联系。
课程时长 14 小时
课程大纲
使用开源工具介绍AIOps
- AIOps概念和优势概述
- 可观测性堆栈中的Prometheus和Grafana
- 机器学习在AIOps中的定位:预测性分析与反应性分析
设置Prometheus和Grafana
- 安装和配置Prometheus以收集时间序列数据
- 使用实时指标在Grafana中创建仪表板
- 探索导出器、重新标记和服务发现
机器学习的数据预处理
- 提取和转换Prometheus指标
- 准备用于异常检测和预测的数据集
- 使用Grafana的转换功能或Python管道
应用机器学习进行异常检测
- 用于异常检测的基本机器学习模型(例如,隔离森林、单类支持向量机)
- 在时间序列数据上训练和评估模型
- 在Grafana仪表板中可视化异常
使用机器学习进行指标预测
- 构建简单的预测模型(ARIMA、Prophet、LSTM简介)
- 预测系统负载或资源使用情况
- 使用预测进行早期告警和扩展决策
将机器学习与告警和自动化集成
- 基于机器学习输出或阈值定义告警规则
- 使用Alertmanager和通知路由
- 在异常检测时触发脚本或自动化工作流
扩展和运营AIOps
- 集成外部可观测性工具(例如,ELK堆栈、Moogsoft、Dynatrace)
- 在可观测性管道中运营机器学习模型
- 大规模AIOps的最佳实践
总结和后续步骤
要求
- 了解系统监控和可观测性概念
- 有使用Grafana或Prometheus的经验
- 熟悉Python和基本机器学习原理
目标受众
- 可观测性工程师
- 基础设施和DevOps团队
- 监控平台架构师和站点可靠性工程师(SRE)