联系我们
 课程时长 14 小时

课程大纲

使用开源工具介绍AIOps

  • AIOps概念和优势概述
  • 可观测性堆栈中的Prometheus和Grafana
  • 机器学习在AIOps中的定位:预测性分析与反应性分析

设置Prometheus和Grafana

  • 安装和配置Prometheus以收集时间序列数据
  • 使用实时指标在Grafana中创建仪表板
  • 探索导出器、重新标记和服务发现

机器学习的数据预处理

  • 提取和转换Prometheus指标
  • 准备用于异常检测和预测的数据集
  • 使用Grafana的转换功能或Python管道

应用机器学习进行异常检测

  • 用于异常检测的基本机器学习模型(例如,隔离森林、单类支持向量机)
  • 在时间序列数据上训练和评估模型
  • 在Grafana仪表板中可视化异常

使用机器学习进行指标预测

  • 构建简单的预测模型(ARIMA、Prophet、LSTM简介)
  • 预测系统负载或资源使用情况
  • 使用预测进行早期告警和扩展决策

将机器学习与告警和自动化集成

  • 基于机器学习输出或阈值定义告警规则
  • 使用Alertmanager和通知路由
  • 在异常检测时触发脚本或自动化工作流

扩展和运营AIOps

  • 集成外部可观测性工具(例如,ELK堆栈、Moogsoft、Dynatrace)
  • 在可观测性管道中运营机器学习模型
  • 大规模AIOps的最佳实践

总结和后续步骤

要求

  • 了解系统监控和可观测性概念
  • 有使用Grafana或Prometheus的经验
  • 熟悉Python和基本机器学习原理

目标受众

  • 可观测性工程师
  • 基础设施和DevOps团队
  • 监控平台架构师和站点可靠性工程师(SRE)

即将举行的公开课程

课程分类