联系我们
 课程时长 14 小时

课程大纲

设计开放AIOps架构

  • 开放AIOps管道中关键组件概述
  • 从数据采集到告警的数据流
  • 工具比较与集成策略

数据收集与聚合

  • 使用Prometheus采集时间序列数据
  • 使用Logstash和Beats捕获日志
  • 标准化数据以实现跨源关联

构建可观测性仪表板

  • 使用Grafana可视化指标
  • 构建Kibana仪表板进行日志分析
  • 使用Elasticsearch查询提取运维洞察

异常检测与事件预测

  • 将可观测性数据导出到Python管道
  • 训练机器学习模型进行异常值检测和预测
  • 在可观测性管道中部署模型进行实时推理

使用开源工具实现告警与自动化

  • 创建Prometheus告警规则和Alertmanager路由
  • 触发脚本或API工作流以实现自动响应
  • 使用开源编排工具(如Ansible、Rundeck)

集成与可扩展性考虑

  • 处理高容量数据采集和长期数据保留
  • 开源技术栈中的安全与访问控制
  • 独立扩展每一层:采集、处理、告警

实际应用与扩展

  • 案例研究:性能调优、停机预防和成本优化
  • 使用追踪工具或服务图扩展管道
  • 在生产环境中运行和维护AIOps的最佳实践

总结与后续步骤

要求

  • 具备Prometheus或ELK等可观测性工具的使用经验。
  • 掌握Python和机器学习基础知识。
  • 了解IT运维和告警工作流程。

目标学员

  • 高级网站可靠性工程师(SRE)
  • 从事运维工作的数据工程师
  • DevOps平台负责人和基础设施架构师

即将举行的公开课程

课程分类