感谢您发送咨询!我们的团队成员将很快与您联系。
感谢您发送预订!我们的团队成员将很快与您联系。
课程时长 14 小时
课程大纲
设计开放AIOps架构
- 开放AIOps管道中关键组件概述
- 从数据采集到告警的数据流
- 工具比较与集成策略
数据收集与聚合
- 使用Prometheus采集时间序列数据
- 使用Logstash和Beats捕获日志
- 标准化数据以实现跨源关联
构建可观测性仪表板
- 使用Grafana可视化指标
- 构建Kibana仪表板进行日志分析
- 使用Elasticsearch查询提取运维洞察
异常检测与事件预测
- 将可观测性数据导出到Python管道
- 训练机器学习模型进行异常值检测和预测
- 在可观测性管道中部署模型进行实时推理
使用开源工具实现告警与自动化
- 创建Prometheus告警规则和Alertmanager路由
- 触发脚本或API工作流以实现自动响应
- 使用开源编排工具(如Ansible、Rundeck)
集成与可扩展性考虑
- 处理高容量数据采集和长期数据保留
- 开源技术栈中的安全与访问控制
- 独立扩展每一层:采集、处理、告警
实际应用与扩展
- 案例研究:性能调优、停机预防和成本优化
- 使用追踪工具或服务图扩展管道
- 在生产环境中运行和维护AIOps的最佳实践
总结与后续步骤
要求
- 具备Prometheus或ELK等可观测性工具的使用经验。
- 掌握Python和机器学习基础知识。
- 了解IT运维和告警工作流程。
目标学员
- 高级网站可靠性工程师(SRE)
- 从事运维工作的数据工程师
- DevOps平台负责人和基础设施架构师