感谢您发送咨询!我们的团队成员将很快与您联系。
感谢您发送预订!我们的团队成员将很快与您联系。
课程时长 14 小时
课程大纲
预测性AIOps简介
- IT运营中预测分析概述
- 用于预测的数据源(日志、指标、事件)
- 时间序列预测和异常模式的关键概念
设计事件预测模型
- 对历史事件和系统行为进行标注
- 选择并训练模型(如LSTM、随机森林、AutoML)
- 评估模型性能和处理误报
数据收集与特征工程
- 摄取并对齐日志和指标数据以供模型输入
- 从结构化和非结构化数据中提取特征
- 处理运营管道中的噪声和缺失数据
自动化根因分析(RCA)
- 基于图的服务和基础设施关联
- 利用机器学习从事件链中推断可能的根因
- 通过拓扑感知仪表板可视化RCA
修复与工作流自动化
- 与自动化平台集成(如Ansible、Rundeck)
- 触发回滚、重启或流量重定向
- 审计和记录自动化干预
扩展智能AIOps管道
- 可观测性的MLOps:模型重训和版本管理
- 在分布式节点上实时运行预测
- 在生产环境中部署AIOps的最佳实践
案例研究与实际应用
- 使用预测性AIOps模型分析真实事件数据
- 使用合成数据和生产数据部署RCA管道
- 行业用例回顾:云中断、微服务不稳定、网络降级
总结与后续步骤
要求
- 具备监控系统经验,如Prometheus或ELK
- 掌握Python编程和基础机器学习知识
- 熟悉事件管理工作流
目标学员
- 高级站点可靠性工程师(SRE)
- IT自动化架构师
- DevOps和可观测性平台负责人