联系我们

课程大纲

AI 观测性全景

  • 从仪表板到对话:向 AI 增强型观测性的转变
  • 与观测性相关的 LLM 能力:摘要、推理、模式匹配
  • 架构模式:将 AI 集成到现有观测性技术栈中

自然语言遥测查询

  • Text-to-PromQL:将自然语言转换为监控查询
  • 针对 Elasticsearch、OpenSearch 和 Loki 日志存储的 NL 查询
  • 从自然语言生成结构化遥测数据的 SQL 语句
  • 构建具备工具使用能力和上下文感知能力的查询助手代理

基于 LLM 的日志分析

  • 利用 LLM 进行自动日志解析和结构化
  • 使用嵌入相似度在日志流中进行异常检测
  • 大规模日志聚类和模式发现
  • 从原始日志序列生成人类可读的解释

智能告警与事件丰富

  • 基于语义理解的告警关联与去重
  • 从运行手册、过往事件和文档中自动收集事件上下文
  • 基于内容理解和团队专业知识进行智能告警路由
  • 通过 AI 驱动噪声减少降低告警疲劳

AI 辅助的根本原因分析

  • 从多源遥测关联中生成假设
  • 证据链:连接跨指标、日志和跟踪的症状
  • 通过交互式 AI 诊断会话进行引导式故障排除
  • 构建具备渐进式调查功能的根本原因分析代理

自动事件响应与沟通

  • 从遥测数据生成事件摘要和状态更新
  • 通过时间线重建自动生成事后报告草稿
  • 针对技术和管理受众定制利益相关者沟通
  • 运行手册建议及自动修复推荐

观测性中的机器学习

  • 用于容量规划和异常预测的时间序列预测
  • 用于指标零样本异常检测的基础模型
  • 基于嵌入的服务依赖映射和拓扑发现
  • 在观测性流水线旁训练和部署轻量级 ML 模型

生产部署与伦理

  • 实时 AI 观测性的延迟与成本考量
  • 数据隐私:确保 LLM 不泄露敏感遥测数据
  • 人工监督:何时需要操作员验证 AI 诊断结果
  • 衡量影响:平均检测时间 (MTTD)、平均修复时间 (MTTR) 及值班体验指标

要求

  • 具备 Prometheus、Grafana、Datadog 或 OpenTelemetry 等观测性工具的使用经验。
  • 熟悉日志管理和指标概念。
  • 具备用于数据处理的基础 Python 脚本编写能力。

受众

  • 采用 AI 增强型工具的 SRE 和观测性工程师。
  • 构建下一代监控流水线的平台工程师。
  • 评估将 LLM 集成到事件工作流中的 DevOps 负责人。
 14 小时

即将举行的公开课程

课程分类