联系我们

课程大纲

运维智能体AI入门

  • 从静态运维手册到推理智能体:IT自动化的演进
  • 智能体结构:推理循环、工具使用、记忆与规划
  • 何时自动化,何时保留人在环

智能体框架与架构

  • 单智能体模式:ReAct、计划与执行、工具调用循环
  • 多智能体架构:监督者、层级式及蜂群模式
  • 框架对比:LangGraph、CrewAI、AutoGen及自定义智能体
  • 构建首个运维智能体:查询监控、诊断、提出方案

IT运维工具集成

  • 将智能体连接至Prometheus、Grafana、Datadog及PagerDuty API
  • 智能体日志查询:集成Elasticsearch、Loki及Splunk
  • 基础设施工具使用:通过智能体动作调用kubectl、Terraform、Ansible
  • 设计安全工具接口:参数验证与幂等性

事件响应自动化

  • 自动事件分诊:严重性分类与路由
  • 根因假设生成与证据收集
  • 自动修复:重启、扩缩容、回滚及故障切换操作
  • 构建具备渐进自主等级的事件运维手册智能体

安全、护栏与人在环

  • 动作分类:只读、低风险、高风险及破坏性操作
  • 关键操作的审批门控与升级策略
  • 护栏模式:动作白名单、爆炸半径限制及回滚保证
  • 用于合规的审计追踪与决策溯源

复杂事件的多智能体编排

  • 协调专业智能体:分诊智能体、诊断智能体、修复智能体
  • 智能体间通信与共享上下文管理
  • 智能体提出矛盾动作时的冲突解决
  • 基于多智能体响应的端到端重大事件模拟

可观测性与评估

  • 追踪智能体推理链以用于调试与审计
  • 评估智能体决策质量:精确率、召回率、解决时间
  • 反馈循环:从操作员覆盖及结果中学习
  • 运维智能体的成本追踪与Token经济学

生产部署与运营

  • 将智能体部署为服务:API、Webhooks及定时任务
  • 渐进式自主推送:从影子模式到全自动修复
  • 智能体故障运维手册:当智能体自身出错时如何处理
  • 构建自主运营的业务案例并衡量ROI

要求

  • 具备IT运维、DevOps或SRE实践经验。
  • 熟悉Python脚本编写及REST API。
  • 了解大语言模型(LLM)能力基础及提示工程。

目标受众

  • 探索AI驱动自动化的SRE与DevOps工程师。
  • 构建自愈合基础设施的平台工程师。
  • 评估智能体AI用于事件管理的IT运维负责人。
 14 小时

即将举行的公开课程

课程分类