感谢您发送咨询!我们的团队成员将很快与您联系。
感谢您发送预订!我们的团队成员将很快与您联系。
课程大纲
运维智能体AI入门
- 从静态运维手册到推理智能体:IT自动化的演进
- 智能体结构:推理循环、工具使用、记忆与规划
- 何时自动化,何时保留人在环
智能体框架与架构
- 单智能体模式:ReAct、计划与执行、工具调用循环
- 多智能体架构:监督者、层级式及蜂群模式
- 框架对比:LangGraph、CrewAI、AutoGen及自定义智能体
- 构建首个运维智能体:查询监控、诊断、提出方案
IT运维工具集成
- 将智能体连接至Prometheus、Grafana、Datadog及PagerDuty API
- 智能体日志查询:集成Elasticsearch、Loki及Splunk
- 基础设施工具使用:通过智能体动作调用kubectl、Terraform、Ansible
- 设计安全工具接口:参数验证与幂等性
事件响应自动化
- 自动事件分诊:严重性分类与路由
- 根因假设生成与证据收集
- 自动修复:重启、扩缩容、回滚及故障切换操作
- 构建具备渐进自主等级的事件运维手册智能体
安全、护栏与人在环
- 动作分类:只读、低风险、高风险及破坏性操作
- 关键操作的审批门控与升级策略
- 护栏模式:动作白名单、爆炸半径限制及回滚保证
- 用于合规的审计追踪与决策溯源
复杂事件的多智能体编排
- 协调专业智能体:分诊智能体、诊断智能体、修复智能体
- 智能体间通信与共享上下文管理
- 智能体提出矛盾动作时的冲突解决
- 基于多智能体响应的端到端重大事件模拟
可观测性与评估
- 追踪智能体推理链以用于调试与审计
- 评估智能体决策质量:精确率、召回率、解决时间
- 反馈循环:从操作员覆盖及结果中学习
- 运维智能体的成本追踪与Token经济学
生产部署与运营
- 将智能体部署为服务:API、Webhooks及定时任务
- 渐进式自主推送:从影子模式到全自动修复
- 智能体故障运维手册:当智能体自身出错时如何处理
- 构建自主运营的业务案例并衡量ROI
要求
- 具备IT运维、DevOps或SRE实践经验。
- 熟悉Python脚本编写及REST API。
- 了解大语言模型(LLM)能力基础及提示工程。
目标受众
- 探索AI驱动自动化的SRE与DevOps工程师。
- 构建自愈合基础设施的平台工程师。
- 评估智能体AI用于事件管理的IT运维负责人。
14 小时