联系我们

课程大纲

生产环境中的Agentic系统基础

  • Agentic架构:循环、工具、记忆和编排层
  • Agent的生命周期:开发、部署和持续运营
  • 生产规模Agent管理的挑战

基础设施与部署模型

  • 在容器化和云环境中部署Agent
  • 扩展模式:水平与垂直扩展、并发和节流
  • 多Agent编排与工作负载均衡

监控与可观测性

  • 关键指标:延迟、成功率、内存使用和Agent调用深度
  • 追踪Agent活动与调用图
  • 使用Prometheus、OpenTelemetry和Grafana实现可观测性

日志记录、审计与合规

  • 集中式日志记录与结构化事件采集
  • Agentic工作流中的合规性与可审计性
  • 设计审计追踪与回放机制以便调试

性能调优与资源优化

  • 降低推理开销并优化Agent编排周期
  • 模型缓存与轻量级嵌入以加速检索
  • AI管道的负载测试与压力场景

成本控制与治理

  • 理解Agent成本驱动因素:API调用、内存、计算和外部集成
  • 追踪Agent级别成本并实施成本分摊模型
  • 通过自动化策略防止Agent蔓延和空闲资源消耗

Agent的CI/CD与发布策略

  • 将Agent管道集成到CI/CD系统中
  • 面向迭代式Agent更新的测试、版本管理和回滚策略
  • 渐进式发布与安全部署机制

故障恢复与可靠性工程

  • 面向容错与优雅降级的设计
  • Agent可靠性的重试、超时与熔断器模式
  • AI运维的事件响应与复盘框架

结业项目

  • 构建并部署一个具备完整监控和成本追踪的Agentic AI系统
  • 模拟负载、测量性能并优化资源使用
  • 向同伴展示最终架构与监控仪表盘

总结与后续步骤

要求

  • 深入理解MLOps和生产机器学习系统
  • 具备容器化部署经验(Docker/Kubernetes)
  • 熟悉云成本优化和可观测性工具

目标受众

  • MLOps工程师
  • 站点可靠性工程师(SRE)
  • 管理AI基础设施的工程经理
 21 小时

客户评论 (3)

即将举行的公开课程

课程分类