联系我们

课程大纲

腾讯混元生产基础

  • 腾讯混元模型服务场景概览
  • 大型和MoE模型的生产特性
  • 常见的延迟、吞吐量及成本瓶颈
  • 为推理工作流定义服务级别目标

部署架构与服务流程

  • 生产推理堆栈的核心组件
  • 在容器化、本地和云部署模式之间做出选择
  • 模型加载、请求路由及GPU分配基础
  • 设计可靠性与运维简便性

延迟优化实践

  • 在适用场景中使用优化的推理引擎,如TensorRT
  • KV缓存概念及实际的缓存调优
  • 减少启动、预热和响应开销
  • 测量首字延迟和令牌生成速度

吞吐量、批处理与GPU效率

  • 连续批处理与请求批处理策略
  • 管理并发与队列行为
  • 提升GPU利用率而不损害用户体验
  • 处理长上下文和混合工作负载请求

量化与成本控制

  • 为何量化对生产服务至关重要
  • FP16、INT8及其他常见精度选项的实用权衡
  • 平衡模型质量、延迟与基础设施成本
  • 制定简易的成本优化清单

运维、监控与就绪审查

  • 推理服务的自动扩缩容触发机制
  • 监控延迟、吞吐量、缓存使用及GPU健康状况
  • 日志记录、警报与事件响应基础
  • 审查参考部署方案并制定改进计划

要求

  • 对大型语言模型部署和推理工作流有基本了解
  • 具备容器、云或本地基础设施以及基于API的服务使用经验
  • 掌握Python或系统工程任务的工作知识

受众

  • 将LLM部署到生产环境的ML工程师
  • 负责基于GPU的推理服务的平台工程师
  • 设计可扩展AI服务平台的解决方案架构师
 14 小时

即将举行的公开课程

课程分类