联系我们

课程大纲

性能概念与指标

  • 延迟、吞吐量、功耗、资源利用率
  • 系统级与模型级瓶颈
  • 推理与训练的性能分析

华为昇腾平台性能分析

  • 使用CANN Profiler与MindInsight
  • 内核与算子诊断
  • 卸载模式与内存映射

壁仞GPU平台性能分析

  • 壁仞SDK性能监控功能
  • 内核融合、内存对齐与执行队列
  • 功耗与温度感知的性能分析

寒武纪MLU平台性能分析

  • BANGPy与Neuware性能工具
  • 内核级可见性与日志解读
  • MLU性能分析器与部署框架的集成

图级与模型级优化

  • 图剪枝与量化策略
  • 算子融合与计算图重构
  • 输入尺寸标准化与批次调优

内存与内核优化

  • 优化内存布局与复用
  • 跨芯片组的高效缓冲区管理
  • 各平台的内核级调优技巧

跨平台最佳实践

  • 性能可移植性:抽象策略
  • 为多芯片环境构建共享调优流水线
  • 示例:在昇腾、壁仞与MLU上调优目标检测模型

总结与后续步骤

要求

  • 具备AI模型训练或部署流水线的工作经验
  • 理解GPU/MLU计算原理与模型优化
  • 基本熟悉性能分析工具与指标

目标受众

  • 性能工程师
  • 机器学习基础设施团队
  • AI系统架构师
 21 小时

即将举行的公开课程

课程分类