感谢您发送咨询!我们的团队成员将很快与您联系。
感谢您发送预订!我们的团队成员将很快与您联系。
课程大纲
性能概念与指标
- 延迟、吞吐量、功耗、资源利用率
- 系统级与模型级瓶颈
- 推理与训练的性能分析
华为昇腾平台性能分析
- 使用CANN Profiler与MindInsight
- 内核与算子诊断
- 卸载模式与内存映射
壁仞GPU平台性能分析
- 壁仞SDK性能监控功能
- 内核融合、内存对齐与执行队列
- 功耗与温度感知的性能分析
寒武纪MLU平台性能分析
- BANGPy与Neuware性能工具
- 内核级可见性与日志解读
- MLU性能分析器与部署框架的集成
图级与模型级优化
- 图剪枝与量化策略
- 算子融合与计算图重构
- 输入尺寸标准化与批次调优
内存与内核优化
- 优化内存布局与复用
- 跨芯片组的高效缓冲区管理
- 各平台的内核级调优技巧
跨平台最佳实践
- 性能可移植性:抽象策略
- 为多芯片环境构建共享调优流水线
- 示例:在昇腾、壁仞与MLU上调优目标检测模型
总结与后续步骤
要求
- 具备AI模型训练或部署流水线的工作经验
- 理解GPU/MLU计算原理与模型优化
- 基本熟悉性能分析工具与指标
目标受众
- 性能工程师
- 机器学习基础设施团队
- AI系统架构师
21 小时