感谢您发送咨询!我们的团队成员将很快与您联系。
感谢您发送预订!我们的团队成员将很快与您联系。
课程大纲
自定义算子开发简介
- 为什么构建自定义算子?用例和限制
- CANN运行时结构和算子集成点
- 华为AI生态中TBE、TIK和TVM概述
使用TIK进行底层算子编程
- 理解TIK编程模型和支持的API
- TIK中的内存管理和分块策略
- 使用CANN创建、编译和注册自定义算子
测试和验证自定义算子
- 图中算子的单元测试和集成测试
- 调试内核级性能问题
- 可视化算子执行和缓冲区行为
基于TVM的调度和优化
- TVM作为张量算子编译器的概述
- 在TVM中为自定义算子编写调度
- TVM调优、基准测试和昇腾代码生成
与框架和模型的集成
- 为MindSpore和ONNX注册自定义算子
- 验证模型完整性和回退行为
- 支持混合精度的多算子图
案例研究和专项优化
- 案例研究:小输入形状的高效卷积
- 案例研究:内存感知的注意力算子优化
- 跨设备部署自定义算子的最佳实践
总结和后续步骤
要求
- 扎实的AI模型内部结构和算子级计算知识
- 具备Python和Linux开发环境经验
- 熟悉神经网络编译器或图级优化器
目标学员
- 从事AI工具链的编译器工程师
- 专注于底层AI优化的系统开发人员
- 构建自定义算子或针对新型AI工作负载的开发人员
14 小时