联系我们

课程大纲

自定义算子开发简介

  • 为什么构建自定义算子?用例和限制
  • CANN运行时结构和算子集成点
  • 华为AI生态中TBE、TIK和TVM概述

使用TIK进行底层算子编程

  • 理解TIK编程模型和支持的API
  • TIK中的内存管理和分块策略
  • 使用CANN创建、编译和注册自定义算子

测试和验证自定义算子

  • 图中算子的单元测试和集成测试
  • 调试内核级性能问题
  • 可视化算子执行和缓冲区行为

基于TVM的调度和优化

  • TVM作为张量算子编译器的概述
  • 在TVM中为自定义算子编写调度
  • TVM调优、基准测试和昇腾代码生成

与框架和模型的集成

  • 为MindSpore和ONNX注册自定义算子
  • 验证模型完整性和回退行为
  • 支持混合精度的多算子图

案例研究和专项优化

  • 案例研究:小输入形状的高效卷积
  • 案例研究:内存感知的注意力算子优化
  • 跨设备部署自定义算子的最佳实践

总结和后续步骤

要求

  • 扎实的AI模型内部结构和算子级计算知识
  • 具备Python和Linux开发环境经验
  • 熟悉神经网络编译器或图级优化器

目标学员

  • 从事AI工具链的编译器工程师
  • 专注于底层AI优化的系统开发人员
  • 构建自定义算子或针对新型AI工作负载的开发人员
 14 小时

即将举行的公开课程

课程分类