联系我们
 课程时长 21 小时

课程大纲

音频分类基础

  • 声音事件类型:环境、机械、人为生成
  • 用例概述:监控、监测、自动化
  • 音频分类与检测与分割

音频数据和特征提取

  • 音频文件类型和格式
  • 采样率、窗口化、帧大小考虑
  • 提取MFCC、色度特征、梅尔频谱图

数据准备和标注

  • UrbanSound8K、ESC-50和自定义数据集
  • 标注声音事件和时间边界
  • 平衡数据集和音频增强

构建音频分类模型

  • 使用卷积神经网络(CNN)处理音频
  • 模型输入:原始波形与特征
  • 损失函数、评估指标和过拟合

事件检测和时间定位

  • 基于帧和基于段的检测策略
  • 使用阈值和平滑进行检测后处理
  • 在音频时间线上可视化预测

高级主题和实时处理

  • 低数据场景下的迁移学习
  • 使用TensorFlow Lite或ONNX部署模型
  • 流式音频处理和延迟考虑

项目开发和应用场景

  • 设计完整流程:从采集到分类
  • 为监控、质量控制或监测开发概念验证
  • 日志记录、告警以及与仪表板或API集成

总结和后续步骤

要求

  • 理解机器学习概念和模型训练
  • 具备Python编程和数据预处理经验
  • 熟悉数字音频基础知识

目标受众

  • 数据科学家
  • 机器学习工程师
  • 音频信号处理领域的研究人员和开发者

即将举行的公开课程

课程分类