联系我们
 课程时长 14 小时 (2 天数)

课程大纲

语音识别技术概述

  • 语音识别的历史与演进
  • 声学模型、语言模型和解码
  • 现代架构:RNN、Transformer和Whisper

音频预处理与转录基础

  • 处理音频格式和采样率
  • 清洁、修剪和分段音频
  • 从音频生成文本:实时与批量

动手实践:Whisper和其他API

  • 安装和使用OpenAI Whisper
  • 调用云API(Google、Azure)进行转录
  • 比较性能、延迟和成本

语言、口音和领域适应

  • 处理多种语言和口音
  • 自定义词汇和噪声容忍度
  • 法律、医疗或技术语言处理

输出格式化和集成

  • 添加时间戳、标点和说话人标签
  • 导出为文本、SRT或JSON格式
  • 将转录集成到apps或数据库

用例实施实验

  • 转录会议、访谈或播客
  • 语音转文字命令系统
  • 视频/音频流的实时字幕

评估、局限性和伦理

  • 准确性指标和模型基准测试
  • 语音模型中的偏见和公平性
  • 隐私和合规性考虑

总结和后续步骤

要求

  • 了解AI和机器学习的基本概念
  • 熟悉音频或媒体文件格式及工具

目标学员

  • 处理语音数据的数据科学家和AI工程师
  • 构建基于转录应用的软件开发人员
  • 探索语音识别以实现自动化的组织

即将举行的公开课程

课程分类