联系我们
 课程时长 14 小时 (2 天数)

课程大纲

语音合成与语音克隆简介

  • 文本转语音(TTS)和神经语音合成概述
  • 语音克隆与语音生成:用例和边界
  • 关键模型:Tacotron、WaveNet、FastSpeech、VITS

使用商业平台

  • 使用ElevenLabs和Resemble AI
  • 语音创建、克隆和编辑
  • API访问和文本转语音工作流程

使用开源工具构建

  • 安装和配置Coqui TTS
  • 训练自定义语音和管理数据集
  • 精细控制生成语音(音调、速度、情感)

数据准备和语音数据集管理

  • 收集和清理语音样本
  • 分段、标注和对齐转录文本
  • 伦理来源和语音同意

应用集成

  • 在网站和应用程序中嵌入TTS
  • 创建IVR系统和交互式机器人
  • 为视频和游戏生成合成对话

评估质量和真实感

  • 平均意见得分(MOS)和可懂度测试
  • 控制表现力和韵律
  • 比较延迟、保真度和真实感

伦理、法律和治理考量

  • 深度伪造风险和负责任的使用
  • 同意、署名和版权影响
  • 法规和组织政策

总结和后续步骤

要求

  • 了解机器学习基础知识
  • 熟悉音频文件格式和编辑工具
  • 基础Python编程技能

目标受众

  • 对语音合成感兴趣的AI开发者和工程师
  • 探索语音生成的内容创作者和媒体技术专家
  • 构建个性化或动态音频系统的研发团队

即将举行的公开课程

课程分类