聯繫我們
 課程時長 14 時間: (2 天)

課程簡介

语音识别技术概览

  • 语音识别的历史与发展
  • 声学模型、语言模型与解码
  • 现代架构:RNN、transformers与Whisper

音频预处理与转录基础

  • 处理音频格式与采样率
  • 音频清理、裁剪与分段
  • 从音频生成文字:实时与批处理

动手实践Whisper及其他API

  • 安装并使用OpenAI Whisper
  • 调用云API(Google、Azure)进行转录
  • 比较性能、延迟与成本

语言、口音与领域适配

  • 处理多语言与多口音
  • 自定义词汇表与噪声容忍度
  • 法律、医学或技术语言的处理

输出格式化与集成

  • 添加时间戳、标点与说话人标签
  • 导出为文本、SRT或JSON格式
  • 将转录内容集成到应用程序或数据库中

用例实施实验

  • 转录会议、访谈或播客
  • 语音转文字指令系统
  • 为视频/音频流提供实时字幕

评估、局限性与伦理

  • 准确率指标与模型基准测试
  • 语音模型中的偏见与公平性
  • 隐私与合规考量

总结与后续步骤

最低要求

  • 了解通用的AI和机器学习概念
  • 熟悉音频或媒体文件格式及相关工具

目标受众

  • 处理语音数据的数据科学家与AI工程师
  • 构建基于转录应用的软件开发人员
  • 探索将语音识别用于自动化的组织

人數


每位參與者的報價

即將到來的課程

課程分類