人工智能語音識別
林毅,賈如春 主編;張婷婷,吳濤,陳正茂 副主編;郭東嶽,諶利鵬,王慶揚,楊中平 參編
- 出版商: 清華大學
- 出版日期: 2026-06-01
- 定價: $359
- 售價: $358
- 語言: 簡體中文
- ISBN: 7302714010
- ISBN-13: 9787302714019
-
相關分類:
語音辨識 Speech-recognition
下單後立即進貨 (約4週~6週)
商品描述
目錄大綱
目錄
第1章緒論1
1.1什麼是語音1
1.2常見的語音應用2
1.2.1語音編碼3
1.2.2語音增強4
1.2.3語音識別4
1.2.4說話人識別5
1.2.5語音合成6
1.3本書的組織結構8
第2章語音信號基礎10
2.1語音信號的產生10
2.1.1語音信號的發聲過程11
2.1.2發聲器官的結構和功能11
2.2語音信號與電信號13
2.2.1語音信號轉換為電信號13
2.2.2語音信號的兩種表達形式14
2.3語音信號轉換15
2.3.1采樣16
2.3.2量化17
2.3.3編碼17
2.4語音信號的Python實踐21
2.4.1聲音文件的讀取與寫入21
2.4.2聲音文件的疊加等處理22
2.4.3采樣率轉換23
第3章語音信號處理與特征提取24
3.1概述24
3.2語音信號的預處理25
3.2.1預加重處理25
3.2.2語音分幀與加窗26
3.3語音信號的時域分析29
3.3.1短時能量、短時平均幅度29
3.3.2短時過零率30
3.3.3短時相關分析31
3.3.4短時平均幅度差函數33
3.4語音信號的頻域分析33
3.4.1短時傅裏葉變換34
3.4.2短時傅裏葉逆變換35
3.4.3短時功率譜35
3.4.4臨界頻帶特征矢量36
3.4.5語譜圖37
3.5語音信號的倒譜分析39
3.5.1同態信號處理的基本原理39
3.5.2復倒譜與倒譜40
3.5.3梅爾頻率倒譜系數41
3.5.4濾波器組特征44
3.6語音信號的線性預測分析44
3.6.1線性預測分析的基本原理44
3.6.2線性預測分析的求解45
3.6.3線性預測的譜分析47
3.6.4感知線性預測系數48
3.7語音信號特征提取實戰49
3.7.1librosa語音信號處理庫49
3.7.2librosa庫的安裝部署49
3.7.3提取語音信號時域特征50
3.7.4提取語音信號頻域特征52
3.7.5提取語音信號倒譜特征54
第4章語音增強57
4.1語音增強概述57
4.1.1語音增強理論57
4.1.2噪聲特性58
4.1.3語音增強相關研究任務59
4.2語音增強發展綜述60
4.2.1傳統的語音增強算法60
4.2.2基於機器學習的語音增強算法61
4.2.3基於神經網絡的語音增強算法61
4.3常用數據集62
4.3.1幹凈語音數據集63
4.3.2噪聲語音數據集63
4.3.3成對語音數據集65
4.4常用評價指標65
4.4.1主觀評價指標65
4.4.2客觀評價指標67
4.5傳統語音增強算法與基於機器學習的語音增強算法71
4.5.1傳統語音增強算法71
4.5.2基於機器學習的語音增強算法72
4.6基於神經網絡的語音增強算法73
4.6.1神經網絡形式73
4.6.2經典深度學習模型介紹77
4.7WebRTC基本介紹82
4.7.1什麼是WebRTC82
4.7.2WebRTC的發展歷史83
4.7.3WebRTC整體框架83
4.7.4WebRTC的使用場景84
4.8語音增強的應用與展望84
4.8.1語音增強相關應用84
4.8.2語音增強相關展望84
第5章語音識別86
5.1語音識別概述87
5.2語音識別發展綜述88
5.3常用數據集90
5.3.1中文數據集90
5.3.2英文數據集92
5.4評價指標94
5.4.1詞錯誤率94
5.4.2句錯誤率95
5.4.3實時率95
5.5聲學模型95
5.5.1GMMHMM95
5.5.2DNNHMM100
5.5.3端到端102
5.5.4序列到序列105
5.6語言模型110
5.6.1語言模型概述110
5.6.2語言模型發展綜述111
5.6.3數據標註與常見數據集114
5.6.4解碼方法115
5.6.5剪枝116
5.6.6統計語言模型構建117
5.7語音識別的應用與展望118
第6章說話人識別120
6.1說話人識別概述121
6.1.1說話人識別定義121
6.1.2說話人識別分類121
6.1.3說話人識別技術特點122
6.1.4說話人識別行業及國家標準122
6.2說話人識別發展綜述123
6.2.1基於簡單人工特征分析的起步階段123
6.2.2基於復雜特征與模板匹配方法的探索階段124
6.2.3基於混合高斯的識別模型的發展階段124
6.2.4基於深度特征學習與端到端學習的成熟階段124
6.2.5聚焦魯棒性問題的工程化實用化技術解決階段125
6.3數據采集與常用數據集125
6.3.1自動化數據采集方法126
6.3.2常用說話人識別數據集126
6.4評價指標129
6.4.1識別準確率、精確率、召回率與F1值130
6.4.2檢測錯誤權衡曲線與等錯誤率130
6.4.3接受者操作特性曲線與曲線下方的面積131
6.4.4最小檢測代價功能132
6.4.5TopN正確率132
6.5經典說話人識別算法132
6.5.1GMMUBM132
6.5.2ivector136
6.5.3dvector139
6.5.4xvector141
6.5.5DeepSpeaker142
6.5.6SincNet145
6.6說話人識別應用與展望147
6.6.1說話人識別應用場景147
6.6.2說話人識別前景展望147
第7章語音合成149
7.1引言149
7.2語音合成技術發展150
7.2.1硬件設備模擬合成150
7.2.2拼接法合成150
7.2.3統計參數語音合成151
7.2.4基於端到端的語音合成架構151
7.3數據標註與常用數據集151
7.3.1標貝科技151
7.3.2AiShell152
7.3.3LJspeech Dataset152
7.3.4DiDiSpeech152
7.3.5VCTK152
7.3.6CSS10152
7.3.7其他語料庫153
7.4評價指標153
7.4.1MOS值153
7.4.2ABX測評154
7.4.3系統性能指標154
7.5文本前端154
7.5.1文本歸一化155
7.5.2分詞155
7.5.3詞性標註155
7.5.4韻律預測155
7.5.5字素到音素轉換156
7.6聲學模型156
7.6.1統計參數語音合成系統的聲學模型156
7.6.2端到端的聲學模型156
7.6.3Tacotron157
7.6.4Tacotron2160
7.6.5FastSpeech161
7.6.6FastSpeech2164
7.7聲碼器166
7.7.1WaveNet166
7.7.2MelGAN168
7.7.3HiFiGAN170
7.8語音合成應用與展望172
第8章語音平臺174
8.1Kaldi175
8.1.1簡介175
8.1.2安裝175
8.1.3架構175
8.1.4訓練流程176
8.1.5功能183
8.2ESPnet185
8.2.1簡介185
8.2.2安裝185
8.2.3架構186
8.2.4訓練流程187
8.2.5功能188
8.3ESPnetSE191
8.3.1簡介191
8.3.2安裝191
8.3.3架構191
8.3.4訓練流程192
8.3.5功能193
8.4WeNet195
8.4.1簡介195
8.4.2安裝196
8.4.3架構196
8.4.4訓練流程197
8.4.5功能198
8.5PaddleSpeech199
8.5.1簡介199
8.5.2安裝199
8.5.3架構200
8.5.4訓練流程200
8.5.5功能202
第9章語音實驗205
9.1語音識別實驗206
9.1.1實驗描述206
9.1.2實驗環境206
9.1.3實驗內容207
9.2語音增強實驗211
9.2.1實驗描述211
9.2.2實驗環境211
9.2.3實驗內容212
9.3說話人識別實驗219
9.3.1實驗描述219
9.3.2實驗環境219
9.3.3實驗內容221



