深度學習與計算機視覺:理論與實踐

王艷娟

相關主題

商品描述

《深度學習與計算機視覺 : 理論與實踐》系統地介紹了深度學習與計算機視覺領域的基本概念、基本原理和基本方法。全書共10章,主要包括計算機視覺的基本概念、基本原理;深度學習的基本知識和基本原理;卷積神經網絡的基本知識和基本方法;遷移學習的相關知識;圖像分類的基本知識和主流算法模型;目標檢測的基本原理和主流算法模型;圖像分割的基本知識。同時,還介紹了生成式模型,如生成對抗網絡、擴散模型等。為幫助讀者充分了解和掌握基礎理論知識,第1~9章附有思維導圖及習題,並且第2~9章配有項目實戰,每個項目實戰都有詳細的指導手冊以及源代碼包,幫助讀者將理論應用於實踐。第10章是綜合實踐,幫助讀者系統地消化和應用本書的理論知識。本書概念清晰、系統性強、重點突出、圖文並茂。 《深度學習與計算機視覺 : 理論與實踐》既可作為高等院校人工智能相關專業和計算機相關專業的本科生教材,也可供深度學習與計算機視覺領域的研究生和工程技術人員參考。

作者簡介

王艷娟,女,博士,副教授,畢業於大連海事大學,現為大連交通大學副教授、碩士生導師。長期致力於人工智能、目標檢測與識別等相關教學與科研工作。主持或參與國家及省部級科研項目10餘項,發表學術論文20餘篇,其中SCI期刊論文15篇(以第一作者身份發表SCI論文9篇),申請國家發明專利2項,先後出版《Photoshop平面設計基礎》《匯編語言程序設計》《計算機網絡管理》教材,主持教學改革項目3項,發表教學改革類論文3篇。

目錄大綱

前言

第1章 計算機視覺概述 1
1.1 計算機視覺技術概述 1
1.1.1 計算機視覺的概念 1
1.1.2 計算機視覺技術的發展歷程 2
1.1.3 計算機視覺的功能 3
1.1.4 計算機視覺系統組成 4
1.1.5 計算機視覺的應用 7
1.2 計算機視覺管道 9
1.2.1 輸入數據 10
1.2.2 圖像預處理 12
1.2.3 特征提取 14
1.2.4 分類器學習算法 15
1.3 計算機視覺處理常用工具 17
1.3.1 OpenCV簡介 17
1.3.2 OpenCV-Python 17
1.3.3 OpenCV的基礎模塊 18
1.3.4 其他CV常用工具 18
1.4 Anaconda開發環境配置 19
1.4.1 Anaconda簡介 19
1.4.2 Anaconda常用操作指令 19
1.5 PyTorch框架安裝 20
1.5.1 PyTorch簡介 20
1.5.2 PyTorch常用函數 20
1.5.3 Jupyter Notebook使用PyTorch 22
1.6 PyCharm安裝 24
1.6.1 PyCharm創建Python項目 24
1.6.2 PyCharm使用PyTorch 29
本章小結 31
習題 31
第2章 深度學習基礎 32
2.1 機器學習概述 33
2.1.1 什麼是機器學習 33
2.1.2 機器學習的類別 34
2.1.3 機器學習的重要分支—深度
學習 34
2.1.4 機器學習的應用場景 35
2.2 感知機 37
2.2.1 感知機的定義 37
2.2.2 感知機的學習機制 40
2.2.3 單層感知機的局限 40
2.3 多層感知機 42
2.3.1 多層感知機架構 43
2.3.2 隱藏層的設計 44
2.4 激活函數 45
2.4.1 線性轉移函數 45
2.4.2 Heaviside階躍函數(二元
分類器) 46
2.4.3 Sigmoid函數 47
2.4.4 softmax函數 48
2.4.5 雙曲正切函數(tanh) 48
2.4.6 修正線性單元(ReLU) 49
2.5 前饋過程 50
2.5.1 前饋計算 51
2.5.2 特征學習 52
2.6 誤差函數 53
2.6.1 誤差函數的定義 53
2.6.2 誤差函數的意義 54
2.6.3 如何選擇合適的誤差函數 54
2.6.4 均方誤差函數 56
2.6.5 交叉熵損失函數 56
2.7 優化算法 58
2.7.1 優化的定義 58
2.7.2 批量梯度下降法 60
2.7.3 隨機梯度下降法 61
2.7.4 小批量梯度下降法 62
2.8 反向傳播 63
2.8.1 反向傳播的定義 63
2.8.2 反向傳播的總結 65
2.9 項目實戰:基於神經網絡的
手寫數字識別 65
本章小結 68
習題 69
第3章 卷積神經網絡 70
3.1 使用MLP進行圖像分類 71
3.1.1 MLP概述 71
3.1.2 MLP進行圖像分類 71
3.1.3 MLP的缺點 73
3.2 CNN架構 73
3.2.1 CNN概述 73
3.2.2 卷積層 76
3.2.3 池化層 79
3.2.4 全連接層 81
3.2.5 Dropout層 82
3.3 彩色圖像分類 85
3.3.1 彩色圖像的卷積 85
3.3.2 計算覆雜度的變化 86
3.4 使用CNN進行圖像分類 86
3.4.1 構建模型架構 87
3.4.2 參數計算方法 88
3.5 評價指標 89
3.5.1 混淆矩陣 89
3.5.2 精確率 90
3.5.3 召回率 90
3.5.4 F1得分 90
3.6 數據集的處理方法 91
3.6.1 數據集預處理 91
3.6.2 數據集劃分 94
3.7 超參數優化 95
3.7.1 超參數分類 96
3.7.2 超參數優化 97
3.8 項目實戰:基於CNN的鳶尾花
分類 99
3.8.1 數據集準備 99
3.8.2 模型設計 100
3.8.3 實驗準備 100
3.8.4 實驗代碼 100
3.8.5 實驗結果分析 103
本章小結 104
習題 105
第4章 遷移學習 106
4.1 遷移學習基礎 107
4.1.1 遷移學習的背景 107
4.1.2 遷移學習的概念 109
4.1.3 遷移學習的分類 111
4.2 遷移學習方法 113
4.2.1 基於實例的遷移學習方法 113
4.2.2 基於特征的遷移學習方法 114
4.2.3 基於模型的遷移學習方法 116
4.2.4 基於關系的遷移學習方法 117
4.3 遷移學習工作原理 120
4.3.1 使用預訓練網絡作為分類器 120
4.3.2 使用預訓練網絡作為特征
提取器 125
4.3.3 微調 127
4.4 項目實戰:利用遷移學習進行
鮮花分類 131
本章小結 136
習題 136
第5章 圖像分類 137
5.1 經典的卷積神經網絡模型 137
5.1.1 LeNet模型 138
5.1.2 AlexNet模型 139
5.1.3 VGGNet模型 141
5.2 基於殘差的網絡模型 143
5.2.1 ResNet模型 143
5.2.2 DenseNet模型 145
5.3 基於Transformer的網絡模型 148
5.3.1 Transformer網絡介紹 148
5.3.2 ViT模型 152
5.3.3 Swin Transformer模型 154
5.3.4 Mamba 模型 157
5.4 輕量化的網絡模型 159
5.4.1 MobileNet模型 159
5.4.2 PP-LCNet模型 161
5.5 項目實戰:動物圖像分類 163
5.5.1 模型構建 163
5.5.2 訓練階段 164
5.5.3 圖像推理 165
本章小結 166
習題 167
第6章 目標檢測 168
6.1 目標檢測概述 168
6.1.1 目標檢測和圖像分類的區別 169
6.1.2 目標檢測基本流程 169
6.1.3 核心問題與挑戰 170
6.2 目標檢測關鍵技術 171
6.2.1 候選區域 171
6.2.2 網絡預測 173
6.2.3 非極大值抑制(NMS) 173
6.2.4 評價指標 174
6.3 Two-Stage系列模型 175
6.3.1 R-CNN模型 175
6.3.2 SPP-Net模型 177
6.3.3 Fast R-CNN模型 179
6.3.4 Faster R-CNN模型 181
6.3.5 Grid R-CNN模型 184
6.4 YOLO系列模型 185
6.4.1 從Two-Stage到One-Stage 185
6.4.2 YOLO系列發展歷程 186
6.4.3 YOLOv8 192
6.4.4 YOLOv11 196
6.4.5 YOLOv13 201
6.4.6 YOLO26 204
6.5 項目實戰:基於YOLO的動物識別與檢測 206
本章小結 210
習題 211
第7章 圖像分割 212
7.1 圖像分割基礎 212
7.1.1 圖像分割概述 212
7.1.2 圖像分割的應用 215
7.1.3 圖像分割方法的評價指標 216
7.2 深度學習語義分割基礎網絡 221
7.2.1 FCN網絡模型 221
7.2.2 U-Net網絡模型 223
7.2.3 SegNet網絡模型 225
7.2.4 PSPNet網絡模型 226
7.2.5 DeepLabv3+網絡模型 227
7.2.6 SCTNet網絡模型 228
7.3 項目實戰:基於YOLOv5模型的
微顆粒圖像分割 230
本章小結 235
習題 235
第8章 生成對抗網絡 236
8.1 生成對抗網絡概述 237
8.1.1 背景 237
8.1.2 GAN的定義 237
8.1.3 GAN的優缺點 238
8.2 GAN的主流應用 239
8.2.1 文本生成圖像 239
8.2.2 圖像翻譯 240
8.2.3 圖像超分辨率重建 241
8.2.4 其他應用 243
8.3 模型架構 243
8.3.1 GAN模型結構 243
8.3.2 訓練GAN 245
8.3.3 目標函數 247
8.4 模型評估 249
8.4.1 IS評價指標 250
8.4.2 FID Score評價指標 251
8.5 項目實戰:利用SRGAN生成超
分辨率圖像 253
8.5.1 數據集的加載 253
8.5.2 訓練 254
8.5.3 可視化結果 255
本章小結 256
習題 256
第9章 擴散模型 257
9.1 擴散模型概述 258
9.1.1 背景 258
9.1.2 擴散模型簡介 259
9.1.3 擴散模型分類 261
9.1.4 擴散模型的應用 263
9.2 擴散模型原理 267
9.2.1 擴散過程 267
9.2.2 逆擴散過程 269
9.2.3 優化誤差函數 270
9.2.4 訓練和采樣過程 272
9.3 擴散模型架構 272
9.3.1 DDPM模型架構 272
9.3.2 Diffusion Transformer(DiT)
架構 274
9.4 項目實戰:基於擴散模型的鮮花
圖像生成 278
本章小結 279
習題 279
第10章 綜合實踐:交通標誌檢測 280
10.1 項目分析與設計 280
10.2 算法模型開發 280
10.2.1 數據準備 280
10.2.2 開發環境配置 283
10.2.3 模型選擇 288
10.2.4 數據集劃分 291
10.3 系統測試 295
10.3.1 訓練 295
10.3.2 推理 296
10.3.3 效果展示 297
10.3.4 代碼獲取 298
本章小結 298
參考文獻 299