強化學習原理與實踐(微課版)
吳賀俊
- 出版商: 清華大學
- 出版日期: 2026-09-01
- 售價: $414
- 語言: 簡體中文
- ISBN: 7302714282
- ISBN-13: 9787302714286
-
相關分類:
Reinforcement、DeepLearning
下單後立即進貨 (約4週~6週)
商品描述
作者簡介
目錄大綱
目錄
第1章強化學習基礎知識1
1.1緒論1
1.1.1強化學習的基本概念1
1.1.2強化學習的4個要素3
1.1.3強化學習的特點4
1.1.4小結5
1.2強化學習的問題模型5
1.2.1智能體和環境的動態交互過程5
1.2.2馬爾可夫決策過程5
1.2.3MDP中的優化問題7
1.2.4小結8
1.3值函數8
1.3.1概率和期望的數學基礎8
1.3.2值函數的引例: 送餐機器人11
1.3.3簡單值函數12
1.3.4標準值函數14
1.3.5狀態值函數計算14
1.3.6動作值函數計算15
1.3.7小結15
1.4最優值函數16
1.4.1策略分類16
1.4.2最優策略和最優值函數16
1.4.3小結17
1.5本章小結17
1.6本章常用符號列表18
第2章強化學習表格型求解法20
2.1動態規劃算法20〖3〗強化學習原理與實踐(微課版)目錄〖3〗2.1.1遞歸及動態規劃20
2.1.2貝爾曼算子21
2.1.3策略評估22
2.1.4策略改進23
2.1.5策略疊代評估改進24
2.1.6值函數疊代27
2.1.7小結29
2.2蒙特卡羅算法30
2.2.1蒙特卡羅算法介紹 30
2.2.2探索策略32
2.2.3策略異軌的蒙特卡羅算法35
2.2.4小結38
2.3時序差分算法38
2.3.1時序差分算法簡介38
2.3.2Sarsa: 策略同軌的時序差分算法40
2.3.3Q學習41
2.3.4值函數的偏差44
2.3.5雙Q學習45
2.3.6值函數預測的誤差46
2.3.7小結47
2.4本章常用符號列表48
第3章深度強化學習基礎50
3.1神經網絡基礎51
3.1.1人腦神經網絡和人工神經網絡51
3.1.2人工神經元52
3.1.3前饋神經網絡55
3.1.4小結57
3.2神經網絡的參數學習57
3.2.1損失函數57
3.2.2梯度反向傳播59
3.2.3梯度下降法64
3.2.4小結66
3.3采用深度神經網絡近似值函數的強化學習算法66
3.3.1用神經網絡近似值函數66
3.3.2DQN算法69
3.3.3DoubleDQN75
3.3.4DuelingDQN77
3.3.5小結78
3.4策略梯度定理78
3.4.1隨機策略梯度79
3.4.2采用策略梯度的強化學習方法: REINFORCE算法 83
3.4.3基於值函數梯度的方法與基於策略梯度的方法對比84
3.4.4小結85
3.5確定性策略梯度算法85
3.5.1確定性策略梯度85
3.5.2DDPG87
3.5.3小結89
3.6執行者評判者算法89
3.6.1執行者評判者算法的思路 89
3.6.2A2C以及A3C90
3.6.3小結94
3.7策略優化算法94
3.7.1TRPO94
3.7.2PPO97
3.7.3小結98
3.8本章常用符號列表99
第4章神經網絡與深度強化學習100
4.1卷積神經網絡100
4.1.1神經元與感受野100
4.1.2卷積神經網絡基礎102
4.1.3CNN的連接結構107
4.1.4卷積神經網絡的參數學習110
4.1.5其他卷積種類113
4.1.6經典卷積網絡113
4.1.7殘差網絡115
4.1.8深度強化學習與卷積神經網絡116
4.1.9小結118
4.2循環神經網絡118
4.2.1循環神經網絡基礎119
4.2.2長短期記憶網絡124
4.2.3深度強化學習與循環神經網絡131
4.2.4小結135
4.3Transformer模型135
4.3.1Transformer神經網絡基礎135
4.3.2註意力137
4.3.3註意力層139
4.3.4自註意力層141
4.3.5Transformer的組成142
4.3.6Transformer具體運行過程145
4.3.7Transformer的應用155
4.3.8深度強化學習與Transformer156
4.3.9小結167
4.4圖神經網絡167
4.4.1圖卷積網絡基礎167
4.4.2深度強化學習與圖神經網絡169
4.4.3小結170
4.5本章常用符號列表171
第5章貝葉斯強化學習173
5.1貝葉斯強化學習簡介173
5.2基礎知識一: 貝葉斯推斷、共軛先驗分布與湯普森采樣173
5.2.1貝葉斯推斷的流程174
5.2.2Binomial分布和其參數的共軛先驗分布Beta174
5.2.3Poisson分布和其參數的共軛先驗分布Gamma176
5.2.4Multinomial分布和其參數的共軛先驗分布Dirichlet178
5.2.5湯普森采樣180
5.2.6小結180
5.3基礎知識二: 高斯過程與高斯過程回歸180
5.3.1無參數的高斯過程回歸181
5.3.2有參數的高斯過程回歸182
5.3.3小結182
5.4有模型的貝葉斯強化學習182
5.4.1簡介182
5.4.2環境模型182
5.4.3貝葉斯自適應馬爾可夫決策過程183
5.4.4貝葉斯最優性183
5.4.5離線值逼近183
5.4.6在線值逼近185
5.4.7在線樹搜索值逼近186
5.4.8用探索獎勵以保證“可能近似正確”的方法187
5.4.9擴展到未知獎勵189
5.4.10小結189
5.5無模型的貝葉斯強化學習190
5.5.1簡介190
5.5.2值函數算法與高斯過程時序差分190
5.5.3貝葉斯策略梯度方法192
5.5.4小結194
5.6本章常用符號列表195
第6章其他類型的強化學習算法197
6.1基於模型的強化學習197
6.1.1環境模型學習198
6.1.2基於模型學習策略201
6.1.3DynaQ算法204
6.1.4基於模型的強化學習優勢205
6.1.5小結206
6.2分層強化學習206
6.2.1馬爾可夫過程和半馬爾可夫過程206
6.2.2基於選項的分層強化學習207
6.2.3基於選項的算法實例: OptionCritic算法208
6.2.4分層抽象機210
6.2.5MAXQ值函數分解212
6.2.6小結214
6.3人類建議強化學習214
6.3.1建議的提供與分類215
6.3.2解釋建議215
6.3.3建議塑造216
6.3.4算法實例: SVFB算法217
6.3.5小結218
6.4課程強化學習219
6.4.1遷移學習及其評價指標219
6.4.2課程及其評價指標219
6.4.3課程學習221
6.4.4算法實例: 教師學生課程學習222
6.4.5小結222
6.5安全強化學習223
6.5.1優化準則223
6.5.2探索過程225
6.5.3小結226
6.6最大熵強化學習226
6.6.1概率圖模型227
6.6.2基於概率推理的策略搜索228
6.6.3推理過程的優化目標229
6.6.4隨機轉移概率的優化方式230
6.6.5結構化變分推斷230
6.6.6小結231
6.7本章常用符號列表231
第7章多智能體強化學習基礎233
7.1多智能體系統233
7.2博弈論基礎234
7.2.1多智能體交互與博弈234
7.2.2標準形式博弈236
7.2.3納什均衡237
7.2.4重復博弈239
7.2.5馬爾可夫博弈241
7.2.6部分觀察隨機博弈244
7.2.7擴展形式博弈245
7.2.8平均場博弈247
7.3小結248
7.4本章常用符號列表249
第8章多智能體深度強化學習250
8.1獨立訓練運行的MADRL250
8.2集中式訓練、分布式執行的MADRL251
8.2.1基於值的集中式訓練、分布式執行的MADRL251
8.2.2基於策略的多智能體強化學習算法261
8.3智能體間通信的MADRL262
8.4互相推測的MADRL264
8.5多智能體強化學習展望265
8.6小結265
8.7本章常用符號列表266







