深入淺出強化學習算法與實戰
朱萬林
- 出版商: 化學工業
- 出版日期: 2026-09-01
- 售價: $594
- 語言: 簡體中文
- 頁數: 321
- ISBN: 7122509540
- ISBN-13: 9787122509543
-
相關分類:
Reinforcement
下單後立即進貨 (約4週~6週)
相關主題
商品描述
本書循序漸進、深入系統地講解了強化學習的核心原理、主流算法與工程實踐,內容豐富、層次清晰、通俗易懂。全書共12章,涵蓋從基礎知識、經典算法,到深度強化學習、策略優化方法,再到離線強化學習、模型強化學習、多任務與多智能體系統等前沿內容。書中不僅詳細介紹了Q-learning、DQN、PPO、TRPO、GRPO等算法的原理與推導,還配套了多個完整實戰案例,如Atari遊戲、CartPole平衡控制、迷宮導航系統、機械臂抓取、多智能體博弈等,幫助讀者快速掌握從算法理解到項目落地的全流程技能。本書語言簡潔直觀,圖文結合,配有大量實戰項目和訓練結果分析,同時覆蓋了市面上同類圖書較少涉及的內容,如強化學習在大模型中的新應用(GRPO)、元強化學習的系統構建,以及工業級多智能體訓練框架,極具實用性與前瞻性,是學習強化學習開發技術與實戰應用的理想工具。
本書適合具有Python基礎、了解機器學習或深度學習初步知識的讀者閱讀,尤其適合人工智能開發者、AI工程師、機器人研究人員、自動化系統設計者,也可作為高校人工智能相關專業的教材或教學參考書,以及企業培訓課程的技術參考資料。
目錄大綱
第1章 強化學習基礎與核心概念 001
1.1 強化學習基礎知識 001
1.1.1 強化學習的誕生背景 001
1.1.2 強化學習的核心思想與要素 002
1.1.3 強化學習與其他機器學習方法的區別 003
1.1.4 強化學習的挑戰 004
1.2 強化學習的應用領域概覽 005
1.2.1 機器人控制與路徑規劃 005
1.2.2 遊戲與虛擬環境 006
1.2.3 金融與投資決策 006
1.2.4 自動駕駛與智能交通 007
1.2.5 自然語言處理中的應用 008
1.3 強化學習的理論基礎:馬爾可夫決策過程 009
1.3.1 MDP的概念和定義 009
1.3.2 策略、值函數(V, Q)和貝爾曼方程 010
1.4 OpenAI Gym環境初探 011
1.4.1 OpenAI Gym簡介 011
1.4.2 MountainCar環境 012
1.4.3 CartPole環境 016
第2章 強化學習的經典求解方法 022
2.1 動態規劃:策略疊代與值疊代 022
2.1.1 策略疊代 022
2.1.2 值疊代 027
2.2 蒙特卡洛方法:從經驗中學習 031
2.2.1 蒙特卡洛預測 031
2.2.2 蒙特卡洛控制 035
2.2.3 探索策略 039
2.3 時序差分學習 044
2.3.1 TD(0)預測和SARSA 045
2.3.2 Q-learning:離策略學習的代表 045
2.3.3 綜合實戰:使用Q-learning解決網格世界問題 050
第3章 深度Q網絡:從遊戲突破到通用值函數逼近 055
3.1 Q-learning的局限與深度化的必要性 055
3.1.1 數據相關性問題:Q-learning 面臨的挑戰 055
3.1.2 目標值的不穩定性:傳統方法的缺陷 056
3.1.3 高維狀態空間的困難:對深度化的需求 057
3.2 DQN的核心思想與突破 058
3.2.1 經驗回放:打破數據相關性 059
3.2.2 目標網絡:穩定學習目標 060
3.3 DQN算法流程與實現細節 061
3.3.1 DQN的神經網絡結構 062
3.3.2 訓練循環:從環境交互到參數更新 063
3.3.3 目標網絡的更新過程:權重同步時機與方法 071
3.3.4 超參數的選擇與調整:學習率、折扣因子等的影響 072
3.4 綜合實戰:用DQN玩轉Atari遊戲 074
3.4.1 Atari遊戲環境介紹 075
3.4.2 具體實現 075
第4章 DQN算法的演進 086
4.1 Double DQN 086
4.1.1 DQN算法的問題剖析 086
4.1.2 Double DQN的核心思想 087
4.1.3 Double DQN的算法流程與實現要點 088
4.1.4 綜合實戰:使用Double DQN實現超級馬裏奧遊戲 090
4.2 Dueling DQN 104
4.2.1 Dueling DQN的動機 104
4.2.2 Dueling DQN網絡架構設計 105
4.2.3 綜合實戰:使用Dueling DQN實現二維網格世界導航任務 106
4.3 優先級經驗回放 113
4.3.1 優先級經驗回放的動機 114
4.3.2 優先級定義與采樣策略 114
4.3.3 重要性采樣校正 115
4.3.4 綜合實戰:比較DQN中普通經驗回放和PER在CartPole問題中的表現 116
第5章 策略梯度方法:直接優化策略 121
5.1 策略梯度定理:理論基礎 121
5.1.1 策略梯度的定義與意義 121
5.1.2 與值函數方法的對比分析 122
5.1.3 策略梯度定理的適用場景與局限性 123
5.2 REINFORCE:蒙特卡洛策略梯度算法 125
5.2.1 算法原理與實現 125
5.2.2 基線的引入與作用 129
5.3 綜合實戰:CartPole平衡控制與LunarLander軟著陸 137
5.3.1 背景介紹 137
5.3.2 實驗環境與任務建模 137
5.3.3 具體實現 138
5.3.4 運行結果與分析 145
第6章 Actor-Critic算法:融合價值與策略—149
6.1 Actor-Critic原理 149
6.1.1 策略梯度與值函數結合的動機 149
6.1.2 Actor與Critic的角色分工 150
6.1.3 策略評估與策略改進的閉環 151
6.1.4 經典AC算法流程 152
6.1.5 綜合實戰:使用經典AC算法解決CartPole-v1平衡問題 154
6.2 A2C算法 159
6.2.1 優勢函數的數學原理 160
6.2.2 蒙特卡洛與TD誤差的優勢函數估計 161
6.2.3 GAE技術 161
6.2.4 綜合實戰:A2C算法實現與優勢估計方法比較 162
6.3 A3C算法 165
6.3.1 並行化架構設計 165
6.3.2 異步梯度更新與鎖機制 166
6.3.3 探索策略:熵正則化在A3C中的應用 167
6.3.4 綜合實戰:A2C和A3C的性能對比 168
6.4 SAC算法 171
6.4.1 熵正則化與探索激勵 171
6.4.2 SAC算法核心設計 173
6.4.3 綜合實戰:基於SAC算法的機械臂抓取任務 174
第7章 TRPO算法核心知識與應用實踐 182
7.1 TRPO基礎知識 182
7.1.1 TRPO算法的誕生背景 182
7.1.2 TRPO算法的意義 183
7.2 TRPO算法的核心原理 184
7.2.1 信任域概念的引入 184
7.2.2 構建目標函數與約束條件 185
7.2.3 綜合實戰:使用TRPO解決CartPole平衡問題 187
7.3 綜合實戰:基於低秩矩陣的TRPO優化 194
7.3.1 優化策略:NN-TRPO 和 TRLRPO 194
7.3.2 項目介紹 195
7.3.3 經驗數據管理和狀態空間離散化 195
7.3.4 定義環境 197
7.3.5 創建強化學習模型 198
7.3.6 創建代理 201
7.3.7 評估TRPO在CustomAcrobotEnv環境中的性能 208
7.3.8 評估TRPO在Mountain-CarContinuous-v0環境中的性能 210
7.3.9 評估TRPO在Custom-PendulumEnv環境中的性能 212
7.3.10 性能可視化 214
第8章 OpenAI的PPO和DeepSeek的GRPO 218
8.1 PPO算法的核心知識和應用 218
8.1.1 PPO的推出背景 218
8.1.2 PPO算法的基本思想 219
8.1.3 綜合實戰:使用PPO算法解決CartPole平衡問題 221
8.2 GRPO算法的核心知識和應用 226
8.2.1 GRPO的誕生背景 226
8.2.2 GRPO算法的基本原理 227
8.2.3 GRPO算法的數學推導 229
8.2.4 GRPO在DeepSeek-R1模型中的作用和表現 230
8.2.5 庫TRL 231
8.2.6 綜合實戰:使用GRPO算法訓練數學問題解答模型 233
第9章 離線強化學習:從歷史數據中學習策略 242
9.1 離線RL的核心挑戰 242
9.1.1 分布偏移 242
9.1.2 外推誤差 243
9.1.3 數據質量依賴性 244
9.2 約束策略優化 245
9.2.1 常用的約束策略優化方法介紹 245
9.2.2 綜合實戰:比較三種約束策略優化方法的性能 246
9.3 基於不確定性的方法 251
9.3.1 常用的基於不確定性的方法介紹 251
9.3.2 綜合實戰:比較三種基於不確定性的方法的性能 252
9.4 模仿正則化 260
9.4.1 常用的模仿正則化方法介紹 261
9.4.2 綜合實戰:評估AWAC、IQL和ORL方法的性能 262
第10章 前沿技術:基於模型的強化學習 276
10.1 基於模型和無模型的強化學習介紹 276
10.1.1 核心區別 276
10.1.2 基於模型的強化學習方法的優勢 278
10.1.3 無模型的強化學習方法的優勢 279
10.1.4 基於模型和無模型的強化學習方法的結合策略 280
10.1.5 綜合實戰:迷宮環境中的障礙物檢測與獎勵分配 282
10.2 學習環境動力學模型 289
10.2.1 模型表示形式:確定性模型與隨機模型 290
10.2.2 模型學習的損失函數 291
10.2.3 常用模型學習技術 292
10.2.4 處理部分可觀測性 293
10.2.5 綜合實戰:基於模型的CartPole動力學學習與規劃 294
10.3 利用模型進行規劃 303
10.3.1 規劃的基本概念:開環規劃與閉環規劃 303
10.3.2 經典規劃方法 304
10.3.3 采樣式規劃方法:蒙特卡洛樹搜索 305
10.3.4 采樣式規劃方法:模型預測控制 306
10.3.5 軌跡采樣與策略改進 308
10.3.6 綜合實戰:用采樣規劃方法解決一個網格世界問題 309
10.4 集成規劃與學習:前沿技術介紹 316
10.4.1 學習規劃器:端到端訓練 317
10.4.2 MuZero:統一學習、規劃與表示的典範 317
10.4.3 其他前沿方法簡述 318
第11章 多任務與元強化學習 320
11.1 多任務學習:共享知識解決多個任務 320
11.2 元強化學習:快速適應新任務 320
11.3 綜合實戰:基於元強化學習的迷宮導航系統 320
第12章 多智能體強化學習實戰:火星殖民地遊戲 321
12.1 項目背景介紹 321
12.2 功能介紹 321
12.3 運行環境 321
12.4 智能體核心邏輯 321
