深入淺出深度學習——大模型開發必由之路

王翔宇、張亞寧

  • 出版商: 清華大學
  • 出版日期: 2026-08-01
  • 售價: $534
  • 語言: 簡體中文
  • ISBN: 7302722897
  • ISBN-13: 9787302722892
  • 相關分類: DeepLearning
  • 下單後立即進貨 (約4週~6週)

  • 深入淺出深度學習——大模型開發必由之路-preview-1
  • 深入淺出深度學習——大模型開發必由之路-preview-2
  • 深入淺出深度學習——大模型開發必由之路-preview-3
  • 深入淺出深度學習——大模型開發必由之路-preview-4
  • 深入淺出深度學習——大模型開發必由之路-preview-5
  • 深入淺出深度學習——大模型開發必由之路-preview-6
  • 深入淺出深度學習——大模型開發必由之路-preview-7
深入淺出深度學習——大模型開發必由之路-preview-1

商品描述

本書講解深度學習中的相關算法,通過細致地介紹和生動形象的實例,幫助讀者理解深度學習的原理,打開了解ChatGPT、DeepSeek等近期主流模型的大門。 本書共14章,采用循序漸進的結構,從基礎模型開始,逐步介紹復雜模型架構,最終聚焦於大模型的技術原理和應用實踐。第1章是緒論,介紹大模型的背景,第2~13章介紹各類深度學習和大模型的原理,第14章討論當前人工智能的缺陷,以及研究人員為了解決這些缺陷所做出的努力。 本書內容翔實、覆蓋面廣,在講解過程中列舉了生動形象的實例,適合對深度學習感興趣的初學者入門,並為作為領域的專業人士的參考讀物。

作者簡介

王翔宇,在大型證券公司擔任算法工程師、技術專家,有近10年金融科技相關工作經驗,從事金融產品分析、算法研究、量化投資工作。在CSSCI核心期刊、CPCI會議等發表多篇論文。在CSDN技術社區發表深度學習、機器學習、大模型、Python技術相關原創博客30多篇,總閱讀量超18萬人次。

目錄大綱

 

目錄

 

 

 

 

本書源碼

 

 

第1章緒論

 

1.1深度學習和大模型的定義

 

1.2人工智能的演進

 

1.3人工智能的三大範式

 

1.4深度學習的核心價值

 

1.5深度學習的應用領域

 

1.6讀者指南

 

1.6.1前置知識

 

1.6.2編程環境準備

 

第2章多層感知機

 

2.1模型結構

 

2.2模型的計算

 

2.2.1確定模型架構

 

2.2.2符號表示

 

2.2.3參數初始化

 

2.2.4正向計算過程

 

2.2.5誤差反向傳播

 

2.2.6預測過程

 

2.3模型的意義

 

2.4模型的不足

 

2.5模型優化技巧

 

2.5.1初始化技術

 

2.5.2激活函數

 

2.5.3Dropout正則化

 

2.5.4小批量梯度下降法

 

2.6常見概念的聯系和區別

 

2.7案例1: 多層感知機擬合各類函數

 

2.8案例2: 多層感知機預測泰坦尼克號乘客生還概率

 

2.8.1描述性統計

 

2.8.2多層感知機建模

 

2.8.3特征重要性分析

 

2.8.4利用模型預測

 

2.8.5數據處理拓展

 

第3章卷積神經網絡

 

3.1模型結構

 

3.1.1設計思路

 

3.1.2卷積層

 

3.1.3池化層

 

3.1.4全連接層

 

3.1.5激活函數

 

3.2卷積與池化的計算

 

3.2.1卷積的概念

 

3.2.2卷積的例子

 

3.2.3卷積的計算

 

3.2.4帶步長和填充的卷積計算

 

3.2.5池化的計算

 

3.3反卷積的計算

 

3.3.1基本思路

 

3.3.2反卷積中的步長和填充

 

3.3.3反卷積計算方法

 

3.3.4延伸討論

 

3.4卷積梯度的計算

 

3.4.1卷積結果對輸入的梯度

 

3.4.2卷積結果對卷積核的梯度

 

3.5反卷積梯度的計算

 

3.5.1反卷積結果對輸入的梯度

 

3.5.2反卷積結果對卷積核的梯度

 

3.5.3反卷積等價於誤差反向傳播

 

3.6模型的優勢

 

3.7模型的不足

 

3.8案例1: 卷積運算識別簡單形狀

 

3.9案例2: 卷積運算識別物體邊緣

 

3.10案例3: 用CNN識別手寫數字

 

第4章循環神經網絡

 

4.1模型結構

 

4.1.1序列數據的特點

 

4.1.2循環連接

 

4.1.3時間展開視角

 

4.2模型正向計算

 

4.3隨時間反向傳播算法

 

4.4模型的優勢

 

4.5模型的不足

 

4.6模型的應用場景

 

4.6.1自然語言處理

 

4.6.2語音和視頻處理

 

4.6.3其他應用場景

 

4.7模型的改進

 

4.7.1梯度裁剪

 

4.7.2雙向RNN

 

4.8案例: 用RNN寫唐詩

 

第5章LSTM與GRU

 

5.1LSTM的結構

 

5.1.1輸入門

 

5.1.2遺忘門

 

5.1.3輸出門

 

5.1.4記憶單元

 

5.2LSTM的優勢分析

 

5.3LSTM的劣勢分析

 

5.4GRU的結構

 

5.4.1重置門

 

5.4.2候選隱藏狀態

 

5.4.3更新門

 

5.4.4當前隱藏狀態

 

5.5LSTM與GRU的比較分析

 

5.5.1結構差異

 

5.5.2參數數量

 

5.5.3計算效率和訓練速度

 

5.5.4長距離建模能力

 

5.5.5場景適用性

 

5.6案例1: 演示LSTM和GRU的計算過程

 

5.7案例2: 用LSTM寫歌詞

 

第6章Transformer

 

6.1模型結構

 

6.2模型輸入處理

 

6.3註意力機制

 

6.3.1問題的引入

 

6.3.2註意力機制的設計思路

 

6.3.3註意力的計算

 

6.3.4多頭註意力

 

6.4Encoder的原理和結構

 

6.4.1多頭註意力

 

6.4.2前饋神經網絡

 

6.4.3殘差神經網絡

 

6.4.4層歸一化

 

6.4.5Dropout

 

6.4.6Padding Mask

 

6.5Decoder的原理和結構

 

6.5.1整體結構

 

6.5.2交叉註意力模塊

 

6.5.3輸入

 

6.5.4Look Ahead Mask

 

6.5.5輸出

 

6.6Transformer改進方法

 

6.7註意力機制與CNN、RNN的關系

 

6.8Transformer的優勢

 

6.9Transformer的劣勢

 

6.10案例: 使用Transformer構造中英文翻譯系統

 

第7章BERT

 

7.1BERT簡介

 

7.2自然語言處理的通用概念

 

7.3BERT的原理

 

7.4BERT的結構

 

7.5BERT的預訓練任務

 

7.5.1掩碼語言模型

 

7.5.2下一句預測

 

7.5.3句子順序預測

 

7.5.4BERT預訓練的意義

 

7.6BERT的微調

 

7.7BERT的參數量分析

 

7.8BERT的優勢

 

7.9BERT的劣勢

 

7.10BERT的改進版本

 

7.11BERT的擴展討論

 

7.12案例: 微調BERT模型用於情感分析

 

第8章GPT

 

8.1Decoderonly的優勢

 

8.2GPT的原理和結構

 

8.2.1GPT1的原理

 

8.2.2GPT1的結構

 

8.2.3原始文本預處理

 

8.2.4分詞

 

8.2.5詞嵌入

 

8.2.6位置編碼

 

8.2.7Decoder

 

8.2.8輸出層

 

8.3GPT的訓練和推理

 

8.3.1預訓練階段

 

8.3.2推理階段

 

8.3.3GPT模型的微調

 

8.4GPT1後續版本的演進

 

8.4.1GPT2

 

8.4.2GPT3

 

8.4.3GPT4

 

8.5模型的應用領域

 

8.6模型優勢

 

8.7模型劣勢

 

8.8案例: 利用GPT2打造文章續寫系統

 

第9章YOLO

 

9.1目標檢測任務介紹

 

9.1.1目標檢測算法的挑戰

 

9.1.2目標檢測評價指標

 

9.1.3目標檢測的數據集

 

9.1.4目標檢測算法的分類

 

9.2傳統目標檢測算法

 

9.2.1RCNN

 

9.2.2Fast RCNN

 

9.2.3Faster RCNN

 

9.3YOLO v1的原理

 

9.4YOLO v1的結構

 

9.5YOLO v1的計算過程

 

9.5.1預訓練分類網絡

 

9.5.2訓練目標檢測網絡

 

9.5.3推理階段

 

9.5.4NMS

 

9.5.5非極大值抑制的例子

 

9.6YOLO的改進

 

9.6.1YOLO v2的改進

 

9.6.2YOLO v3的改進

 

9.6.3YOLO後續版本的改進

 

9.7YOLO的優勢

 

9.8YOLO的劣勢

 

9.9案例: 使用YOLO對圖片做目標檢測

 

9.9.1項目介紹

 

9.9.2使用方法

 

第10章VAE

 

10.1生成模型簡介

 

10.2自編碼器原理與結構

 

10.2.1自編碼器結構

 

10.2.2損失函數

 

10.2.3AE重建的可行性

 

10.2.4AE的訓練

 

10.3AE的變形

 

10.3.1降噪自編碼器

 

10.3.2稀疏自編碼器

 

10.3.3收縮自編碼器

 

10.3.4卷積自編碼器和循環自編碼器

 

10.4AE的優劣勢分析

 

10.4.1優勢

 

10.4.2劣勢

 

10.5VAE的原理

 

10.5.1VAE的結構

 

10.5.2損失函數

 

10.5.3變分推斷

 

10.6VAE的優勢

 

10.7VAE的不足

 

10.8VAE的應用

 

10.9VAE模型與GMM模型的關系

 

10.10案例: 用VAE壓縮圖像

 

第11章對抗神經網絡

 

11.1模型簡介

 

11.2模型結構與原理

 

11.2.1符號表示

 

11.2.2生成模型與概率分布的關系

 

11.2.3Discriminator

 

11.2.4Generator

 

11.3模型訓練和推理過程

 

11.4GAN的變種

 

11.5模型優勢

 

11.6模型不足

 

11.7模型的應用

 

11.7.1圖像生成與編輯

 

11.7.2語音合成與轉換

 

11.8案例: 使用WGANGP生成小狗圖片

 

第12章擴散模型

 

12.1擴散模型背景

 

12.2模型結構與原理

 

12.2.1符號定義

 

12.2.2前向擴散過程

 

12.2.3反向去噪

 

12.3模型訓練與推理

 

12.4最大似然估計

 

12.5模型評價

 

12.6與VAE模型的關系

 

12.7模型的改進方向

 

12.8模型的應用

 

12.9模型優勢

 

12.10模型劣勢

 

12.11未來應用和發展方向

 

12.12案例: 微調擴散模型生成寶可夢角色

 

12.12.1Stable Diffusion簡介

 

12.12.2LoRA技術

 

12.12.3數據集準備

 

12.12.4模型準備

 

12.12.5代碼解析

 

第13章強化學習

 

13.1強化學習核心要素

 

13.2貝爾曼方程

 

13.2.1狀態價值函數與狀態動作價值函數

 

13.2.2貝爾曼期望方程

 

13.2.3貝爾曼最優方程

 

13.3強化學習分類

 

13.4QLearning

 

13.4.1時序差分

 

13.4.2模型原理

 

13.5DQN

 

13.6SARSA

 

13.7REINFORCE

 

13.7.1策略梯度定理

 

13.7.2REINFORCE的原理

 

13.7.3訓練過程

 

13.7.4基線的引入

 

13.8ActorCritic

 

13.8.1ActorCritic的原理

 

13.8.2訓練過程

 

13.9TRPO

 

13.9.1TRPO的原理

 

13.9.2訓練過程

 

13.10PPO

 

13.10.1PPO的原理

 

13.10.2PPO的訓練

 

13.10.3廣義優勢估計

 

13.11GRPO

 

13.12案例: 用強化學習走迷宮

 

13.12.1迷宮的構建

 

13.12.2QLearning

 

13.12.3SARSA

 

13.12.4REINFORCE

 

13.12.5PPO

 

第14章當前人工智能的缺陷

 

14.1數據依賴嚴重

 

14.2計算資源消耗極大

 

14.3可解釋性不足

 

14.4穩健性不足

 

14.5倫理與安全風險

 

14.6生成內容的質量

 

參考文獻

 

 

 

最後瀏覽商品 (20)