大語言模型基礎(微課視頻版)

孫弋 主編,王安義、孫龍傑、田豐、陳旸、孫驍堯 副主編

  • 出版商: 清華大學
  • 出版日期: 2026-08-01
  • 售價: $414
  • 語言: 簡體中文
  • ISBN: 7302721033
  • ISBN-13: 9787302721031
  • 相關分類: Large language model
  • 下單後立即進貨 (約4週~6週)

  • 大語言模型基礎(微課視頻版)-preview-1
  • 大語言模型基礎(微課視頻版)-preview-2
  • 大語言模型基礎(微課視頻版)-preview-3
  • 大語言模型基礎(微課視頻版)-preview-4
  • 大語言模型基礎(微課視頻版)-preview-5
  • 大語言模型基礎(微課視頻版)-preview-6
  • 大語言模型基礎(微課視頻版)-preview-7
大語言模型基礎(微課視頻版)-preview-1

商品描述

本書以Transformer模型為核心,全面覆蓋大語言模型的構建與應用全流程,包括深度學習基礎、註意力機制、預訓練語料處理、數據表征、擴展法則、架構優化、預訓練、微調、推理、人類對齊及評測等關鍵環節。內容兼顧理論深度與實踐指導,通過數學推導、算法解析、代碼實現及案例分析,為讀者提供清晰的學習路徑。 全書共9章,第1章介紹Transformer模型的理論基礎與代碼實現,第2~4章探討預訓練語料、數據表征及擴展法則與架構設計,第5~7章深入預訓練、微調與推理的優化技術,第8章聚焦人類對齊的理論與實踐,第9章系統介紹評測方法。 本書面向高校學生、研究人員及人工智能領域從業者,註重前沿技術與**研究成果結合,適合作為人工智能、計算機科學相關專業的教材,也可作為自然語言處理及大語言模型開發者的參考書。通過閱讀本書,讀者可以掌握大語言模型的核心知識與基礎研究框架,為學術研究與技術應用奠定堅實基礎。

作者簡介

孫弋 教授、工學博士,長期從事信息學科教學與智能軟硬件產品的研究開發工作。信息技術與人工智能領域技術博主,跟蹤相關領域前沿技術與框架,並在各大媒體平臺分享相關視頻,受廣大網友好評。

目錄大綱

目錄

 

 

第1章Transformer模型基礎(90min)1

1.1深度學習1

1.1.1深度學習基礎1

1.1.2語言模型及其演變11

1.2註意力機制14

1.2.1註意力機制的定義14

1.2.2註意力機制的分類16

1.2.3註意力機制的數學原理19

1.2.4註意力機制的變體23

1.2.5註意力機制的應用27

1.3Transformer模型的關鍵支撐技術29

1.3.1歸一化方法29

1.3.2激活函數31

1.3.3位置編碼36

1.4Transformer基礎模型的代碼實現39

1.4.1輸入編碼模塊代碼實現39

1.4.2多頭自註意力機制模塊代碼實現40

1.4.3位置前饋網絡代碼實現44

1.4.4殘差連接與層歸一化代碼實現45

1.4.5編碼器代碼實現46

1.4.6解碼器代碼實現48

第2章大語言模型訓練語料(45min)54

2.1預訓練目標與方法54

2.1.1語言建模54

2.1.2上下文理解56

2.1.3知識獲取57

2.1.4多任務學習57

2.2預訓練語料58

2.2.1預訓練語料的定義58

2.2.2預訓練語料的來源60

2.2.3語言覆蓋63

2.2.4數據規模65

2.3語料預處理67

2.3.1語料去噪67

2.3.2低質過濾68

2.3.3冗余去除69

2.3.4隱私消除70

2.3.5詞元切分70

2.4語料調度71

2.4.1語料調度的定義71

2.4.2語料調度的基本原則和方法72

2.4.3預訓練案例73

第3章大語言模型數據表征(77min)75

3.1語言數據表征的歷史演進75

3.1.1基於規則和統計的方法75

3.1.2詞嵌入76

3.1.3上下文感知的詞嵌入77

3.1.4多模態表征78

3.2語言數據表征與信息表示79

3.2.1數據表征的基本概念79

3.2.2數據表征理論基礎81

3.3詞嵌入技術83

3.3.1詞嵌入技術的數學基礎83

3.3.2Skipgram模型83

3.3.3CBoW模型84

3.3.4詞嵌入模型實現的關鍵技術86

3.4句子與篇章嵌入技術92

3.4.1靜態句子嵌入技術93

3.4.2上下文句子嵌入96

3.5多模態表征技術102

3.5.1共享嵌入空間103

3.5.2CLIP: 圖文對比學習106

3.5.3ViLBERT: VisionandLanguage BERT108

3.6具身智能表征技術113

3.6.1具身智能基本概念與原理113

3.6.2具身智能表征方法114

3.6.3具身智能表征技術應用115

第4章大語言模型訓練的擴展法則和架構(67min)117

4.1擴展法則概述117

4.2擴展法則的數學建模120

4.2.1模型規模對性能的影響120

4.2.2訓練數據規模對性能的影響122

4.2.3計算量對性能的影響124

4.2.4綜合擴展法則的聯合優化126

4.3大語言模型主流擴展法則129

4.3.1KaplanMcCandlish 擴展法則129

4.3.2Chinchilla 擴展法則130

4.4大語言模型架構131

4.4.1編碼器解碼器架構131

4.4.2僅編碼器架構134

4.4.3僅解碼器架構136

4.5架構優化技術140

4.5.1稀疏註意力機制140

4.5.2模型並行化143

4.5.3混合專家模型146

4.6擴展法則與架構的協同設計150

4.6.1架構對擴展法則的影響150

4.6.2基於擴展法則的架構優化153

第5章大語言模型預訓練(74min)156

5.1預訓練概述156

5.2預訓練任務158

5.2.1掩碼語言模型159

5.2.2因果語言模型162

5.2.3序列到序列任務164

5.3預訓練優化167

5.3.1學習率調度167

5.3.2梯度裁剪170

5.3.3混合精度訓練172

5.4因果解碼器模型預訓練參數量計算與效率分析174

5.4.1大語言模型參數量計算175

5.4.2大語言模型預訓練運算量計算177

5.4.3大語言模型預訓練時間計算180

5.4.4大語言模型預訓練顯存計算182

第6章大語言模型微調(63min)187

6.1微調的基本概念187

6.1.1微調的定義與目標187

6.1.2微調與預訓練的區別188

6.1.3微調的應用場景190

6.2微調技術191

6.2.1全參數微調191

6.2.2提示微調194

6.2.3部分參數微調197

6.2.4高效微調技術207

6.3微調策略216

6.3.1數據準備216

6.3.2訓練過程優化218

6.3.3多任務與多語言微調220

第7章大語言模型推理(59min)224

7.1推理原理224

7.1.1推理的定義與類型224

7.1.2大語言模型中的推理任務226

7.2推理方法基礎227

7.2.1基於規則的推理228

7.2.2概率推理230

7.2.3思維鏈推理232

7.2.4自回歸推理236

7.3推理算法238

7.3.1解碼控制算法238

7.3.2結構化生成算法246

7.3.3復雜推理增強249

7.4推理優化技術257

7.4.1計算資源優化257

7.4.2模型結構優化262

7.4.3系統級優化265

第8章人類對齊(68min)269

8.1人類對齊概述269

8.1.1人類對齊基礎知識269

8.1.2人類對齊問題背景271

8.1.3人類對齊目標272

8.2人類對齊方法275

8.2.1人類對齊指令微調275

8.2.2人類反饋強化學習278

8.2.3RLHF的數學原理282

8.3人類對齊評估方法294

8.3.1人類對齊評估指標294

8.3.2人類對齊綜合評估框架296

8.4人類對齊案例研究299

8.4.1ChatGPT3的對齊實踐299

8.4.2GPT4的對齊案例300

8.4.3LLaMA模型的對齊實踐302

第9章大語言模型評測(47min)304

9.1大語言模型評測方法305

9.1.1定量評測方法305

9.1.2定性評測方法309

9.2標準基準數據集315

9.2.1基準數據集315

9.2.2基準數據集應用320

9.3大語言模型特定能力評估321

9.3.1語言理解能力321

9.3.2語言生成評估324

9.3.3推理和常識326

9.3.4世界知識329

9.3.5多模態能力331

9.4少樣本和零樣本評測334

9.4.1少樣本和零樣本評測概念334

9.4.2評估技術335

9.5穩健性和倫理考慮336

9.5.1穩健性評估336

9.5.2公平性和偏見評估337

9.5.3安全和倫理問題338

9.6評估技術實踐339

9.6.1實驗設置339

9.6.2統計顯著性341

9.6.3評測報告343

參考文獻345