開源大模型全鏈路訓練實踐:預訓練、後訓練與數據工程
周佺喜
- 出版商: 清華大學
- 出版日期: 2026-10-01
- 定價: $419
- 售價: $418
- 語言: 簡體中文
- ISBN: 7302726256
- ISBN-13: 9787302726258
-
相關分類:
Large language model
尚未上市,歡迎預購
相關主題
商品描述
作者簡介
目錄大綱
第1章 國內開源大模型技術體系概論 1 1.1 國內大模型發展格局與技術路線 1 1.1.1 主流開源模型架構對比分析 1 1.1.2 技術創新點與差異化策略 3 1.1.3 開源生態與社區建設現狀 4 1.2 DeepSeek系列模型技術解析 5 1.2.1 MoE架構設計與稀疏激活機制 6 1.2.2 多頭潛在註意力(MLA)創新 7 1.2.3 DeepSeek-R1推理模型與強化學習訓練 9 1.3 Qwen系列模型技術解析 11 1.3.1 模型規模譜系與 MoE架構演進 11 1.3.2 多模態統一與多模態融合 13 1.3.3 混合思考模式與Agent能力 14 1.4 GLM系列模型技術解析 15 1.4.1 GLM架構特點與 MoE設計 15 1.4.2 智能體原子能力與推理模型 16 1.4.3 開源策略與生態布局 17 1.5 KimiK2模型技術解析 19 1.5.1 萬億參數 MoE架構設計 20 1.5.2 MuonClip優化器與訓練穩定性 21 1.5.3 技術路線對比與選型建議 22 1.6 本章小結 24 第2章 訓練理論的數學基礎 25 2.1 優化理論與損失函數設計 25 2.1.1 梯度下降算法族的數學原理 25 2.1.2 自適應優化器的收斂性分析 27 2.1.3 損失函數的設計原則與權衡 28 2.2 分布式訓練的理論基礎 29 2.2.1 數據並行與模型並行的數學模型 29 Ⅳ 2.2.2 梯度同步與通信優化理論 31 2.2.3 流水線並行的效率分析 32 2.3 縮放定律與計算效率 34 2.3.1 ScalingLaw的數學推導 34 2.3.2 計算最優與數據最優的平衡點 36 2.3.3 模型規模與性能的冪律關系 37 2.4 註意力機制的數學本質 39 2.4.1 自註意力的信息論解釋 39 2.4.2 位置編碼的頻域分析 40 2.4.3 註意力優化的復雜度分析 41 2.5 本章小結 43 第3章 訓練數據的采集與清洗 44 3.1 數據源評估與采集策略 44 3.1.1 開源數據集的質量評估框架 44 3.1.2 網絡爬取的法律邊界與技術實現 46 3.1.3 專有數據的獲取與處理流程 47 3.2 數據清洗Pipeline設計 48 3.2.1 文本規範化與編碼統一 48 3.2.2 噪聲識別與過濾算法 49 3.2.3 敏感信息檢測與脫敏處理 50 3.3 去重技術與實現策略 51 3.3.1 MinHash算法原理與優化 51 3.3.2 語義去重的向量化方法 53 3.3.3 大規模去重的分布式實現 54 3.4 數據質量評估體系 55 3.4.1 語言質量的自動化評分 56 3.4.2 知識覆蓋度的量化指標 57 3.4.3 毒性與偏見的檢測方法 58 3.5 本章小結 59 第4章 數據增強與合成技術 61 4.1 基於規則的數據增強 61 4.1.1 回譯與paraphrase生成 61 4.1.2 模板化數據的批量生成 63 4.1.3 知識圖譜驅動的數據擴充 64 4.2 基於模型的數據合成 65 4.2.1 Self-Instruct方法與實踐 66 4.2.2 ConstitutionalAI數據生成 68 Ⅴ 4.2.3 疊代優化的數據質量提升 69 4.3 合成數據的質量控制 71 4.3.1 多樣性與覆蓋度評估 71 4.3.2 合成數據的驗證策略 72 4.3.3 人工與自動評估的結合 74 4.4 數據配比與課程學習 75 4.4.1 領域數據的最優混合比例 75 4.4.2 課程學習的排序策略 77 4.4.3 動態數據選擇算法 78 4.5 本章小結 79 第5章 預訓練架構設計與實現 80 5.1 訓練框架選型與適配 80 5.1.1 主流訓練框架對比分析 80 5.1.2 國產模型的框架適配要點 82 5.1.3 自定義算子的開發指南 83 5.2 分布式訓練架構設計 85 5.2.1 3D/4D並行策略的選擇與組合 85 5.2.2 通信拓撲的優化設計 87 5.2.3 容錯機制與檢查點管理 88 5.3 內存優化與計算加速 90 5.3.1 激活重計算的策略選擇 90 5.3.2 混合精度訓練的穩定性保障 91 5.3.3 FlashAttention與 MLA的工程實現 92 5.4 超參數調優策略 95 5.4.1 學習率調度的設計原則 95 5.4.2 批次大小與梯度累積策略 96 5.4.3 正則化參數的經驗設置 97 5.5 本章小結 98 第6章 預訓練過程監控與調試 100 6.1 訓練指標體系設計 100 6.1.1 損失曲線的異常模式識別 100 6.1.2 梯度統計與權重分布監控 102 6.1.3 驗證集性能的在線評估 104 6.2 訓練穩定性保障 106 6.2.1 梯度爆炸與消失的診斷 106 6.2.2 數值穩定性的保障措施 108 6.2.3 MoE負載均衡與穩定性 110 Ⅵ 6.2.4 訓練發散的恢復策略 111 6.3 性能瓶頸分析與優化 113 6.3.1 計算與通信的性能剖析 113 6.3.2 數據加載的Pipeline優化 115 6.3.3 GPU利用率的提升方法 117 6.4 實驗管理與版本控制 118 6.4.1 實驗配置的標準化管理 118 6.4.2 模型版本與數據版本追蹤 120 6.4.3 實驗結果的自動化分析 122 6.5 本章小結 123 第7章 監督微調與指令調優 125 7.1 指令數據的構建方法 125 7.1.1 任務分類與指令模板設計 125 7.1.2 多輪對話數據的組織形式 126 7.1.3 Chain-of-Thought數據構造 128 7.2 SFT訓練策略優化 130 7.2.1 數據采樣與重要性加權 130 7.2.2 多任務學習的平衡策略 131 7.2.3 災難性遺忘的緩解方法 132 7.3 參數高效微調技術 134 7.3.1 LoRA及其變體的原理分析 134 7.3.2 MoE模型的參數高效微調 135 7.3.3 混合微調策略的設計 137 7.4 微調效果評估方法 139 7.4.1 任務特定指標的設計 139 7.4.2 泛化能力的測試策略 140 7.4.3 人工評估的組織實施 141 7.5 本章小結 143 第8章 強化學習與偏好優化 144 8.1 RLHF技術體系詳解 144 8.1.1 獎勵模型的訓練策略 144 8.1.2 PPO算法的實現要點 145 8.1.3 KL散度約束的作用機制 147 8.2 直接偏好優化方法 148 8.2.1 DPO算法原理與推導 148 8.2.2 IPO、CPO與GRPO的改進思路 149 8.2.3 在線與離線方法的對比 151 Ⅶ 8.3 RLAIF與自動化反饋 152 8.3.1 AI反饋的可靠性分析 152 8.3.2 ConstitutionalAI訓練流程 153 8.3.3 疊代改進的反饋機制 155 8.4 推理模型與過程獎勵 156 8.4.1 過程獎勵模型(PRM)的設計 156 8.4.2 步驟級監督的實現方法 158 8.4.3 推理路徑的質量評估 160 8.5 本章小結 161 第9章 對齊技術與安全訓練 163 9.1 價值對齊的技術框架 163 9.1.1 有用性、誠實性、無害性平衡 163 9.1.2 紅隊測試與對抗訓練 164 9.1.3 Constitutional方法與自我改進 166 9.1.4 安全邊界的定義與實施 167 9.2 偏見緩解與公平性 168 9.2.1 偏見的檢測與量化方法 168 9.2.2 去偏技術的算法實現 170 9.2.3 公平性指標的設計原則 171 9.3 魯棒性與對抗防禦 173 9.3.1 對抗樣本的生成與檢測 173 9.3.2 魯棒訓練的策略選擇 174 9.3.3 防禦機制的有效性評估 175 9.4 可解釋性與透明度 177 9.4.1 註意力可視化技術 177 9.4.2 特征歸因方法的應用 179 9.4.3 決策過程的追蹤機制 180 9.5 本章小結 181 第10章 訓練基礎設施建設 183 10.1 計算集群架構設計 183 10.1.1 網絡拓撲與帶寬規劃 183 10.1.2 存儲系統的性能優化 185 10.1.3 調度系統的選型配置 187 10.2 訓練平臺工程化 188 10.2.1 容器化與環境管理 189 10.2.2 自動化訓練Pipeline 190 10.2.3 監控告警體系建設 192 Ⅷ 10.3 成本優化策略 193 10.3.1 算力資源的動態分配 193 10.3.2 Spot實例的使用策略 195 10.3.3 訓練效率的量化分析 196 10.4 團隊協作與知識管理 198 10.4.1 實驗協作流程設計 198 10.4.2 知識庫的構建和維護 200 10.4.3 最佳實踐的沈澱機制 201 10.5 本章小結 202 第11章 模型壓縮與部署優化 204 11.1 量化技術實踐 204 11.1.1 訓練後量化的方法選擇 204 11.1.2 量化感知訓練的實施 206 11.1.3 混合精度量化策略 207 11.2 知識蒸餾技術 209 11.2.1 教師模型的選擇策略 209 11.2.2 蒸餾損失的設計優化 210 11.2.3 多教師蒸餾的實現 211 11.3 模型剪枝與稀疏化 213 11.3.1 結構化剪枝的算法設計 213 11.3.2 非結構化剪枝的實現 215 11.3.3 動態稀疏訓練方法 216 11.4 推理加速技術 217 11.4.1 KVCache優化策略 217 11.4.2 MoE模型的推理優化 219 11.4.3 批處理與並發優化 220 11.4.4 硬件加速的適配方法 221 11.5 本章小結 222 第12章 持續學習與模型疊代 223 12.1 增量學習策略 223 12.1.1 新數據的融合方法 223 12.1.2 知識保留機制設計 224 12.1.3 性能退化的檢測預防 226 12.2 模型版本管理 227 12.2.1 版本發布流程規範 227 12.2.2 A/B測試的實施方案 229 12.2.3 回滾機制的設計實現 230 Ⅸ 12.3 在線學習與實時更新 232 12.3.1 流式數據的處理策略 232 12.3.2 在線RLHF的工程實現 234 12.3.3 實時性能監控體系 236 12.4 長期維護與演進規劃 237 12.4.1 技術債務的管理策略 237 12.4.2 架構演進的規劃方法 238 12.4.3 生態系統的持續建設 240 12.5 本章小結 241



