從零掌握大模型算法(部署微調與模型對齊)

AI新世界 趙星月 尹黎 周海艷

  • 出版商: 北京理工大學
  • 出版日期: 2026-05-01
  • 售價: $594
  • 語言: 簡體中文
  • 頁數: 239
  • ISBN: 7576366575
  • ISBN-13: 9787576366570
  • 相關分類: Large language model
  • 下單後立即進貨 (約4週~6週)

商品描述

本書系統講解了當前大規模預訓練模型領域的核心算法體系、工程化部署技術、微調優化方法及模型對齊實戰流程,致力於幫助讀者掌握大模型開發的完整工程技能路徑。 本書共10章,內容從大模型算法體系基礎與訓練優化算法講起,深入到大模型部署架構設計與推理優化,系統闡述全量微調技術與輕量化微調技術,詳細拆解RLHF算法及Prompt工程對齊實踐,重點覆蓋模型安全治理技術,輔以高性能部署優化與系統架構設計、典型行業微調與對齊實戰,最後通過綜合應用開發與工程實戰實現工程閉環。 全書突出算法深度、工程實操性與對齊攻防能力,內容覆蓋當前產業界主流實踐,緊貼前沿技術發展路徑,兼具理論深度與工程廣度,既可作為大模型技術學習參考書,也可作為企業內部工程團隊提升工程化能力的重要技術手冊。

目錄大綱

第1章 大模型算法體系基礎
1.1 大模型的發展歷程
1.1.1 從統計語言模型到Transformer架構
1.1.2 自回歸語言模型
1.1.3 掩碼語言模型
1.1.4 編碼-解碼結構
1.2 Transformer核心算法詳解
1.2.1 Self-Attention機制
1.2.2 多頭註意力機制
1.2.3 殘差連接與歸一化算法
1.2.4 前饋神經網絡優化
1.3 預訓練算法設計
1.3.1 掩碼策略與動態掩碼
1.3.2 Next Sentence預測任務
1.3.3 Prompt Learning算法實現
1.4 大模型優化算法
1.4.1 MoE模型
1.4.2 RoPE
1.4.3 Sparse Attention算法實現
1.4.4 FlashAttention算法實現
1.5 本章小結
1.6 習題
第2章 大模型訓練優化算法
2.1 高效優化器
2.1.1 AdamW優化器
2.1.2 Lion優化器
2.1.3 LAMB優化器
2.1.4 優化器調參
2.2 學習率調度算法
2.2.1 Warmup調度算法
2.2.2 Cosine Decay策略
2.2.3 OneCycle調度算法
2.3 分布式訓練算法
2.3.1 數據並行
2.3.2 模型並行
2.3.3 流水線並行
2.4 本章小結
2.5 習題
第3章 大模型部署架構設計與推理優化
3.1 部署架構分類
3.1.1 單機部署方案
3.1.2 多卡部署方案
3.1.3 雲原生部署架構
3.2 推理優化算法
3.2.1 ONNX圖優化
3.2.2 TensorRT動態批次優化
3.2.3 vLLM Paged Attention優化
3.2.4 KV Cache壓縮算法
3.3 流式推理系統設計
3.3.1 Token Streaming架構
3.3.2 高並發請求處理
3.3.3 GPU資源覆用策略
3.3.4 流式推理中的緩存優化
3.4 本章小結
3.5 習題
第4章 全量微調技術
4.1 全量微調算法
4.1.1 微調流程設計
4.1.2 參數凍結策略
4.1.3 災難性遺忘防護
4.2 微調數據處理
4.2.1 數據對齊策略
4.2.2 Prompt構建與優化
4.2.3 Pairwise Ranking數據處理
4.3 微調訓練優化
4.3.1 課程學習策略
4.3.2 分層學習率調度策略
4.3.3 多階段微調策略
4.4 本章小結
4.5 習題
第5章 輕量化微調技術
5.1 LoRA技術
5.1.1 LoRA技術的基本原理
5.1.2 Rank參數的選擇與影響
5.1.3 Dropout機制
5.2 QLoRA技術
5.2.1 4bit量化算法
5.2.2 QAT機制
5.2.3 QLoRA技術與全量微調技術對比
5.3 Prompt Tuning技術
5.3.1 Soft Prompt
5.3.2 Prefix Tuning
5.3.3 Prompt Parameterization
5.4 本章小結
5.5 習題
第6章 模型對齊算法與實戰流程
6.1 RLHF算法原理
6.1.1 Reward Model訓練算法
6.1.2 PPO算法
6.1.3 KL Penalty動態調整機制
6.1.4 RLHF收斂優化
6.2 數據驅動對齊
6.2.1 Pairwise Ranking數據設計
6.2.2 Adversarial Prompt數據設計
6.3 Prompt工程對齊
6.3.1 系統Prompt設計
6.3.2 Behavior Prompt控制
6.3.3 Prompt Layering技術
6.3.4 Prompt Injection防禦
6.4 對齊效果評估
6.4.1 Harmlessness指標
6.4.2 Helpfulness指標
6.4.3 Truthfulness指標
6.5 本章小結
6.6 習題
第7章 模型安全治理技術
7.1 Prompt Injection攻防
7.1.1 攻擊類型分析
7.1.2 Prompt Injection檢測
7.1.3 Prompt Guard
7.2 Guardrails系統實現
7.2.1 NeMo Guardrails框架
7.2.2 Rule-based Guardrails
7.2.3 Red-Teaming攻防測試
7.2.4 Guardrails效果評估
7.3 模型輸出安全治理
7.3.1 有害內容檢測算法
7.3.2 偏見檢測與糾正技術
7.3.3 毒性檢測算法
7.4 本章小結
7.5 習題
第8章 高性能部署優化與系統架構設計
8.1 高性能部署架構設計
8.1.1 多GPU並發架構
8.1.2 流式推理優化
8.1.3 動態批次調度
8.2 負載均衡與容錯
8.2.1 多租戶隔離設計
8.2.2 負載均衡算法
8.2.3 容災備份架構
8.2.4 灰度發布機制
8.3 本章小結
8.4 習題
第9章 典型行業微調與對齊實戰
9.1 金融行業
9.1.1 金融合規Prompt設計
9.1.2 金融知識對齊微調
9.1.3 金融行業評估體系
9.1.4 金融RAG應用
9.2 醫療行業
9.2.1 醫療術語對齊
9.2.2 醫療問答系統微調
9.2.3 醫療安全檢測
9.2.4 法規約束Prompt設計
9.3 法律行業
9.3.1 法律Prompt工程
9.3.2 法律文書生成優化
9.3.3 法律安全治理
9.3.4 法律行業微調
9.4 智能客服系統
9.4.1 多輪對話優化
9.4.2 用戶記憶機制優化
9.4.3 對齊與RAG結合優化
9.4.4 智能客服系統綜合優化
9.5