AI大模型訓練與應用實踐

劉傑、仉乾隆、黃鵬、李兵

  • 出版商: 清華大學
  • 出版日期: 2026-07-01
  • 定價: $419
  • 售價: $418
  • 語言: 簡體中文
  • 頁數: 241
  • ISBN: 7302718741
  • ISBN-13: 9787302718741
  • 相關分類: Large language model
  • 下單後立即進貨 (約4週~6週)

  • AI大模型訓練與應用實踐-preview-1
  • AI大模型訓練與應用實踐-preview-2
  • AI大模型訓練與應用實踐-preview-3
AI大模型訓練與應用實踐-preview-1

商品描述

"《AI大模型訓練與應用實踐》內容包括對大模型知識的全面總結和基於大模型的人工智能應用所進行的實踐探索。大模型的設計和訓練旨在提供更強大、更準確的模型,以應對更復雜、更龐大的數據集或任務。大模型在各領域都有廣泛的應用,包括自然語言處理、計算機視覺、語音識別和推薦系統等。 本書的目標是幫助大模型使用者理解和掌握大模型的基本概念,並指導使用者應用這些模型解決實際問題。書中包含了大量的理論知識和實踐經驗,以及詳細的代碼示例,幫助使用者從理論到實踐全面應用大模型。 "

作者簡介

"劉傑:人工智能方向博士在讀,先後就職於中興通訊、騰訊科技(深圳)等公司,主要從事互聯網後端大規模分布式系統研發及大規模數據分析相關工作。主要研究方向包括數據分析、人工智能、中臺體系等技術方向。同時在數智驅動企業數字化運營及數字化轉型方向形成從戰略到落地的端到端的方法論,帶領數字化團隊打造多項企業數字化轉型經典案例。仉乾隆:十年互聯網廣告從業經驗,從 0 到 1 參與構建過行業標桿級訊飛廣告交易平臺。對高可用高並發分布式系統構建、海量數據處理以及 AI 模型與算法在廣告和教育領域的落地經驗豐富。個人興趣是復雜系統理論在商業與工程上的應用落地。黃鵬:科大訊飛企業數字化業務群技術總監,長期專註企業智能化轉型技術體系搭建。主導企業級大數據 PaaS 底座、企業 AI 能力中臺、流程自動化 RPA 產品的整體規劃與研發落地,精通數據治理、大模型工程化、智能 Agent 落地實踐,推動多項 AI 數字化產品規模化商用交付。李兵:十年互聯網大數據系統研發、營銷智能化運營從業經驗,曾從 0 到 1 打造業內**的訊飛營銷反欺詐系統和智能廣告運營系統。目前聚焦於辦公場景,利用多模態大模型、RPA 等核心技術,期望打造億級辦公人群提升效率的產品,改善工作效能和提升幸福感。"

目錄大綱

目錄

第1篇 導論

第1章 自然語言處理劃時代的突破:大模型的崛起 2

1.1 深度學習的演變歷程 2

1.1.1 人工神經網絡的起源 4

1.1.2 早期的統計語言模型 6

1.1.3 早期的神經網絡模型 7

1.1.4 卷積神經網絡的發展 9

1.1.5 RNN 模型和LSTM 模型 11

1.1.6 Transformer 模型 12

1.2 預訓練語言模型的崛起 14

1.2.1 預訓練技術 14

1.2.2 預訓練思想在自然語言處理中的應用 17

1.2.3 預訓練語言模型的發展歷程 19

1.2.4 典型的預訓練語言模型:ELMo、BERT 和GPT 21

1.3 大模型的時代 25

1.3.1 大模型的定義和特性 25

1.3.2 大模型的優勢和挑戰 26

1.3.3 大模型在自然語言處理中的應用 27

1.3.4 大模型的應用 28

1.4 大模型核心技術概覽 31

1.4.1 模型架構和設計 31

1.4.2 模型的加速 34

1.4.3 當前的挑戰和未來的趨勢 35

第2章 國內外主流大模型介紹 36

2.1 全球大模型概覽 36

2.2 代表型廠商及模型特點 37

2.2.1 OpenAI GPT 系列 37

2.2.2 Google(谷歌)PaLM 45

2.2.3 Meta LLaMA 系列 50

2.2.4 訊飛星火 53

2.2.5 百度文心一言 55

2.2.6 智譜 GLM 系列 56

2.2.7 百川大模型 58

2.2.8 Anthropic Claude 大模型 61

2.2.9 DeepSeek 系列大模型 62

2.3 大模型中文領域評測基準 65

2.3.1 C-Eval 66

2.3.2 SuperCLUE 69

2.3.3 AgentBench 70

第2篇 技術原理及實戰

第3章 深度學習中的大模型原理 74

3.1 深度學習驅動的自然語言處理 74

3.1.1 傳統機器學習算法的劣勢 74

3.1.2 深度學習與大模型時代對傳統機器學習算法的挑戰 75

3.2 深度學習中神經網絡的發展 75

3.2.1 淺層神經網絡與深度神經網絡 76

3.2.2 神經網絡結構的演進歷程 77

3.3 大模型架構 81

3.3.1 典型架構 81

3.3.2 大模型的技術架構層次 85

3.3.3 大模型核心組件的配置 87

3.4 大模型訓練的關鍵階段 93

第4章 大模型微調及評測 97

4.1 微調數據準備 98

4.1.1 開源數據集介紹 98

4.1.2 數據預處理手段 100

4.2 微調策略及框架 105

4.2.1 微調策略 105

4.2.2 加速策略 110

4.2.3 LLM 框架 115

4.3 微調效果評估 118

4.4 微調實戰:把大模型塞到多張小卡裏 121

第3篇 應用

第5章 大模型典型應用 132

5.1 大模型的應用概覽 132

5.1.1 C 端應用:個性化推薦、智能助手、內容創作等 132

5.1.2 B 端應用:客戶服務、數據分析、業務決策支持、運籌優化等 133

5.1.3 大模型在應用中的挑戰 134

5.2 基於星火13B 的智能檢索生成任務 135

5.2.1 什麼是RAG 135

5.2.2 RAG 架構 137

5.2.3 RAG 應用流程包含的階段 138

5.2.4 基於LangChain 的知識智能問答實踐 140

5.3 構建一個小粒度的Agent 145

5.3.1 AI Agent 的定義及現狀 145

5.3.2 數據獲取 149

5.3.3 模型微調與訓練 154

5.3.4 Agent 應用 159

5.4 構建您的智能客服 162

5.4.1 智能客服的業務需求和場景 162

5.4.2 數據獲取:收集和處理客服對話數據 167

5.4.3 構建模型 172

5.4.4 模型微調與訓練 174

5.5 創建您的數字分身 183

5.5.1 數字分身的需求和場景 183

5.5.2 數據獲取:收集和處理微博對話數據 184

5.5.3 模型訓練和優化 186

5.6 實現一個郵件分類器插件 194

5.6.1 郵件分類插件的需求和場景 194

5.6.2 數據獲取:收集和處理郵件數據 194

5.6.3 構建郵件分類模型 199

5.6.4 模型訓練和優化 200

第4篇 技術發展展望

第6章 大模型技術發展展望 208

6.1 大模型後續技術發展展望 208

6.1.1 多模態大模型 208

6.1.2 AI Agent 未來展望 209

6.1.3 具身智能 211

6.2 行業大模型技術發展展望 212

6.2.1 金融大模型 213

6.2.2 醫療大模型 215

6.2.3 法律大模型 217

6.2.4 教育大模型 219

6.3 企業私有化大模型落地路徑 220

6.3.1 提示詞工程 221

6.3.2 外掛知識庫 222

6.3.3 微調開源大模型 222

6.4 大模型發展的未來挑戰 223

6.4.1 大模型的數據資源問題 223

6.4.2 大模型的信息準確性 224

6.4.3 大模型的災難性遺忘問題 227

6.4.4 大模型的長上下文建模問題 230

6.4.5 大模型的可解釋性 232

6.4.6 大模型的計算成本和能源消耗 233

6.4.7 大模型的倫理與安全問題 234

參考文獻 239