向量計算:換個角度學AI,打通任督二脈

  • 出版商: 清華大學
  • 出版日期: 2026-08-01
  • 售價: $588
  • 語言: 簡體中文
  • ISBN: 7302724857
  • ISBN-13: 9787302724858
  • 相關分類: Machine Learning
  • 下單後立即進貨 (約4週~6週)

  • 向量計算:換個角度學AI,打通任督二脈-preview-1
  • 向量計算:換個角度學AI,打通任督二脈-preview-2
  • 向量計算:換個角度學AI,打通任督二脈-preview-3
向量計算:換個角度學AI,打通任督二脈-preview-1

相關主題

商品描述

為什麼學了很多AI理論,面對大模型時依然感到“雲裏霧裏”?因為你可能陷入了枯燥的數學推導或繁雜的API調用中,卻忽略了貫穿AI世界的真正“靈魂”——向量計算。 本書拒絕照本宣科,主張“換個角度學AI”。我們將向量計算作為打通人工智能“任督二脈”的關鍵鑰匙,帶你穿越復雜的神經網絡表象,直抵智能產生的物理本質。本書從Embedding如何將萬物轉化為數字坐標講起,深入解密HNSW如何在大海撈針中實現毫秒級檢索,剖析向量數據庫與GPU硬件的底層加速機制,最終徹底講透RAG與Transformer註意力機制背後的向量流轉邏輯。 如果你不滿足於只做一個知其然而不知其所以然的“調包俠”,如果你渴望看透ChatGPT、推薦系統與以圖搜圖背後的底層法則,本書將帶你從微觀的數字計算走向宏觀的系統架構,徹底終結你對AI技術的“一知半解”,真正掌握駕馭智能時代的硬核能力。 本書適合渴望了解AI黑盒本質的高校學生、算法工程師、系統架構師和技術轉型者學習與使用。

作者簡介

清華大學博士,原任解放軍理工大學教授、博導、學科帶頭人,兼任中國大數據應用聯盟人工智能專家委員會主任、中國信息協會教育分會人工智能教育專家組長、教育部全國普通高校畢業生就業創業指導委員會委員、全國大學生數學建模競賽命題人、第45屆世界技能大賽中國雲計算專家指導組組長、中國電子學會雲計算專家委員會雲存儲組組長、工信部雲計算研究中心專家。 在雲計算、大數據和人工智能等領域具有多年的研究積累,是我國該領域知名專家。曾獲全球大數據處理比賽PennySort世界冠軍、全國大學生“挑戰杯”比賽總冠軍、AIM國家路演大賽中國區亞軍、中國先進技術轉化應用大賽銅獎,榮獲全軍十大學習成才標兵、江蘇省中青年科技領軍人才、南京十大傑出青年、中國大數據創新百人、清華大學特等獎學金等榮譽。 主持科研項目40余項,榮獲部級科學技術二等獎6項和三等獎3項。發表論文80余篇,授權發明專利66余項。出版的人工智能、大數據教材被全國高校廣泛采用,其中一本曾經位居中國高被引圖書計算機類**。並創辦了國內雲計算、大數據、人工智能等領域的門戶網站。 

目錄大綱

 

目  錄 

  

第1篇 入門篇 

第1章 走進向量計算的世界 ............... 2 

1.1 為什麼AI的核心是向量 

計算? ................................................ 2 

1.1.1 萬物皆可向量化 ........................ 2 

1.1.2 AI中的向量計算無處不在 ...... 4 

1.1.3 為什麼向量計算如此重要? .. 5 

1.1.4 向量計算的挑戰 ........................ 6 

1.2 從標量、向量、矩陣到張量 ........ 6 

1.2.1 標量:一個數字 ........................ 7 

1.2.2 向量:一串有序的數字 ........... 7 

1.2.3 矩陣:數字組成的表格 ........... 7 

1.2.4 張量:多維的數字集合 ........... 7 

1.2.5 維度的直觀理解 ........................ 8 

1.2.6 張量在AI中的應用 .................. 9 

1.3 向量計算的數學基礎 ..................... 9 

1.3.1 向量的表示 ................................. 9 

1.3.2 向量的可視化 ........................... 10 

1.3.3 向量的基本運算 ...................... 10 

1.3.4 向量的範數(長度).............. 13 

1.3.5 向量距離的度量 ...................... 14 

1.3.6 矩陣乘法 .................................... 15 

1.3.7 向量化計算的優勢 .................. 17 

1.3.8 實戰:用向量計算實現 

簡單推薦 ................................... 18 

1.4 本章小結 ......................................... 19 

1.5 參考文獻 ......................................... 20 

第2章 萬物皆向量:Embedding 技術 ........................................ 21 

2.1 文本向量化:從Word2Vec到 Transformer/BERT .......................... 21 

2.1.1 從One-Hot到分布式表示: 讓詞語“活”起來 .................. 21 

2.1.2 Word2Vec的兩種訓練方式: CBOW和Skip-Gram ............... 22 

2.1.3 負采樣:把百萬分之一的 計算變成二選一....................... 22 

2.1.4 BERT時代:上下文相關 的動態向量 ............................... 23 

2.1.5 從靜態到動態:向量表示 的進化 ........................................ 24 

2.2 圖像向量化:CNN與ViT特征 提取.................................................. 24 

2.2.1 CNN:用“窗口”掃描 圖像的智慧 ............................... 24 

2.2.2 ViT:把圖像切成“詞”, 用Transformer處理 .................. 26 

2.2.3 選擇CNN還是ViT? ............. 27 

2.2.4 實戰:如何從圖像中提取 向量? ........................................ 27 

2.3 多模態對齊:CLIP模型與跨 模態向量空間 ................................ 28 

2.3.1 CLIP的核心思想:對比 學習 ............................................. 29 

2.3.2 CLIP的雙編碼器架構 ............. 30 

2.3.3 InfoNCE損失函數:讓正確 答案脫穎而出 ........................... 30 

2.3.4 CLIP的神奇應用:零樣本 圖像分類 ................................... 31 

2.3.5 2025年CLIP的進化 ............... 32 

2.3.6 多模態檢索的實戰流程 ......... 32 

2.4 向量的降維與可視化 ................... 34 

2.4.1 為什麼要降維? ...................... 34 

2.4.2 PCA:主成分分析—— 找到數據的主軸 ...................... 34 

2.4.3 t-SNE:保留局部結構的 非線性降維 ............................... 36 

2.4.4 PCA VS t-SNE:如何選擇? . 37 

2.4.5 降維技術在向量數據庫中 的應用 ........................................ 38 

2.4.6 實戰:使用scikit-learn 進行降維 ................................... 38 

2.4.7 降維的註意事項 ...................... 39 

2.5 本章小結 ......................................... 40 

第2篇 算法篇 

第3章 向量相似度度量 ..................... 43 

3.1 距離算法詳解:歐氏距離、 余弦相似度、內積 ....................... 43 

3.1.1 歐氏距離:最直觀的 “物理距離” ........................... 43 

3.1.2 余弦相似度:關註“方向” 而非“長度” ........................... 44 

3.1.3 內積:兼顧方向和長度的 綜合度量 ................................... 45 

3.1.4 度量的數學性質與實現 ......... 47 

3.2 距離度量的選擇與應用場景 差異 .................................................. 47 

3.2.1 三種度量的全面對比.............. 48 

3.2.2 典型應用場景的選擇.............. 48 

3.2.3 數據特征對度量選擇的 影響 ............................................ 50 

3.2.4 計算效率與工程考量.............. 51 

3.2.5 實際案例分析 ........................... 51 

3.2.6 混合策略與動態選擇.............. 52 

3.3 本章小結 ......................................... 53 

3.4 參考文獻 ......................................... 55 

第4章 近似最近鄰搜索算法 ............. 56 

4.1 暴力搜索的局限性 ....................... 56 

4.1.1 KNN的基本原理 ..................... 56 

4.1.2 暴力搜索的時間代價 .............. 57 

4.1.3 暴力搜索的空間代價 .............. 58 

4.1.4 暴力搜索的適用場景 .............. 58 

4.1.5 問題的本質:精度 VS  速度 ............................................. 59 

4.1.6 ANN算法的核心思想............. 59 

4.2 基於樹的方法與基於哈希的 方法.................................................. 60 

4.2.1 基於樹的方法:KD-Tree ........ 60 

4.2.2 基於哈希的方法:LSH .......... 62 

4.2.3 為什麼需要HNSW? ............. 68 

4.3 核心算法詳解:HNSW ............... 68 

4.3.1 從小世界圖說起 ....................... 68 

4.3.2 HNSW的分層結構 .................. 69 

4.3.3 HNSW的搜索過程 .................. 71 

4.3.4 HNSW的參數調優 .................. 75 

4.3.5 HNSW的實戰應用 .................. 76 

4.3.6 HNSW VS 其他算法 ................ 78 

4.4 向量量化技術:標量量化與 乘積量化 ......................................... 78 

4.4.1 為什麼需要量化? .................. 78 

4.4.2 標量量化 .................................... 80 

4.4.3 乘積量化 .................................... 82 

4.4.4 量化實戰:使用Faiss進行 向量量化 .................................... 86 

4.4.5 量化策略的選擇 ....................... 89 

4.5 本章小結 ......................................... 90 

4.6 參考文獻 ......................................... 91 

第3篇 架構篇 

第5章 向量數據庫技術 ..................... 93 

5.1 向量數據庫 VS 傳統數據庫 ....... 93 

5.1.1 傳統數據庫的局限:為什 麼MySQL幹不了這個活 ...... 93 

5.1.2 向量數據庫的設計哲學: 為相似度而生 ........................... 94 

5.1.3 向量數據庫的核心能力 ......... 94 

5.2 主流向量數據庫架構解析 .......... 95 

5.2.1 Milvus:開源的向量數據 庫王者 ........................................ 95 

5.2.2 Pinecone:雲原生的向量 數據庫 ........................................ 96 

5.2.3 Chroma:輕量級的嵌入式 數據庫 ........................................ 97 

5.2.4 三大向量數據庫對比.............. 99 

5.2.5 其他向量數據庫 ...................... 99 

5.3 向量數據庫的增刪改查操作 ...... 99 

5.3.1 連接數據庫 ............................... 99 

5.3.2 創建集合 .................................... 99 

5.3.3 插入數據 .................................. 100 

5.3.4 創建索引 .................................. 101 

5.3.5 查詢數據 .................................. 102 

5.3.6 混合查詢:向量檢索+元 數據過濾 ................................. 103 

5.3.7 更新數據 .................................. 104 

5.3.8 刪除數據 .................................. 104 

5.3.9 完整CRUD示例 .................... 105 

5.3.10 性能優化技巧 ....................... 106 

5.4 實戰:搭建一個私有知識庫 問答系統 ....................................... 108 

5.4.1 系統架構 .................................. 108 

5.4.2 環境準備 .................................. 108 

5.4.3 文檔向量化 ............................. 108 

5.4.4 創建向量數據庫並存儲 ....... 110 

5.4.5 檢索相關文檔 ......................... 111 

5.4.6 生成答案 .................................. 112 

5.4.7 完整的RAG系統 .................. 113 

5.5 向量數據庫的性能優化與未來 趨勢 ................................................ 117 

5.5.1 性能優化的高級技巧............ 117 

5.5.2 2026年的技術趨勢................ 118 

5.5.3 向量數據庫的選型決策樹 ... 119 

5.6 本章小結 ....................................... 120 

5.7 參考文獻 ....................................... 121 

第6章 向量計算的硬件加速 ........... 122 

6.1 SIMD指令集與CPU加速 ........ 122 

6.1.1 什麼是SIMD:一條指令 處理多個數據 ......................... 122 

6.1.2 SIMD的歷史演進:從MMX 到AVX-512 .............................. 123 

6.1.3 SIMD實戰:用AVX加速 向量加法 .................................. 124 

6.1.4 SIMD的性能優勢與限制 ..... 125 

6.1.5 實際應用:NumPy的SIMD 優化 ........................................... 125 

6.1.6 2025年的SIMD:AMX 和SVE ...................................... 126 

6.2 GPU與CUDA編程模型中的 向量運算 ....................................... 126 

6.2.1 從CPU到GPU:並行計算 的革命 ...................................... 126 

6.2.2 GPU架構:從計算單元到 內存層次 .................................. 127 

6.2.3 CUDA編程模型:Thread、 Block、Grid.............................. 128 

6.2.4 性能優化:共享內存、內存 合並、Bank沖突 .................... 130 

6.2.5 PyTorch的GPU加速 ............. 131 

6.2.6 2025年的GPU:H100與 HBM3e ...................................... 132 

6.3 專用硬件:TPU與NPU對矩陣 乘法的優化 .................................. 133 

6.3.1 專用加速芯片的崛起:通用  VS 專用 .................................... 133 

6.3.2 TPU:Google的張量處理 單元 ........................................... 133 

6.3.3 NPU:神經網絡處理器 ........ 134 

6.3.4 Tensor Cores:GPU中的專 用矩陣單元 ............................. 135 

6.3.5 精度優化:INT8量化與 混合精度 .................................. 136 

6.3.6 2025年專用硬件的發展與 未來趨勢 .................................. 137 

6.4 實戰:優化向量計算性能 ........ 138 

6.4.1 案例1:優化CPU向量 加法 .......................................... 138 

6.4.2 案例2:優化GPU矩陣 乘法 .......................................... 139 

6.4.3 案例3:優化相似度計算 .... 140 

6.4.4 性能分析工具 ......................... 142 

6.5 硬件選擇與性能規劃 ................. 143 

6.5.1 如何選擇合適的硬件............ 143 

6.5.2 性能規劃:算力需求估算 ... 144 

6.5.3 成本優化 .................................. 145 

6.5.4 未來趨勢:2026—2030年 展望 .......................................... 145 

6.6 本章小結 ....................................... 146 

6.7 參考文獻 ....................................... 147 

第4篇 應用篇 

第7章 視覺向量計算 ....................... 149 

7.1 超大規模人臉識別與聚類 ........ 149 

7.1.1 人臉向量化:從像素到數 字身份證 ................................. 149 

7.1.2 人臉識別系統的完整工作 流程 .......................................... 150 

7.1.3 相似度計算:人臉比對的 核心 .......................................... 150 

7.1.4 向量聚類:從個體到群體 ... 151 

7.1.5 實際應用案例:智慧社區 門禁系統 ................................. 151 

7.1.6 大規模人臉識別的挑戰與 解決方案 ................................. 152 

7.1.7 代碼示例:人臉特征提取 與比對 ...................................... 153 

7.1.8 面向未來的趨勢 .................... 153 

7.2 以圖搜圖與視頻內容檢索 ........ 154 

7.2.1 以圖搜圖的基本原理............ 154 

7.2.2 圖像特征提取的演進歷程 ... 155 

7.2.3 特征提取的兩大流派: CNN VS ViT ............................ 155 

7.2.4 相似度度量與索引構建 ....... 156 

7.2.5 多模態檢索:CLIP的突破.. 157 

7.2.6 視頻內容檢索的特殊挑戰 ... 158 

7.2.7 實際應用案例 ......................... 159 

7.2.8 性能優化策略 ......................... 160 

7.2.9 代碼示例:基於CLIP的以 圖搜圖 ...................................... 160 

7.2.10 面向未來的趨勢 ................... 161 

7.3 本章小結 ....................................... 161 

7.4 參考文獻 ....................................... 162 

第8章 大模型時代的基石:RAG 技術 ...................................... 163 

8.1 什麼是大模型幻覺與知識 截止................................................ 163 

8.1.1 大模型幻覺:一本正經地 胡說八道 .................................. 163 

8.1.2 知識截止:大模型的記憶 局限 ........................................... 164 

8.1.3 傳統解決方案的局限 ............ 165 

8.1.4 RAG的核心理念:給大模 型裝上“外掛大腦” ............ 166 

8.1.5 RAG的價值主張 .................... 167 

8.2 RAG的標準架構 ......................... 168 

8.2.1 RAG系統的完整架構 ........... 168 

8.2.2 RAG與普通問答的對比 ...... 173 

8.2.3 RAG系統的關鍵參數調優 .. 174 

8.2.4 RAG系統的評估指標 ........... 175 

8.3 文檔切片與混合檢索策略 ........ 176 

8.3.1 文檔切片的藝術 ..................... 176 

8.3.2 切片的最佳實踐 ..................... 179 

8.3.3 混合檢索:關鍵詞 + 向量 ... 180 

8.3.4 檢索重排序 .............................. 183 

8.3.5 元數據過濾 .............................. 183 

8.4 RAG的進階應用 ......................... 184 

8.4.1 多輪對話中的RAG ............... 184 

8.4.2 多模態RAG ............................ 185 

8.4.3 Agent驅動的RAG ................. 186 

8.4.4 RAG系統的監控和優化 ...... 187 

8.5 本章小結 ....................................... 188 

8.6 參考文獻 ....................................... 189 

第9章 大模型推理與優化 ............... 190 

9.1 量化(Int8/FP4)對向量計算的 影響................................................ 190 

9.1.1 為什麼需要量化:大模型的“瘦身”需求 ......................... 190 

9.1.2 量化的數學原理:用更少的 比特表示更多的信息 ........... 190 

9.1.3 量化對向量計算的影響: 精度與性能的權衡 ................ 191 

9.1.4 量化實戰:從FP32到Int8 的模型轉換 ............................. 192 

9.2 註意力機制本質就是向量相 似度 ................................................ 193 

9.2.1 註意力機制的直觀理解: 聚焦關鍵信息 ......................... 193 

9.2.2 註意力機制的數學表達: 向量相似度的應用 ................ 193 

9.2.3 自註意力:序列內部的關系 建模 .......................................... 194 

9.2.4 註意力可視化:直觀理解 註意力權重 ............................. 194 

9.2.5 註意力機制的計算挑戰: O(n2)的復雜度 ........................ 195 

9.3 Flash Attention:IO感知的向量 計算優化 ....................................... 195 

9.3.1 傳統註意力的性能瓶頸: 內存訪問效率低下 ................ 195 

9.3.2 Flash Attention的核心創新: 分塊計算與重新排序 ........... 196 

9.3.3 Flash Attention的性能提升: 從理論到實踐 ......................... 196 

9.3.4 Flash Attention實戰:性能 對比 .......................................... 197 

9.3.5 未來趨勢:註意力優化的 新方向 ...................................... 198 

9.4 大模型推理的其他關鍵優化 技術 ................................................ 199 

9.4.1 KV緩存:避免重復計算 .... 199 

9.4.2 批處理:提高硬件利用率 ... 199 

9.4.3 模型並行與張量並行: 突破單卡內存限制 ................ 200 

9.4.4 推理優化框架:簡化部署 流程 .......................................... 200 

9.5 實戰:大模型推理性能優化全 流程................................................ 200 

9.5.1 優化目標與評估指標 ............ 200 

9.5.2 優化步驟:從模型到部署 ... 200 

9.5.3 案例研究:Llama 2 7B模型 推理優化 .................................. 201 

9.5.4 2025年最新優化技術回顧 ... 203 

9.6 本章小結 ....................................... 203 

9.7 參考文獻 ....................................... 204 

第5篇 實戰篇 

第10章 實戰1:搭建一個“私有知識庫問答助手” ..................... 206 

10.1 PDF文檔解析與文本切塊 ...... 206 

10.1.1 為什麼需要文檔解析和 文本切塊? ........................ 206 

10.1.2 安裝必要的Python庫 ....... 207 

10.1.3 加載和解析PDF文檔 ...... 207 

10.1.4 文檔切分:將長文檔轉化 為文本塊 ............................. 209 

10.1.5 豐富切片的元數據 ............ 211 

10.1.6 文檔切分的最佳實踐 ....... 212 

10.2 調用Embedding API進行向 量化 .............................................. 213 

10.2.1 什麼是文本向量化? ....... 213 

10.2.2 選擇合適的Embedding 模型 ...................................... 213 

10.2.3 使用OpenAI Embedding  API ........................................ 213 

10.2.4 使用LangChain進行向 量化 ...................................... 215 

10.2.5 使用開源Embedding 模型 ...................................... 215 

10.2.6 向量化性能優化 ................ 216 

10.3 存入向量數據庫 ........................ 217 

10.3.1 為什麼需要向量數 據庫? ................................. 217 

10.3.2 主流向量數據庫對比 ....... 218 

10.3.3 使用Chroma向量數據庫 . 218 

10.3.4 使用LangChain集成向量 數據庫 ................................. 220 

10.3.5 使用Milvus向量數據庫 .. 221 

10.3.6 向量數據庫的性能優化... 223 

10.4 結合LLM API實現“基於文 檔回答問題” ............................. 224 

10.4.1 RAG系統的完整架構 ...... 224 

10.4.2 構建簡單的RAG鏈 ......... 225 

10.4.3 自定義提示詞模板 ........... 225 

10.4.4 直接使用OpenAI API ....... 226 

10.4.5 處理多輪對話 .................... 228 

10.4.6 添加來源追溯功能 ........... 229 

10.4.7 搭建Web界面 ................... 230 

10.4.8 性能優化和錯誤處理 ....... 232 

10.4.9 完整的RAG系統代碼 ..... 234 

10.5 本章小結 ..................................... 240 

10.6 參考文獻 ..................................... 241 

第11章 實戰2:構建“以圖搜圖” 向量檢索系統 ..................... 242 

11.1 圖像數據準備與預處理 ........... 242 

11.1.1 為什麼需要圖像預 處理? ................................. 242 

11.1.2 圖像數據集準備 ................ 242 

11.1.3 圖像預處理工具 ................ 244 

11.1.4 數據增強 ............................. 245 

11.1.5 圖像質量評估 .................... 247 

11.1.6 批量處理圖像數據集 ....... 249 

11.2 使用CLIP模型提取圖像 特征 .............................................. 251 

11.2.1 什麼是CLIP模型? ......... 251 

11.2.2 CLIP模型架構詳解 .......... 251 

11.2.3 安裝CLIP模型 .................. 251 

11.2.4 使用OpenAI CLIP提取 圖像特征 ............................ 252 

11.2.5 使用Sentence-Transformers 提取圖像特征 ................... 255 

11.2.6 保存和加載圖像特征........ 257 

11.2.7 特征可視化 ......................... 258 

11.3 存入向量數據庫 ........................ 259 

11.3.1 為什麼需要向量數據庫 存儲圖像特征? ............... 259 

11.3.2 選擇適合圖像檢索的向量 數據庫 ................................. 259 

11.3.3 使用Chroma存儲圖像 向量 ...................................... 260 

11.3.4 使用Faiss進行圖像檢索 .. 261 

11.3.5 使用Qdrant進行圖像 檢索 ...................................... 264 

11.3.6 優化向量數據庫性能........ 267 

11.4 實現“以圖搜圖”檢索功能 .. 268 

11.4.1 完整的以圖搜圖系統 架構 ...................................... 268 

11.4.2 構建核心檢索函數 ............ 268 

11.4.3 實現批量搜索 ..................... 271 

11.4.4 添加高級過濾功能 ............ 272 

11.4.5 構建Web界面 .................... 273 

11.4.6 實現多模態檢索(“以文 搜圖”) ............................... 275 

11.4.7 性能優化技巧 ..................... 276 

11.4.8 評估檢索性能 ..................... 278 

11.4.9 完整的以圖搜圖系統 代碼 ...................................... 280 

11.5 本章小結 ..................................... 287 

11.6 參考文獻 ..................................... 288 

第12章 實戰3:構建個性化電影 推薦引擎 ............................ 289 

12.1 雙塔模型(User向量與Item 向量)設計 ................................. 289 

12.1.1 推薦系統的核心挑戰 ....... 289 

12.1.2 雙塔模型的核心架構 ....... 289 

12.1.3 向量相似度計算:如何 判斷匹配度 ........................ 290 

12.1.4 雙塔模型的優勢 ................ 291 

12.1.5 模型訓練:如何讓模型 學會理解用戶和電影 ....... 292 

12.2 矩陣分解與向量內積召回 ...... 293 

12.2.1 矩陣分解:從協同過濾到 向量表示 ............................ 293 

12.2.2 矩陣分解的求解方法 ....... 294 

12.2.3 從矩陣分解到雙塔模型... 295 

12.2.4 召回:從海量候選中快速 篩選 ..................................... 296 

12.3 解決冷啟動問題:利用內容 特征補充行為數據 .................... 298 

12.3.1 冷啟動問題與挑戰 ........... 298 

12.3.2 基於內容特征的冷啟動 解決方案 ............................ 298 

12.3.3 混合策略:行為數據與 內容特征的融合 ............... 301 

12.3.4 冷啟動效果的評估 ........... 303 

12.3.5 實戰案例:某視頻平臺 的冷啟動優化 ................... 304 

12.4 本章小結 ..................................... 305 

12.5 參考文獻 ..................................... 306 

第13章 實戰4:Transformer 內核——Self-Attention 與KV Cache ...................... 307 

13.1 Self-Attention的QKV機制 ...... 307 

13.1.1 為什麼需要Self- Attention? .......................... 307 

13.1.2 QKV(查詢、鍵、值) 的直觀理解 ........................ 308 

13.1.3 Self-Attention的數學 原理 ..................................... 308 

13.1.4 詳細計算示例 .................... 311 

13.1.5 多頭註意力 ......................... 315 

13.1.6 Self-Attention的可視化與 解釋 ..................................... 318 

13.1.7 Self-Attention與RNN、 CNN的比較 ....................... 319 

13.2 位置編碼 ..................................... 320 

13.2.1 為什麼需要位置編碼? ... 320 

13.2.2 絕對位置編碼 ..................... 320 

13.2.2.1 正弦/余弦位置 編碼 ..................... 321 

13.2.2.2 可學習的位置 編碼 ..................... 323 

13.2.2.3 絕對位置編碼的 局限 ..................... 323 

13.2.3 相對位置編碼 ..................... 324 

13.2.4 旋轉位置編碼 ..................... 325 

13.2.4.1 RoPE的核心 思想 ..................... 325 

13.2.4.2 為什麼RoPE能編 碼相對位置? ... 325 

13.2.4.3 RoPE的實現 ..... 326 

13.2.5 位置編碼的比較與選擇 ... 327 

13.3 KV Cache:推理加速的基石 .. 327 

13.3.1 Transformer推理的挑戰: 自回歸生成 ........................ 327 

13.3.2 KV Cache的原理 ............... 328 

13.3.3 KV Cache的詳細實現 ....... 329 

13.3.3.1 緩存結構 ............ 329 

13.3.3.2 緩存更新策略 ... 330 

13.3.3.3 代碼實現 ............ 331 

13.3.4 KV Cache的內存與計算 權衡 ...................................... 332 

13.3.5 KV Cache的優化技術 ....... 333 

13.3.5.1 量化 ..................... 333 

13.3.5.2 Paged Attention(分頁註意力) ........ 334 

13.3.5.3 分組查詢註 意力 ..................... 335 

13.3.5.4 動態緩存管理 ... 336 

13.3.6 KV Cache的工程挑戰與 解決方案 ............................. 337 

13.3.6.1 顯存不足 ............ 337 

13.3.6.2 內存碎片 ............ 337 

13.3.6.3 緩存共享 ............ 337 

13.3.6.4 動態批處理 ....... 337 

13.4 Transformer推理優化全景 ....... 338 

13.4.1 推理流程:Prefill與 Decode ................................. 338 

13.4.2 計算優化 ............................. 339 

13.4.2.1 Flash Attention .... 339 

13.4.2.2 算子融合 ........... 340 

13.4.2.3 編譯優化 ........... 340 

13.4.3 內存優化 ............................. 341 

13.4.3.1 激活值顯存 優化 ..................... 341 

13.4.3.2 權重量化(Weight Quantization) .... 342 

13.4.4 推理框架與工具 ................ 342 

13.4.4.1 vLLM .................. 342 

13.4.4.2 TensorRT-LLM ... 343 

13.4.4.3 DeepSpeed-FastGen ................ 343 

13.4.5 性能基準測試與調優 ....... 344 

13.4.5.1 關鍵指標: 餐廳的“體 檢報告” ............ 344 

13.4.5.2 調優建議:根據 場景“看人下菜碟” ..................... 345 

13.5 本章小結 ..................................... 345 

13.6 參考文獻 ..................................... 346