vLLM與SGLang(大模型高效推理雙引擎實戰)
李明飛
- 出版商: 電子工業
- 出版日期: 2026-08-01
- 售價: $594
- 語言: 簡體中文
- 頁數: 468
- ISBN: 7121531763
- ISBN-13: 9787121531767
-
相關分類:
Large language model
下單後立即進貨 (約4週~6週)
相關主題
商品描述
本書以vLLM與SGLang兩大主流開源推理框架為核心,系統講解其從理論基礎到生產部署的完整知識體系,是面向算法工程師與系統工程師的實戰參考手冊。 全書共14章,分為3部分。第1部分(第1~4章)夯實理論基礎,涵蓋Transformer推理機制、KV緩存原理、連續批處理、FlashAttention、投機解碼等核心算法,幫助讀者建立紮實的推理優化認知體系。第2部分(第5~12章)以項目驅動的方式深入實踐,內容涵蓋長文檔處理、結構化輸出、多模態實時視頻理解、多智能體協作、生產級服務部署與監控,以及基於vLLM的DeepSeek-V4長上下文推理服務等典型工程場景,每章均提供可直接覆用的完整工程代碼。第3部分(第13~14章)聚焦進階優化與技術前沿,系統梳理模型量化、分布式推理、軟硬件協同等高階技術路徑,並對以DeepSeek-V4為代表的新一代模型架構發展趨勢與推理框架演進方向做出研判與展望。 本書註重工程嚴謹性,力求做到開卷即用、經得起生產環境的檢驗。無論是希望系統入門推理優化的工程師,還是尋求在生產實踐中進一步提升系統性能的資深從業者,均可從本書中獲得切實的啟發。
作者簡介
李明飛,清華大學軟件學院軟件工程專業碩士,計算機科學教育專家。現任教育部學位與研究生教育發展中心學位論文評審專家,長期從事數據智能與人工智能領域的技術研究、工程實踐與人才培養工作。在大模型原理、Agent系統設計、大模型推理方向有系統深入的研究積累,對vLLM、SGLang等推理引擎的底層機制與性能優化有深入理解,有豐富的生產級落地經驗。
目錄大綱
第1章 大模型推理技術演進與挑戰
1.1 大模型推理的核心痛點
1.1.1 內存墻問題與KV緩存優化需求
1.1.2 推理延遲與吞吐量的平衡難題
1.1.3 多樣化部署場景的適配挑戰
1.2 主流推理框架技術譜系
1.2.1 從HuggingFace Transformers到專用推理引擎
1.2.2 vLLM與SGLang的技術定位
1.3 本書技術選型邏輯
本章參考文獻
第2章 vLLM核心技術解析
2.1 vLLM架構與設計哲學
2.1.1 整體架構概覽
2.1.2 vLLM設計哲學的三大原則
2.1.3 PagedAttention機制深度剖析
2.1.4 連續批處理的原理
2.1.5 KV緩存管理策略
2.2 vLLM性能優化技術
2.2.1 算子融合與CUDA內核優化
2.2.2 張量並行與流程並行實現
2.2.3 投機解碼支持
2.3 OpenAI兼容接口與服務接入
第3章 SGLang核心技術解析
3.1 SGLang架構與創新理念
3.1.1 結構化生成語言的設計哲學
3.1.2 RadixAttention共享前綴優化機制
3.1.3 程序化提示工程範式
3.2 SGLang的獨特優化技術
3.2.1 約束解碼的實現原理
3.2.2 多輪對話上下文管理優化
3.3 SGLang的編程模型
第4章 vLLM與SGLang技術對比
4.1 性能維度分析
4.1.1 KV緩存管理的兩種哲學
4.1.2 批量吞吐:數據、原因與邊界條件
4.1.3 延遲的多維分解與尾延遲控制
4.1.4 前綴感知調度的定量收益模型
4.1.5 內存效率與硬件適配範圍
4.2 功能特性對比
4.2.1 結構化輸出:從提示工程到約束解碼
4.2.2 前綴共享:自動化程度與操作模型
4.2.3 服務接口、模型支持與分布式能力
4.3 場景驅動的選型決策框架
4.3.1 以工作負載特征為第一判斷依據
4.3.2 硬件環境對選型的約束
4.3.3 團隊與組織因素
4.3.4 混合部署:適用條件與完整成本評估
4.4 工程實踐:部署、監控與長期維護
4.4.1 部署配置:關鍵參數與常見陷阱
4.4.2 監控體系的建立
4.4.3 版本管理與長期維護
本章參考文獻
第5章 基礎環境搭建與性能基準測試
5.1 項目背景與目標
5.1.1 驗證目標:建立性能基線
5.1.2 理論印證:從假設到實驗的方法論
5.2 環境準備與依賴配置
5.2.1 CUDA與PyTorch基礎環境配置
5.2.2 vLLM與SGLang分別安裝部署
5.2.3 測試數據集設計與準備
5.3 測試框架架構設計
5.3.1 設計約束與技術方案選擇
5.3.2 公共指標數據結構
5.3.3 統一資源監控模塊
5.3.4 統一測試引擎
5.4 框架測試實現與執行
5.4.1 vLLM服務器配置與啟動
5.4.2 SGLang服務器配置與啟動
5.4.3 完整測試執行流程
5.4.4 結果對比分析工具
5.5 效果驗證
5.5.1 預期結果分析與理論對照
5.5.2 數據可視化方法
5.5.3 常見問題與排查方法
5.5.4 測試方法論總結
第6章 實戰項目1:高並發API服務(vLLM生產部署)
6.1 需求分析與技術方案推導
6.1.1 業務約束的量化
6.1.2 框架選型的量化推導
6.1.3 系統架構設計
6.2 項目準備
6.2.1 模型選擇與量化方案決策
6.2.2 vLLM服務配置詳解
6.2.3 服務啟動驗證
6.3 核心實現
6.3.1 FastAPI網關
6.3.2 輸入截斷的實現細節
6.3.3 Nginx配置
6.3.4 Prometheus監控體系
6.4 優化疊代
6.4.1 基線測試與性能分析
6.4.2 第一輪優化:max-num-seqs的機制與尋優
6.4.3 第二輪優化:提升GPU利用率
6.4.4 第三輪優化:長尾延遲的根因分析與處置
6.5 效果驗證
6.5.1 驗證方法論:如何判斷測試結果是可信的
6.5.2 完整優化路徑的對比驗證
6.5.3 Grafana監控面板配置
6.6 場景延伸:多模型部署與灰度發布
6.6.1 多模型部署的方案對比
6.6.2 灰度發布的決策框架
第7章 實戰項目2:結構化數據提取系統(SGLang優勢場景)
7.1 項目需求與技術方案
7.1.1 場景:簡歷信息批量結構化提取
7.1.2 約束解碼與前綴緩存的實際價值
7.1.3 技術選型:SGLang + Pydantic + JSON Schema
7.2 項目準備
7.2.1 SGLang服務部署
7.2.2 簡歷數據集構建
7.2.3 Pydantic數據模型定義
7.3 核心實現
7.3.1 SGLang約束解碼提取流程
7.3.2 JSON Schema生成與字段驗證
7.3.3 批量處理流程
7.4 優化疊代
7.4.1 提示工程優化
7.4.2 結構化輸出的容錯處理
7.4.3 RadixAttention前綴緩存效果驗證
7.5 效果驗證
7.5.1 提取準確率評估
7.5.2 處理速度基準測試
7.5.3 前綴緩存命中率分析
7.6 場景延伸
7.6.1 合同條款智能審查
7.6.2 醫療報告結構化分析
7.6.3 金融輿情實體抽取
第8章 實戰
