Token服務實戰

劉鵬,劉思成

  • 出版商: 中國水利水電出版社
  • 出版日期: 2026-07-01
  • 售價: $768
  • 語言: 簡體中文
  • 頁數: 275
  • ISBN: 7522646863
  • ISBN-13: 9787522646862
  • 相關分類: AI Coding
  • 下單後立即進貨 (約4週~6週)

商品描述

流量紅利逐漸消退,Token行業已從流量驅動轉向效率驅動,工程效率決定盈利上限。

針對行業普遍存在的顯存溢出、算力閒置、延遲超標、集群故障等核心挑戰,本書立足真實生產場景,打造了一套完整的 Token 工程落地體系。全書聚焦算力芯片選型、電力與散熱工程體系、底層環境標準化搭建、Token服務商的模型選型、模型量化與壓縮、主流推理引擎深耕、KV緩存深度調優、分布式推理架構、全鏈路智能調度、場景化微調工程等核心模塊,兼顧NVIDIA、國產昇騰、平頭哥等多類算力生態,覆蓋單機、異構集群、萬卡超級工廠等不同部署規模,圍繞降本、提效、穩服、增益四大目標,構建標準化、可量產的技術方案。

本書從單節點部署到萬卡級分布式集群,從芯片硬件精算到KV緩存深度優化,助力從業者壓減Token生產邊際成本,釋放算力價值,在存量競爭中實現收益倍增。

本書面向Token服務技術決策者、算力運維工程師、AI基礎設施開發者及創業公司技術負責人,無論你是從零搭建推理集群,還是優化萬卡級算力中心,都能找到從硬件選型到生產調優的實戰參考。

作者簡介

劉鵬,清華大學博士,某上市公司董事長,兼任中國大數據應用聯盟人工智能專家委員會主任、中國信息協會教育分會人工智能教育專家組長、教育部全國普通高校畢業生就業創業指導委員會委員、全國大學生數學建模競賽命題人、第45屆世界技能大賽中國雲計算專家指導組組長、中國電子學會雲計算專家委員會雲存儲組組長、工信部雲計算研究中心專家。在雲計算 等領域造詣深厚,獲全球大數據處理賽冠軍等多項榮譽。主持40餘項科研項目,獲6項部級二等獎、3 項三等獎。發表80餘篇論文,授權超66項專利。出版的人工智能、大數據教材被高校廣泛采用,創辦相關領域門戶網站。

劉思成,2006年生,Z世代AGI開發者。9歲獲無人機體感操控系統國家專利;12歲著《小天才學Python》,被多校選作教材並出第二版;13歲公益直播編程課,數千兒童受益;15歲獲VR萬向運動機美國專利及預防AI幹預外界方法中國專利;2025年實現創新型 WENG-Ontokinetics AGI原型,創新性地融合了張力驅動認知、概念幾何學和元推理引擎,並通過實驗數據驗證了其在認知躍遷、自主進化和洞見生成方面的能力。。

目錄大綱

第1篇 算力基建底座
第1章 全球算力芯片梯隊:參數實測、適配場景全解析
1.1 國際頂級GPU全系工程解析與合規紅線
1.1.1 NVIDIA H20:模型推理的優選方案
1.1.2 RTX 4090的技術特性與定位
1.1.3 NVIDIA Ampere家族:A100的工程哲學
1.1.4 NVIDIA Hopper家族:H100的性能跨越
1.1.5 NVIDIA Blackwell家族:B200/B300開啟新時代
1.1.6 經典商用推理卡:L4、A10G、RTX 4090的細分定位
1.1.7 場景選型指南:閒聊、文案、長文本、高精度等典型場景
1.2 華為昇騰國產算力體系工程適配
1.2.1 昇騰910B:國產方案的綜合優選
1.2.2 昇騰910C:國產算力的“大模型時刻”
1.2.3 昇騰310P:輕量化推理的性價比之選
1.2.4 昇騰950PR:新一代大模型推理主力芯片
1.3 阿裏平頭哥算力體系低成本量產方案
1.3.1 倚天710:Arm服務器CPU的新勢力
1.3.2 真武810E:中小規模推理的高性價比選手
1.3.3 真武M890:2026年的旗艦級產品
1.3.4 軟硬協同的工程優勢
1.4 其他國產算力細分場景普惠適配
1.4.1 沐曦:兼容性突出的國產GPU
1.4.2 海光:x86架構的合規之選
1.4.3 燧原科技:訓推一體的務實派
1.4.4 天數智芯:GPGPU架構的先行者
1.4.5 場景分級適配矩陣
1.5 算力TCO工程精算與選型公式
1.5.1 TCO的成本結構解剖
1.5.2 自建與租賃:成本精算對比
1.5.3 場景分級選型公式
1.5.4 成本優化實戰技巧
1.5.5 TCO計算器:實際案例演示
1.6 本章小結
第2章 電力與散熱工程體系:綠電供能、算電協同與高密度散熱
2.1 算力能耗結構與傳統供散體系的痛點
2.1.1 GPU推理的能耗解剖
2.1.2 傳統供散體系的三大短板
2.1.3 降頻風險的隱性成本
2.2 綠電直供工程與低成本並網方案
2.2.1 為什麼綠電是“重要選擇”
2.2.2 “東數西算”節點:綠電窪地
2.2.3 綠電直供的三種模式
2.2.4 綠電溯源與認證
2.2.5 峰谷調度:提升綠電利用效率
2.3 800V高壓直流算電島供電架構
2.3.1 高壓直流供電的原理
2.3.2 算電島架構:獨立供電單元
2.3.3 預制艙方案:快速部署高壓直流
2.4 算電協同智能柔性量產調度
2.4.1 為什麼需要算電協同
2.4.2 算電協同的四個層次
2.4.3 智能調度系統架構
2.4.4 實際收益測算
2.5 液冷散熱體系與量產選型“避坑”
2.5.1 為什麼液冷是“剛需”
2.5.2 液冷的兩大技術路線
2.5.3 液冷選型決策矩陣
2.5.4 液冷改造的“避坑”指南
2.5.5 液冷改造案例:實施難點與經驗覆盤
2.6 本章小結
第3章 底層環境標準化搭建:系統、驅動與網絡性能兜底
3.1 系統與內核參數生產級調優
3.1.1 Ubuntu生產版本選型
3.1.2 內核網絡參數調優
3.1.3 內存與I/O參數優化
3.1.4 WSL2和Windows Server在生產環境中的局限性
3.1.5 常見系統配置陷阱
3.2 CUDA/驅動/框架黃金兼容版本鎖定
3.2.1 版本兼容性基礎原理
3.2.2 生產環境推薦版本組合
3.2.3 已知不兼容版本與歷史問題
3.2.4 版本鎖定實戰腳本
3.2.5 版本升級的安全檢查清單
3.3 存儲I/O性能提速與緩存加速策略
3.3.1 AI推理的存儲痛點
3.3.2 NVMe陣列搭建最佳實踐
3.3.3 模型高速加載優化
3.3.4 檢查點緩存加速
3.3.5 磁盤擁堵根治方案
3.4 分布式網絡拓撲與通信優化
3.4.1 GPU集群的通信模式
3.4.2 InfiniBand與RoCE v2的技術對比
3.4.3 RDMA配置最佳實踐
3.4.4 網絡拓撲設計
3.4.5 丟包重傳調優
3.4.6 GDR:極致性能優化
3.5 本章小結
第1篇總結
第2篇 模型推理全棧
……
第3篇 運維與商業化交付
附錄A 主流GPU規格對比速查表
附錄B 生產環境檢查清單
附錄C 常見故障排查手冊
附錄D 大模型選型速查表

最後瀏覽商品 (18)