大模型應用開發:評估、優化與工程實踐
樊中愷
- 出版商: 人民郵電
- 出版日期: 2026-09-01
- 定價: $659
- 售價: $658
- 語言: 簡體中文
- 頁數: 316
- ISBN: 7115705747
- ISBN-13: 9787115705747
-
相關分類:
Large language model、Prompt Engineering、Natural Language Processing
下單後立即進貨 (約4週~6週)
相關主題
商品描述
本書系統闡述企業級AI原生應用開發的核心方法論——評估驅動開發(EDD)。面對大語言模型帶來的不確定性,傳統軟件開發模式已難以為繼。本書從模型API選型與評估、Prompt工程優化、RAG系統構建、多輪對話系統、多模態應用、Agentic AI智能體到模型微調,貫穿AI應用開發全流程,以“評估-優化-驗證”循環為技術決策基準。通過豐富的代碼示例和實戰案例,幫助讀者建立可量化、可疊代的質量保障體系,成為既懂技術又懂效果把控的AI工程師。適合AI應用開發者、技術負責人及對LLM工程化感興趣的讀者。
作者簡介
樊中愷,百度主任架構師,涉及搜索、信息流和 AI Native 應用。23 年開始負責文心 APP 產品策略研發工作,指導團隊開發多智能體群聊、放心寫作、魔法漫畫等創新產品,在 Agentic AI、業務模型調優、AI Native 應用架構等方向有深厚的技術積累和豐富的業務經驗。是 QCon、CSDI、Create AI、百度世界等行業峰會的出品人、優秀講師和公開課負責人。出版並翻譯《Web 智能化》、《程序員數學》、《高性能 MVVM 框架的設計與實現》、《微前端設計與實現》等書籍,參與央視等媒體的 AI 主題專訪,在社區和公司內外貢獻 Prompt Engineer、AI Native 應用架構設計等主題的在線課程。
目錄大綱
0 前言
1 第 一章 評估驅動開發(EDD)概念
1.1 從確定性到概率性的範式轉換
1.1.1 兩個世界的根本差異
1.1.2 AI Engineer的角色演進
1.1.3 EDD的核心理念與實踐框架
1.2 EDD的實施策略與應用場景
1.2.1 模型效果評估
1.2.2 上下文工程評估
1.2.3 Agentic AI的端到端評估
1.3 EDD評估體系的設計與實施
1.3.1 評估目標的科學設定
1.3.2 評估方法的選擇與設計
1.3.3 持續優化的反饋機制
2 第二章 模型API使用和效果評估
2.1 快速開始第 一個API調用
2.1.1 平臺選擇與註冊策略
2.1.2 環境配置與依賴管理
2.1.3 第 一個API調用:從Hello World到生產級代碼
2.1.4 統一的評估基準建立
2.2 參數調優與實驗設計
2.2.1 Temperature
2.2.2 Top-P
2.2.3 Max Tokens
2.2.4 其他關鍵參數
2.2.5 參數協同效應與工程化調優實踐
2.3 API使用基礎與最佳實踐
2.3.1 API Key管理與安全實踐
2.3.2 同步輸出與流式輸出
2.4 高級調用技巧
2.4.1 異步並發調用架構設計
2.4.2 請求生命周期管理
2.4.3 智能重試與降級策略
2.5 性能監控與自適應優化
2.5.1 多維度監控體系
2.5.2 智能決策引擎
2.5.3 預測性優化
2.5.4 實戰中的閉環優化
2.6 模型評估與疊代管理
2.6.1 模型疊代的本質與挑戰
2.6.2 ROI驅動的遷移決策
3 第三章 Prompt工程與評估優化
3.1 Prompt工程的真實挑戰
3.1.1 從碰運氣到工程化的轉變
3.1.2 Prompt工程的三大技術挑戰
3.1.3 評估驅動的解決方案
3.2 Prompt模板設計的實戰技巧
3.2.1 超越技巧:理解Prompt設計的第 一性原理
3.2.2 模板的版本管理與A/B測試
3.2.3 領域模板庫的構建
3.3 評估驅動的優化閉環
3.3.1 最小可行評估體系(MVE)
3.3.2 問題定位的方法
3.3.3 漸進式優化策略
3.3.4 優化收益的量化
3.4 Prompt進階技術
3.4.1 用CoT對抗註意力漂移
3.4.2 用彈性邊界破解創意控制悖論
3.4.3 用結構化提示解決上下文汙染
3.4.4 舉例:智能客服
4 第四章 多輪對話系統的構建與評估
4.1 多輪對話系統架構設計
4.1.1 對話系統的核心概念
4.1.2 對話“樹”
4.1.3 系統架構設計模式
4.1.4 對話狀態的表示與存儲
4.2 多輪對話的特殊挑戰
4.2.1 連貫性維持的技術挑戰
4.2.2 記憶信息的選擇性保持
4.2.3 用戶意圖的動態變化處理
4.2.4 對話完整度的保證
4.3 多輪對話評估方法論
4.3.1 傳統單輪評估方法的局限性
4.3.2 多輪評估的核心維度
4.3.3 自動化評估指標設計
4.3.4 人工評估標準化流程
4.4 MT-Bench式評估系統實現
4.4.1 MT-Bench評估框架解析
4.4.2 評估數據集的構建
4.4.3 LLM-as-judge評判系統落地
4.4.4 評估結果的分析與可視化
4.4.5 系統實現與部署
4.5 實戰案例:智能客服多輪對話系統
4.5.1 系統需求與架構設計
4.5.2 核心模塊實現
4.5.3 評估體系構建
4.5.4 優化策略與最佳實踐
5 第五章 RAG系統的構建與評估優化
5.1 RAG系統的本質與架構演進
5.1.1 從知識的角度理解RAG
5.1.2 RAG架構的演進歷程
5.1.3 RAG的核心組件剖析
5.1.4 RAG與其他技術的融合
5.2 文檔工程:RAG系統的數據基礎
5.2.1 文檔處理
5.2.2 元數據
5.2.3 多模態文檔的處理
5.3 檢索策略的設計與優化
5.3.1 從單一檢索到混合檢索的演進
5.3.2 查詢理解與改寫
5.3.3 檢索結果的重排序與過濾
5.3.4 多跳檢索與推理
5.4 RAG評估體系的建立
5.4.1 評估的多維度視角
5.4.2 檢索質量的評估方法
5.4.3 生成質量的評估
5.4.4 在線評估與持續監控
5.5 RAG系統的優化策略
5.5.1 索引優化:效率與效果的平衡
5.5.2 提示工程優化
5.5.3 緩存策略
5.5.4 動態模型選擇
5.6 RAG系統的實戰案例
5.6.1 企業知識庫問答系統
5.6.2 性能優化案例
5.7 未來展望與發展趨勢
6 第六章 多模態系統的構建與評估
6.1 多模態AI的本質與架構演進
6.1.1 從單模態到多模態的認知跨越
6.1.2 多模態架構的演進路徑
6.1.3 多模態系統的核心組件
6.2 多模態模型的評估挑戰與方法
6.2.1 評估的特殊性
6.2.2 自動化評估指標體系
6.2.3 基於模型的評估
6.2.4 人類評估的最佳實踐
6.3 多模態RAG:融合檢索的新範式
6.3.1 為什麼需要多模態RAG
6.3.2 多模態RAG的架構設計
6.3.3 多模態RAG的特殊挑戰
6.4 實踐案例:圖文理解助手
6.4.1 系統需求與架構
6.4.2 核心模塊實現
6.4.3 評估體系設計
7 第七章 Agentic AI智能體系統的構建與評估
7.1 從LLM到Agent的差異
7.1.1 傳統LLM的局限
7.1.2 Agent的定義與核心特征
7.1.3 Agent的認知閉環
7.1.4 典型場景對比:LLM與Agent的差異可視化
7.2 架構演進
7.2.1 架構設計的核心原則
7.2.2 四代架構演進
7.2.3 架構選擇的核心依據
7.3 Agent實現
7.3.1 工具與記憶系統的通用設計
7.3.2 ReAct架構
7.3.3 Planner-Executor架構
7.4 多Agent協同
7.4.1 多Agent協同的價值
7.4.2 多Agent協同的核心挑戰與解決方案
7.4.3 多Agent協同的核心實現
7.5 評估與優化:構建Agent系統的“健康指標”與疊代策略
7.5.1 多維度評估體系:從“結果對不對”到“過程優不優”
7.5.2 基於評估的優化策略:問題驅動的精準疊代
7.6 實踐案例:企業級智能銷售助手的設計與落地
7.6.1 需求分析
7.6.2 架構設計
7.6.3 核心實現
7.6.4 落地效果與持續優化
7.7 未來趨勢與挑戰
7.7.1 四大核心趨勢
7.7.2 三大核心挑戰
8 第八章 模型微調與定制化
8.1 關於微調
8.1.1 微調的本質
8.1.2 微調、Prompt、RAG
8.1.3 微調技術演進
8.1.4 合成數據
8.2 數據工程
8.2.1 核心原則
8.2.2 數據清洗
8.2.3 數據配比
8.3 參數高效微調(PEFT)
8.3.1 LoRA家族
8.3.2 動態決策框架
8.3.3 多LoRA管理:動態切換與組合的技術實現
8.4 對齊技術
8.4.1 DPO
8.4.2 安全性對齊
8.5 微調評估:多維度框架與在線實踐
8.5.1 LLM-as-Judge:當前微調評估的核心工具
8.5.2 在線A/B測試:生產環境的最終驗證
8.6 實戰案例:法律助手
8.6.1 需求與數據準備
8.6.2 微調實施
8.6.3 評估與疊代
9 第九章 簡單實用的EDD
9.1 評估輕量化
9.1.1 自動化評估
9.1.2 小模型適配
9.2 應用拓展
9.2.1 實時交互場景
9.2.2 行業微場景
9.3 落地挑戰:中小團隊的“低成本突破路徑”
9.3.1 成本控制
9.3.2 門檻降低
9.3.3 疊代加速
9.4 落地路徑:中小團隊的“極簡三步法”

