智能體的超級大腦:大模型工作原理揭秘
(美)愛德華·拉夫//德魯·法裏斯//斯特拉·比德曼|...
- 出版商: 清華大學
- 出版日期: 2026-07-01
- 售價: $360
- 語言: 簡體中文
- 頁數: 212
- ISBN: 7302719829
- ISBN-13: 9787302719823
-
相關分類:
Large language model
- 此書翻譯自: How Large Language Models Work (Paperback)
下單後立即進貨 (約4週~6週)
相關主題
商品描述
大語言模型(LLM)讓人 工智能真正“智能”起來。通 過連接數十億份文檔中的詞 語、概念和模式,LLM能夠 生成類似人類的回應——這 也是我們在ChatGPT、 Claude和DeepSeek等工具 使用過程中習以為常的體驗 。在這本兼具知識性與趣味 性的書中,博思艾倫咨詢公 司(Booz Allen Hamilton) 的機器學習研究員 們,深入探討了LLM的基礎 概念、發展機遇與局限性, 以及將人工智能融入企業組 織和應用程序的 實踐方 法。 這本書帶你走進LLM的內 部世界,一步步解析自然語 言提示詞如何轉化為清晰、 易讀的文本補全結果。全書 以通俗易懂的語言撰寫,無 須任何機器學習或人工智能 基礎,你就能學會LLM的構 建原理、出錯原因,以及如 何設計可靠的人工智能解決 方案。閱讀過程中,你還會 了解LLM的“思考”方式、如 何設計基於LLM的智能體與 問答系統等應用,以及如何 應對人工智能領域的倫理、 法律和安全問題。
作者簡介
愛德華·拉夫(Edward Raff)博士是Booz Allen Hamilton公司的首席科學家,也是戰略創新集團機器學習研究團隊的共同負責人。他的工作涉及監督內部研究、招聘和培養技術人才、與高校合作夥伴合作以及專門從事 機器學習的業務開發。Raff博士還協助幾位客戶開展 研究。
目錄大綱
第1章 宏觀視角:什麼是大語言模型
1.1 生成式AI的定位
1.2 本書能帶給你什麼
1.3 LLM工作原理初探
1.4 到底什麼是智能
1.5 人類與機器表征語言的方式有何不同
1.6 GPT及其同類模型
1.7 LLM為何表現如此出色
1.8 LLM實戰:優勢、缺陷與隱患
本章小結
第2章 分詞器:LLM如何“看見”世界
2.1 詞元:文本的數值表征形式
2.2 語言模型只能“看見”詞元
2.2.1 分詞的基本流程
2.2.2 分詞過程中的詞匯量控制
2.2.3 分詞原理詳解
2.2.4 分詞的潛在風險
2.3 分詞與LLM的能力邊界
2.3.1 LLM不擅長文字遊戲
2.3.2 LLM在數學任務上表現不佳
2.3.3 LLM與語言公平性問題
2.4 自測小練習
2.5 分詞的整體定位
本章小結
第3章 Transformer:從輸入到輸出
3.1 Transformer模型
3.2 Transformer架構深度解析
3.2.1 嵌入層
3.2.2 Transformer層
3.2.3 反嵌入層
3.3 創造性與主題相關性的權衡
3.4 Transformer的整體定位
本章小結
第4章 LLM如何學習
4.1 梯度下降
4.1.1 損失函數的定義
4.1.2 什麼是梯度下降
4.2 LLM如何模仿人類文本
4.3 LLM與新穎任務
4.3.1 任務識別失敗問題
4.3.2 LLM缺乏規劃能力
4.4 若LLM外推能力有限,還能使用它們嗎
4.5 模型越大越好嗎
本章小結
第5章 如何約束LLM的行為
5.1 約束LLM行為的核心動因
5.1.1 基礎模型的實用性局限
5.1.2 模型的部分輸出結果不合預期
5.1.3 特定場景對輸出格式有嚴格要求
5.2 微調:改變LLM行為的核心方法
5.2.1 有監督微調
5.2.2 基於人類反饋的強化學習
5.2.3 微調技術全景
5.3 RLHF的工作機制
5.3.1 樸素版RLHF的初步探索
5.3.2 質量獎勵模型
5.3.3 平衡質量與相似性的RLHF目標
5.4 LLM行為的其他關鍵因素
5.4.1 調整訓練數據
5.4.2 優化基礎模型訓練流程
5.4.3 調整輸出結果
5.5 將LLM集成至覆雜工作流
5.5.1 基於檢索增強生成的LLM
5.5.2 通用LLM編程
本章小結
第6章 自然語言處理
6.1 用於軟件開發的LLM
6.1.1 改進LLM以適配代碼任務
6.1.2 驗證LLM生成的代碼
6.1.3 通過格式優化代碼
6.2 面向形式化數學的LLM
6.2.1 輸入預處理的挑戰
6.2.2 數字理解的優化
6.2.3 數學領域的LLM也會使用工具
6.3 Transformer與計算機視覺
6.3.1 圖像與補丁的相互轉換
6.3.2 結合圖像與文本的多模態模型
6.3.3 既往知識的適用性
本章小結
第7章 LLM的常見誤解、能力局限與 優勢
7.1 人類與LLM學習速度的對比
7.1.1 自我改進的局限性
7.1.2 少樣本學習
7.2 工作效率對比:10瓦的人類大腦與2000瓦的計算機
7.2.1 能源消耗
7.2.2 延遲、可擴展性與可用性
7.2.3 優化改進
7.3 語言模型並非世界模型
7.4 計算局限性:難題依舊難解
7.4.1 用“模糊算法”解決“模糊問題”
7.4.2 對於難題,有時近似解就已足夠
本章小結
第8章 基於LLM設計解決方案
8.1 直接開發一個聊天機器人
8.2 自動化偏見
8.2.1 調整流程
8.2.2 當LLM自主運行風險過高時
8.3 結合多種工具降低風險
8.3.1 LLM嵌入向量與其他工具的結合
8.3.2 基於嵌入向量的解決方案設計
8.4 技術呈現方式至關重要
8.4.1 如何實現透明度
8.4.2 與用戶利益對齊
8.4.3 建立反饋循環
本章小結
第9章 構建與使用LLM的倫理問題
9.1 為何要構建LLM
9.1.1 LLM“無所不能”的利弊
9.1.2 要將人類所有工作都自動化嗎
9.2 LLM是否構成生存性風險
9.2.1 自我改進與疊代式S曲線
9.2.2 對齊問題
9.3 數據獲取與覆用的倫理問題
9.3.1 什麼是合理使用
9.3.2 向內容創作者支付報酬面臨的挑戰
9.3.3 公共領域數據的局限性
9.4 LLM輸出內容的倫理擔憂
9.4.1 LLM輸出內容的許可協議影響
9.4.2 LLM的輸出內容是否會毒化數據源
9.5 LLM倫理的其他探索方向
本章小結
