用 macOS 完整部署地端模型
胡嘉璽 著
相關主題
商品描述
【書籍簡介】
Apple Silicon 的統一記憶體,讓一台 Mac 就能執行過去要靠多張顯示卡才載得動的模型。 全書 25 章的操作、指令與畫面,都在 Mac 上實際執行過。
-128GB 統一記憶體全部可當 GPU 記憶體,單機載入 100B 級模型。
-Ghostty、Homebrew、uv 建好環境,Tailscale 與 macmon 遠端使用與監控。
-Ollama、Open WebUI、LM Studio、llama.cpp 四套推論工具實際操作一遍。
-四個方案同條件量測速度與記憶體,並與雲端 API 及 CUDA 主機對照。
-mlx-lm 直接使用 MLX 框架,從命令列、Python API 到相容伺服器。
-量化原理講清楚,實作 DWQ、AWQ、GPTQ 與 dynamic_quant。
-推測式解碼、量化 KV 快取與 prompt 快取,同一個模型輸出更快。
-mflux、Draw Things、ComfyUI 生圖,實測 FLUX.2、Z-Image 與 Wan 2.2。
-mlx-whisper 轉寫、Kokoro 與 Qwen3-TTS 合成、MusicGen 與 ACE-Step 作曲。 -mlx-vlm 與 FastVLM 看圖看影片,AnythingLLM 與 LightRAG 讀自己的文件。 -Claude Code、goose 接地端模型,sandbox-exec 與 Apple container 隔離。
-Foundation Models framework 呼叫系統模型,exo 與 MLX 分散式組叢集。
-mlx_lm.lora、mflux-train、mlx-lm-lora 微調,nanochat-mlx 從零預訓練。
適合手上已經有一台 Apple Silicon Mac,想把它當成地端 AI 主機使用的開發者與研究者。
作者簡介
胡嘉璽
研究領域為LLM、Vibe Coding、Context Engineering、量子電腦、容器。喜歡旅遊、重訓、天文、物理、美食、爵士樂及貓咪。
聯絡方式:github/joshhu
目錄大綱
第一篇 硬體與系統建置
第1 章 Apple Silicon 與 128GB 統一記憶體
1-1 統一記憶體架構
1-2 模型大小與記憶體
1-3 頻寬與推論速度
1-4 128GB 機型選購
1-5 查看 Mac 硬體規格
1-6 本章小結
第2 章 macOS 系統準備與最佳化
2-1 macOS 版本與更新
2-2 開發工具安裝
2-3 電源與休眠設定
2-4 GPU 記憶體上限調整
2-5 Time Machine 備份
2-6 本章小結
第3 章 終端機與開發環境建置
3-1 終端機 Ghostty
3-2 Homebrew 與基本工具
3-3 Python 環境 uv
3-4 Node.js 與 nvm
3-5 Hugging Face CLI
3-6 Claude Code
3-7 本章小結
第4 章 遠端存取與系統監控
4-1 SSH 遠端登入
4-2 螢幕共享
4-3 Tailscale
4-4 headless 主機
4-5 系統監控
4-6 本章小結
第2 篇 地端模型推論入門
第5 章 Ollama:命令列的模型執行器
5-1 Ollama 與 MLX 引擎
5-2 安裝與第一次執行
5-3 模型庫與引擎實測
5-4 多模態影像輸入
5-5 API 服務與程式呼叫
5-6 本章小結
第6 章 WebUI:瀏覽器裡的模型工作台
6-1 Open WebUI 的定位
6-2 安裝與啟動
6-3 對話與模型對比
6-4 RAG 與知識庫
6-5 工具擴充
6-6 更新與維護
6-7 本章小結
第7 章 LM Studio:雙引擎的桌面模型環境
7-1 LM Studio 的定位
7-2 安裝與第一個模型
7-3 lms 指令列工具
7-4 API 服務
7-5 載入參數調校
7-6 LM Link 與 Locally
7-7 與 Ollama 的比較與選擇
7-8 本章小結
第8 章 llama.cpp:所有工具背後的推論引擎
8-1 llama.cpp 的定位
8-2 安裝與編譯
8-3 GGUF 模型下載
8-4 llama-server 與 WebUI
8-5 效能調校
8-6 GGUF 與 MLX 兩套生態的關係
8-7 本章小結
第3 篇 MLX 推論進階
第9 章 mlx-lm:直接使用 Apple 的機器學習框架
9-1 MLX 框架
9-2 安裝與第一次推論
9-3 mlx-community 模型庫
9-4 Python API
9-5 mlx_lm.server
9-6 本章小結
第10 章 量化:用精度換記憶體與速度
10-1 量化的原理
10-2 mlx_lm.convert 的量化選項
10-3 學習型量化
10-4 品質與速度的實測比較
10-5 量化等級的選擇
10-6 本章小結
第11 章 推論加速:讓同一個模型輸出更快
11-1 推測式解碼的原理
11-2 mlx-lm 的推測式解碼
11-3 KV 快取的記憶體
11-4 prompt 快取
11-5 長脈絡的實測
11-6 本章小結
第12 章 方案比較:公平量測與工具選擇
12-1 公平比較的條件
12-2 四個方案同條件實測
12-3 vLLM 生態在 Mac 上的現況
12-4 與雲端及 CUDA 主機的對照
12-5 選擇的判準
12-6 本章小結
第4 篇 多媒體 AI 生成
第13 章 圖像與影片生成:擴散模型在 Mac 上的三個方法
13-1 生圖模型的技術棧
13-2 mflux:MLX 原生的命令列生圖
13-3 Draw Things
13-4 ComfyUI Desktop
13-5 影片生成
13-6 本章小結
第14 章 音訊、語音與音樂 AI:從波形到 token
14-1 聲音的表示與模型架構
14-2 語音辨識
14-3 語音合成與聲音複製
14-4 即時語音對話
14-5 音樂生成與音訊工具鏈
14-6 本章小結
第5 篇 多模態與 AI Agent
第15 章 視覺語言模型:讓模型看懂圖像與影片
15-1 圖像如何變成 token
15-2 mlx-vlm 的圖片理解
15-3 影片理解
15-4 GUI 與 Apple 官方的 FastVLM
15-5 包成 API:多模態的 OpenAI 相容服務
15-6 本章小結
第16 章 RAG 文件問答:讓模型讀自己的資料
16-1 RAG 的三個零件
16-2 AnythingLLM:零設定的文件問答
16-3 embedding 模型的選擇
16-4 LightRAG:知識圖譜加向量的雙路檢索
16-5 圖譜與向量的分工
16-6 本章小結
第17 章 AI Agent 用地端模型
17-1 Anthropic 相容端點的意義
17-2 Claude Code 接 Ollama
17-3 Claude Code 接 LM Studio
17-4 goose:MCP 原生的開源 agent
17-5 本地模型的 agent 限制
17-6 把 agent 關進沙箱
17-7 本章小結
第18 章 編輯器裡的地端模型與 Vibe Coding
18-1 編輯器接上本機模型
18-2 程式開發的模型選擇
18-3 Vibe Coding 實戰
18-4 本章小結
第6 篇 Apple 生態與多機延伸
第19 章 Foundation Models framework
19-1 系統內建的語言模型
19-2 用 Swift 呼叫系統模型
19-3 第三方模型接進同一套 API
19-4 Core ML、ANE 與 MLX 的分工
19-5 本章小結
第20 章 多台Mac 組成推論叢集
20-1 為什麼要多機
20-2 Thunderbolt 直連與 RDMA
20-3 MLX 分散式
20-4 exo 叢集
20-5 llama.cpp RPC
20-6 方案比較與現實期望
20-7 本章小結
第7 篇 模型微調與訓練
第21 章 用 MLX 微調自己的模型
21-1 微調的方法與記憶體帳
21-2 資料集準備
21-3 用 mlx_lm.lora 訓練
21-4 訓練監控與成果驗證
21-5 合併、轉檔、接回工具
21-6 其他微調框架的現況
21-7 本章小結
第22 章 影像模型的 LoRA 微調
22-1 DreamBooth 與影像 LoRA
22-2 準備訓練圖片與標註
22-3 mflux-train 指令列訓練
22-4 Draw Things 圖形介面訓練
22-5 前後對照與 LoRA 運用
22-6 其他訓練工具的現況
22-7 本章小結
第23 章 PyTorch MPS 後端的微調
23-1 MPS 後端的現況
23-2 transformers 加 PEFT 的 LoRA 微調
23-3 sentence-transformers 微調embedding
23-4 MLX 與 MPS 的選擇
23-5 本章小結
第24 章 偏好對齊:DPO 與GRPO
24-1 三種對齊方法
24-2 mlx-lm-lora 的 DPO 實測
24-3 GRPO 推理訓練
24-4 圖形介面的微調工具
24-5 本章小結
第25 章 從零預訓練一個模型t
25-1 預訓練與微調的差別
25-2 nanochat-mlx 的完整管線
25-3 訓練監控
25-4 其他預訓練工具
25-5 本章小結
附錄A 工具指令速查表
A-1 Ollama
A-2 lms(LM Studio CLI)
A-3 llama.cpp
A-4 mlx-lm 與 MLX 分散式
A-5 多媒體生成與辨識
A-6 Hugging Face 下載
A-7 系統相關
附錄B 推薦模型清單與效能基準
B-1 對話與程式模型
B-2 視覺語言模型
B-3 語音模型
B-4 音樂模型
B-5 影像與影片生成模型
B-6 embedding 模型
B-7 128GB 記憶體對照
附錄C 常見問題與故障排除
C-1 安裝與下載
C-2 記憶體
C-3 推論
C-4 微調
C-5 其他
附錄D 128GB 機型規格速查表
D-1 機型總表
D-2 各機型要點
D-3 選擇建議
D-4 參考資料



















