用 macOS 完整部署地端模型

胡嘉璽 著

  • 出版商: 深智
  • 出版日期: 2026-09-19
  • 定價: $1,080
  • 售價: 7.9$853
  • 語言: 繁體中文
  • 頁數: 736
  • ISBN: 6267889696
  • ISBN-13: 9786267889695
  • 相關分類: AI Coding
  • 尚未上市,歡迎預購

  • 用 macOS 完整部署地端模型-preview-1
  • 用 macOS 完整部署地端模型-preview-2
  • 用 macOS 完整部署地端模型-preview-3
  • 用 macOS 完整部署地端模型-preview-4
  • 用 macOS 完整部署地端模型-preview-5
  • 用 macOS 完整部署地端模型-preview-6
  • 用 macOS 完整部署地端模型-preview-7
  • 用 macOS 完整部署地端模型-preview-8
  • 用 macOS 完整部署地端模型-preview-9
  • 用 macOS 完整部署地端模型-preview-10
  • 用 macOS 完整部署地端模型-preview-11
  • 用 macOS 完整部署地端模型-preview-12
  • 用 macOS 完整部署地端模型-preview-13
  • 用 macOS 完整部署地端模型-preview-14
  • 用 macOS 完整部署地端模型-preview-15
  • 用 macOS 完整部署地端模型-preview-16
  • 用 macOS 完整部署地端模型-preview-17
  • 用 macOS 完整部署地端模型-preview-18
  • 用 macOS 完整部署地端模型-preview-19
  • 用 macOS 完整部署地端模型-preview-20
用 macOS 完整部署地端模型-preview-1

相關主題

商品描述

【書籍簡介】

Apple Silicon 的統一記憶體,讓一台 Mac 就能執行過去要靠多張顯示卡才載得動的模型。 全書 25 章的操作、指令與畫面,都在 Mac 上實際執行過。

 

-128GB 統一記憶體全部可當 GPU 記憶體,單機載入 100B 級模型。

-Ghostty、Homebrew、uv 建好環境,Tailscale 與 macmon 遠端使用與監控。

-Ollama、Open WebUI、LM Studio、llama.cpp 四套推論工具實際操作一遍。

-四個方案同條件量測速度與記憶體,並與雲端 API 及 CUDA 主機對照。

-mlx-lm 直接使用 MLX 框架,從命令列、Python API 到相容伺服器。

-量化原理講清楚,實作 DWQ、AWQ、GPTQ 與 dynamic_quant。

-推測式解碼、量化 KV 快取與 prompt 快取,同一個模型輸出更快。

-mflux、Draw Things、ComfyUI 生圖,實測 FLUX.2、Z-Image 與 Wan 2.2。

-mlx-whisper 轉寫、Kokoro 與 Qwen3-TTS 合成、MusicGen 與 ACE-Step 作曲。 -mlx-vlm 與 FastVLM 看圖看影片,AnythingLLM 與 LightRAG 讀自己的文件。 -Claude Code、goose 接地端模型,sandbox-exec 與 Apple container 隔離。

-Foundation Models framework 呼叫系統模型,exo 與 MLX 分散式組叢集。

-mlx_lm.lora、mflux-train、mlx-lm-lora 微調,nanochat-mlx 從零預訓練。

 

適合手上已經有一台 Apple Silicon Mac,想把它當成地端 AI 主機使用的開發者與研究者。

作者簡介

胡嘉璽

研究領域為LLMVibe CodingContext Engineering、量子電腦、容器。喜歡旅遊、重訓、天文、物理、美食、爵士樂及貓咪。

聯絡方式:github/joshhu

目錄大綱

第一篇 硬體與系統建置

1 Apple Silicon 128GB 統一記憶體

1-1 統一記憶體架構

1-2 模型大小與記憶體

1-3 頻寬與推論速度

1-4 128GB 機型選購

1-5 查看 Mac 硬體規格

1-6 本章小結

2 macOS 系統準備與最佳化

2-1 macOS 版本與更新

2-2 開發工具安裝

2-3 電源與休眠設定

2-4 GPU 記憶體上限調整

2-5 Time Machine 備份

2-6 本章小結

3 終端機與開發環境建置

3-1 終端機 Ghostty

3-2 Homebrew 與基本工具

3-3 Python 環境 uv

3-4 Node.js nvm

3-5 Hugging Face CLI

3-6 Claude Code

3-7 本章小結

4 遠端存取與系統監控

4-1 SSH 遠端登入

4-2 螢幕共享

4-3 Tailscale

4-4 headless 主機

4-5 系統監控

4-6 本章小結

2 地端模型推論入門

5 Ollama:命令列的模型執行器

5-1 Ollama MLX 引擎

5-2 安裝與第一次執行

5-3 模型庫與引擎實測

5-4 多模態影像輸入

5-5 API 服務與程式呼叫

5-6 本章小結

6 WebUI:瀏覽器裡的模型工作台

6-1 Open WebUI 的定位

6-2 安裝與啟動

6-3 對話與模型對比

6-4 RAG 與知識庫

6-5 工具擴充

6-6 更新與維護

6-7 本章小結

7 LM Studio:雙引擎的桌面模型環境

7-1 LM Studio 的定位

7-2 安裝與第一個模型

7-3 lms 指令列工具

7-4 API 服務

7-5 載入參數調校

7-6 LM Link Locally

7-7 Ollama 的比較與選擇

7-8 本章小結

8 llama.cpp:所有工具背後的推論引擎

8-1 llama.cpp 的定位

8-2 安裝與編譯

8-3 GGUF 模型下載

8-4 llama-server WebUI

8-5 效能調校

8-6 GGUF MLX 兩套生態的關係

8-7 本章小結

3 MLX 推論進階

9 mlx-lm:直接使用 Apple 的機器學習框架

9-1 MLX 框架

9-2 安裝與第一次推論

9-3 mlx-community 模型庫

9-4 Python API

9-5 mlx_lm.server

9-6 本章小結

10 量化:用精度換記憶體與速度

10-1 量化的原理

10-2 mlx_lm.convert 的量化選項

10-3 學習型量化

10-4 品質與速度的實測比較

10-5 量化等級的選擇

10-6 本章小結

11 推論加速:讓同一個模型輸出更快

11-1 推測式解碼的原理

11-2 mlx-lm 的推測式解碼

11-3 KV 快取的記憶體

11-4 prompt 快取

11-5 長脈絡的實測

11-6 本章小結

12 方案比較:公平量測與工具選擇

12-1 公平比較的條件

12-2 四個方案同條件實測

12-3 vLLM 生態在 Mac 上的現況

12-4 與雲端及 CUDA 主機的對照

12-5 選擇的判準

12-6 本章小結

4 多媒體 AI 生成

13 圖像與影片生成:擴散模型在 Mac 上的三個方法

13-1 生圖模型的技術棧

13-2 mfluxMLX 原生的命令列生圖

13-3 Draw Things

13-4 ComfyUI Desktop

13-5 影片生成

13-6 本章小結

14 音訊、語音與音樂 AI:從波形到 token

14-1 聲音的表示與模型架構

14-2 語音辨識

14-3 語音合成與聲音複製

14-4 即時語音對話

14-5 音樂生成與音訊工具鏈

14-6 本章小結

5 多模態與 AI Agent

15 視覺語言模型:讓模型看懂圖像與影片

15-1 圖像如何變成 token

15-2 mlx-vlm 的圖片理解

15-3 影片理解

15-4 GUI Apple 官方的 FastVLM

15-5 包成 API:多模態的 OpenAI 相容服務

15-6 本章小結

16 RAG 文件問答:讓模型讀自己的資料

16-1 RAG 的三個零件

16-2 AnythingLLM:零設定的文件問答

16-3 embedding 模型的選擇

16-4 LightRAG:知識圖譜加向量的雙路檢索

16-5 圖譜與向量的分工

16-6 本章小結

17 AI Agent 用地端模型

17-1 Anthropic 相容端點的意義

17-2 Claude Code Ollama

17-3 Claude Code LM Studio

17-4 gooseMCP 原生的開源 agent

17-5 本地模型的 agent 限制

17-6 agent 關進沙箱

17-7 本章小結

18 編輯器裡的地端模型與 Vibe Coding

18-1 編輯器接上本機模型

18-2 程式開發的模型選擇

18-3 Vibe Coding 實戰

18-4 本章小結

6 Apple 生態與多機延伸

19 Foundation Models framework

19-1 系統內建的語言模型

19-2 Swift 呼叫系統模型

19-3 第三方模型接進同一套 API

19-4 Core MLANE MLX 的分工

19-5 本章小結

20 多台Mac 組成推論叢集

20-1 為什麼要多機

20-2 Thunderbolt 直連與 RDMA

20-3 MLX 分散式

20-4 exo 叢集

20-5 llama.cpp RPC

20-6 方案比較與現實期望

20-7 本章小結

7 模型微調與訓練

21 MLX 微調自己的模型

21-1 微調的方法與記憶體帳

21-2 資料集準備

21-3 mlx_lm.lora 訓練

21-4 訓練監控與成果驗證

21-5 合併、轉檔、接回工具

21-6 其他微調框架的現況

21-7 本章小結

22 影像模型的 LoRA 微調

22-1 DreamBooth 與影像 LoRA

22-2 準備訓練圖片與標註

22-3 mflux-train 指令列訓練

22-4 Draw Things 圖形介面訓練

22-5 前後對照與 LoRA 運用

22-6 其他訓練工具的現況

22-7 本章小結

23 PyTorch MPS 後端的微調

23-1 MPS 後端的現況

23-2 transformers PEFT LoRA 微調

23-3 sentence-transformers 微調embedding

23-4 MLX MPS 的選擇

23-5 本章小結

24 偏好對齊:DPO GRPO

24-1 三種對齊方法

24-2 mlx-lm-lora DPO 實測

24-3 GRPO 推理訓練

24-4 圖形介面的微調工具

24-5 本章小結

25 從零預訓練一個模型t

25-1 預訓練與微調的差別

25-2 nanochat-mlx 的完整管線

25-3 訓練監控

25-4 其他預訓練工具

25-5 本章小結

附錄A 工具指令速查表

A-1 Ollama

A-2 lmsLM Studio CLI

A-3 llama.cpp

A-4 mlx-lm MLX 分散式

A-5 多媒體生成與辨識

A-6 Hugging Face 下載

A-7 系統相關

附錄B 推薦模型清單與效能基準

B-1 對話與程式模型

B-2 視覺語言模型

B-3 語音模型

B-4 音樂模型

B-5 影像與影片生成模型

B-6 embedding 模型

B-7 128GB 記憶體對照

附錄C 常見問題與故障排除

C-1 安裝與下載

C-2 記憶體

C-3 推論

C-4 微調

C-5 其他

附錄D 128GB 機型規格速查表

D-1 機型總表

D-2 各機型要點

D-3 選擇建議

D-4 參考資料