Mac 上没有 VRAM,只有统一内存。按惯例 Metal 可用约为总量的 75%(可通过 iogpu.wired_limit_mb 上调),再减去 KV 的 1~4GB 和 2GB 系统开销,剩下的就是权重预算。表中的大小是 HF 库实测,理论速度是带宽÷活跃权重。
🌐 · English · 中文 · Español · 한국어 · · 中文 Hub
| 统一内存 | 权重预算 | 入门代表模型(构建·大小) | 速度依据 |
|---|---|---|---|
| 16GB (M4) | ~8GB | Llama-3.1-8B Q4_K_M 4.9 · Qwen3.5-9B Q4_K_M 6.8 · DeepSeek-R1-8B Q4 4.9 | M4 带宽 120GB/s — 8B Q4 理论 24 tok/s,实测报告约 15~20 |
| 32GB (M4 Pro) | ~20GB | Qwen3.8-27B UD-Q4_K_M 16.5 · gpt-oss-20b Q8_0 12.1 · Qwen3-Coder-30B Q3_K_M 14.7 | M4 Pro 273GB/s——27B Q4 理论 16 tok/s,用 MLX 则 +20% |
| 64GB (M4 Max) | ~44GB | Qwen3.8-27B Q8_0 29.0 · Ornith-1.5-35B Q8_0 37.8 · Qwen3-Coder-30B Q8_0 32.5 · Mistral-Small-24B Q8 25.1 | M4 Max 546GB/s——27B Q8 理论 19 tok/s(以 MLX 实测为准) |
| 128GB(M5 Max,我的实测) | ~92GB | Flash-Next 125B UD-Q4_K_XL(MLX 128.5GB 系列)· Qwen3.8-27B Q8_0 · 35B Q8 · 30B Q8 全部 | 我的实测:Qwen3-Coder-30B 146.2 · gpt-oss-20b 102.9 · 35B-A3B 95.1 · Gemma4-26B 88.1 · Flash-Next 59.0 tok/s |
Mac 用 MLX
- M4 Max公开对比:Qwen3-Coder-32B MLX 52.7 vs GGUF Metal 43.2 tok/s — MLX高22%(bestllmfor,2026-04)。
- 从 Ollama v0.40.0(2026-09-25)起,Apple Silicon 上受支持的模型改为默认用 MLX 运行。凡是基于春季配置的 Ollama 的数字都过时了。
- LM Studio 很早就有一流的 MLX 支持——262K 的 Flash-Next 只有靠 MLX 4bit+卸载组合才塞得进 128GB(我实测 59.0 tok/s)。
位数选择是量化阶梯直接照搬它的分模型表即可。笔记本Mac的发热·降频,请把速度按比上表更低来估。
撰写于 2026-09-28 · 文件大小为 Hugging Face 在线列表实测 · 速度仅采用注明出处的公开测量和我的实测 · 无本地运行 ·查看完整枢纽 · 量化阶梯 104 个构建 · 47 款生成速度图表