GPU 시세 · VRAM · 온디바이스 AI

Mac 上没有 VRAM,只有统一内存。按惯例 Metal 可用约为总量的 75%(可通过 iogpu.wired_limit_mb 上调),再减去 KV 的 1~4GB 和 2GB 系统开销,剩下的就是权重预算。表中的大小是 HF 库实测,理论速度是带宽÷活跃权重。

🌐 · English · 中文 · Español · 한국어 · · 中文 Hub

统一内存 权重预算 入门代表模型(构建·大小) 速度依据
16GB (M4) ~8GB Llama-3.1-8B Q4_K_M 4.9 · Qwen3.5-9B Q4_K_M 6.8 · DeepSeek-R1-8B Q4 4.9 M4 带宽 120GB/s — 8B Q4 理论 24 tok/s,实测报告约 15~20
32GB (M4 Pro) ~20GB Qwen3.8-27B UD-Q4_K_M 16.5 · gpt-oss-20b Q8_0 12.1 · Qwen3-Coder-30B Q3_K_M 14.7 M4 Pro 273GB/s——27B Q4 理论 16 tok/s,用 MLX 则 +20%
64GB (M4 Max) ~44GB Qwen3.8-27B Q8_0 29.0 · Ornith-1.5-35B Q8_0 37.8 · Qwen3-Coder-30B Q8_0 32.5 · Mistral-Small-24B Q8 25.1 M4 Max 546GB/s——27B Q8 理论 19 tok/s(以 MLX 实测为准)
128GB(M5 Max,我的实测) ~92GB Flash-Next 125B UD-Q4_K_XL(MLX 128.5GB 系列)· Qwen3.8-27B Q8_0 · 35B Q8 · 30B Q8 全部 我的实测:Qwen3-Coder-30B 146.2 · gpt-oss-20b 102.9 · 35B-A3B 95.1 · Gemma4-26B 88.1 · Flash-Next 59.0 tok/s

Mac 用 MLX

  • M4 Max公开对比:Qwen3-Coder-32B MLX 52.7 vs GGUF Metal 43.2 tok/s — MLX高22%(bestllmfor,2026-04)。
  • 从 Ollama v0.40.0(2026-09-25)起,Apple Silicon 上受支持的模型改为默认用 MLX 运行。凡是基于春季配置的 Ollama 的数字都过时了。
  • LM Studio 很早就有一流的 MLX 支持——262K 的 Flash-Next 只有靠 MLX 4bit+卸载组合才塞得进 128GB(我实测 59.0 tok/s)。

位数选择是量化阶梯直接照搬它的分模型表即可。笔记本Mac的发热·降频,请把速度按比上表更低来估。

撰写于 2026-09-28 · 文件大小为 Hugging Face 在线列表实测 · 速度仅采用注明出处的公开测量和我的实测 · 无本地运行 ·查看完整枢纽 · 量化阶梯 104 个构建 · 47 款生成速度图表