GPU 시세 · VRAM · 온디바이스 AI

‘哪个运行时更快’多半是问错了问题——三者都跑同一个llama.cpp引擎、同一个GGUF文件。差别只来自包装(捆绑版本、默认值、调度器)。附上同一文件sha256校验条件下的两组实测数据(inventivehq 2026、techfuelhq 2026-08-26)。

🌐 · English · 中文 · Español · 한국어 · · 中文 Hub

主力选手 RTX 5060 Ti (Qwen2.5-Coder-7B Q4) Apple M3 Max(同一文件) 待机RAM
llama.cpp (llama-server) 77.0 tok/s 53.5 tok/s ~75 MB
LM Studio 76.8(−0.3%,误差) 38.2(−29%,捆绑引擎落后) 300~500 MB
Ollama 69.1 (−10.3%) 46.2 (−14%) 200~400 MB

一项设置比运行时差异影响更大

  • LM Studio‘auto’ GPU 卸载:悄悄把 gpt-oss 20B 留在 CPU 上,最多损失 31%——仅把滑块拉满就从 186→244.9 tok/s(techfuelhq,RTX 5080)。
  • Ollama 上下文滑块:把默认 4K 放任设成 256K,3B 模型会掉到 CPU,性能下降 3.4 倍。用 ollama ps 确认。
  • 量化选择:Q4_K_M→Q5_K_M要吃掉15~20%——是运行时3~8%差距的两倍(aibytes汇总)。

分情况结论

  • GUI 浏览·模型实验:LM Studio——NVIDIA 上免费(0.3%);AMD Vulkan 较 Ollama ROCm +12%。
  • API·Docker·后台:Ollama——dense 解码快 5~11%,空闲内存轻 5~12 倍。但要注意确认上下文默认值。
  • 最新模型、最高控制、服务器:llama.cpp — 上游支持最快,也是唯一能用 llama-bench 分别测量 prefill/decode 的工具。
  • Apple Silicon:MLX 是主场 — 在 M4 Max 公开对比中,MLX 较 GGUF Metal 高 +20~25%(52.7 vs 43.2)。从 Ollama v0.40.0(2026-09-25)起 MLX 成为默认,LM Studio 本就支持。春季基准的表格请作废。

Mac 选购指南在按 Mac 统一内存划分的模型,5060 Ti 实战表在5060 Ti 页面.

撰写于 2026-09-28 · 文件大小为 Hugging Face 在线列表实测 · 速度仅采用注明出处的公开测量和我的实测 · 无本地运行 ·查看完整枢纽 · 量化阶梯 104 个构建 · 47 款生成速度图表