GPU 시세 · VRAM · 온디바이스 AI

5060 Ti 16GB 是 2026 年本地 LLM 市场最便宜的 16GB 显卡。以 Windows 为准,系统+驱动约占 1GB,实际权重预算是 13~14.5GB(条件是把 KV 压到 q4_0 并缩短上下文)。下表中的大小全部是今天从 Hugging Face 在线文件实测的值。

🌐 · English · 中文 · Español · 한국어 · · 中文 Hub

模型 构建 权重 速度 来源/备注
Qwen3.6-35B-A3B IQ3_XXS 13.2 GB 47~51 tok/s(160K上下文实测) njannasch.dev实测——含KV q4_0 962MiB,共用15,847MiB
Qwen3-Coder-30B-A3B Q3_K_M 14.7 GB 30B 级第1推荐 r/LocalLLaMA 5060 Ti 帖子——’30B still wins’
gpt-oss-20b Q4_K_M 11.6 GB 5080 上 242.8 tok/s(upstream GGUF) techfuelhq 实测——5060 Ti 比这更低
Qwen3.5-9B Q4_K_M 6.8 GB 预计 40~51 tok/s 附注 modelfit.io 8B 级 51 tok/s 估算值
Llama-3.1-8B Q8_0 8.5 GB 预计约 50 tok/s modelfit.io — 8B 级 51 tok/s
Phi-4 Q6_K 12.0 GB 预计约 30 tok/s 比 modelfit.io 的 14B Q4 32 tok/s 高一档位宽
DeepSeek-R1-Distill-8B Q4_K_M 4.9 GB 预计 45~55 tok/s 以 8B dense 为基准
Mistral-Small-3.2-24B Q3_K_M 11.5 GB 未测量 含KV约14GB线——勉强装得下
Gemma 4 26B-A4B QAT UD-Q4_K_XL 14.2 GB 未实测——最有可能的新面孔 QAT 故 4 位质量最佳 — 必须 KV q8

装不下的

  • Qwen3.8-27B Q4_K_M 16.5GB——光权重就超。双卡(5060 Ti ×2)有实测 130 tok/s 的报告(r/LocalLLaMA)。
  • Muse-Glimmer-30B Q4_K_M 16.8GB,Laguna-XS-2.1 Q4_K_M 19.6GB——24GB 卡的地盘。
  • dense 30B 以上 — 只有 MoE(A3B 级)才现实。

运行时选择

同一显卡的公开实测:llama.cpp 77.0 / LM Studio 76.8 / Ollama 69.1 tok/s(Qwen2.5-Coder-7B Q4,inventivehq)。用图形界面选 LM Studio,做 API 服务选 Ollama——但 Ollama 有个上下文滑块默认值的坑——3 种运行时对比参考。批次·KV 设置的一项差异,比换模型影响还大。

更长的配方清单见社区积累仓库club-5060ti在这里。笔记本 5060 Ti(TGP 较低的一端)是笔记本GPU TGP指南先看这个。VRAM计算公式是VRAM 分用途指南.

撰写于 2026-09-28 · 文件大小为 Hugging Face 在线列表实测 · 速度仅采用注明出处的公开测量和我的实测 · 无本地运行 ·查看完整枢纽 · 量化阶梯 104 个构建 · 47 款生成速度图表