GPU 시세 · VRAM · 온디바이스 AI

2026 年 9 月,内存暴涨让 8GB 档重新变大。先看价格:按 Danawa 实际成交中位数折算每 GB 单价,3060 12GB 以 45,000 韩元档压倒性第一,全新8GB三款是75,000~100,₩000/GB。已有8GB卡的话,靠下表就能撑。

🌐 · English · 中文 · Español · 한국어 · · 中文 Hub

显卡(丹那哇实际在售中位价) 今日价格 每 GB
RTX 3060 12GB 540,300 韩元 45,025 韩元
RTX 5050 8GB 605,200 韩元 75,650 韩元
RTX 5060 8GB 757,000 韩元 ₩94,625
RTX 5060 Ti 8GB 801,200 韩元 ₩100,150

真正能塞进8GB的构建

模型 构建 权重 备注
Llama-3.1-8B Q4_K_M 4.9 GB 事实上的行业默认 — 含 KV 约 6GB 线
DeepSeek-R1-Distill-8B Q4_K_M 4.9 GB 推理特化
Qwen3.5-9B Q4_K_M 6.8 GB 9B 的最后底线——上下文用 8K
Qwen3.5-9B IQ2_M 4.9 GB 赶时间——开始掉质量
Phi-4 Q3_K_M 7.2 GB 硬塞 14B——不合适就上 IQ2
Llama-3.1-8B IQ4_XS 4.4 GB 比 Q4 省 0.5GB

3 个陷阱

  • 上下文默认值:把 Ollama 滑块放任在 256K,2GB 的模型会膨胀成 18GB 占用并溢出到 CPU——实测劣化 3.4 倍(techfuelhq)。请用 ollama ps 确认 CPU/GPU 分配比例。
  • GPU 自动卸载:LM Studio‘auto’ 会把部分 MoE 悄悄放在 CPU 上——把卸载拉到最大可以拿回 23~31%(techfuelhq,5080 实测)。
  • 不压缩 KV:仅开启 q8_0 KV 缓存,以 8B 为基准就能省下 0.7GB — 比用 IQ2 更划算。

12GB 档的计算见VRAM 分用途指南,笔记本则TGP 指南.

撰写于 2026-09-28 · 文件大小为 Hugging Face 在线列表实测 · 速度仅采用注明出处的公开测量和我的实测 · 无本地运行 ·查看完整枢纽 · 量化阶梯 104 个构建 · 47 款生成速度图表