2026 年 9 月,内存暴涨让 8GB 档重新变大。先看价格:按 Danawa 实际成交中位数折算每 GB 单价,3060 12GB 以 45,000 韩元档压倒性第一,全新8GB三款是75,000~100,₩000/GB。已有8GB卡的话,靠下表就能撑。
🌐 · English · 中文 · Español · 한국어 · · 中文 Hub
| 显卡(丹那哇实际在售中位价) | 今日价格 | 每 GB |
|---|---|---|
| RTX 3060 12GB | 540,300 韩元 | 45,025 韩元 |
| RTX 5050 8GB | 605,200 韩元 | 75,650 韩元 |
| RTX 5060 8GB | 757,000 韩元 | ₩94,625 |
| RTX 5060 Ti 8GB | 801,200 韩元 | ₩100,150 |
真正能塞进8GB的构建
| 模型 | 构建 | 权重 | 备注 |
|---|---|---|---|
| Llama-3.1-8B | Q4_K_M | 4.9 GB | 事实上的行业默认 — 含 KV 约 6GB 线 |
| DeepSeek-R1-Distill-8B | Q4_K_M | 4.9 GB | 推理特化 |
| Qwen3.5-9B | Q4_K_M | 6.8 GB | 9B 的最后底线——上下文用 8K |
| Qwen3.5-9B | IQ2_M | 4.9 GB | 赶时间——开始掉质量 |
| Phi-4 | Q3_K_M | 7.2 GB | 硬塞 14B——不合适就上 IQ2 |
| Llama-3.1-8B | IQ4_XS | 4.4 GB | 比 Q4 省 0.5GB |
3 个陷阱
- 上下文默认值:把 Ollama 滑块放任在 256K,2GB 的模型会膨胀成 18GB 占用并溢出到 CPU——实测劣化 3.4 倍(techfuelhq)。请用 ollama ps 确认 CPU/GPU 分配比例。
- GPU 自动卸载:LM Studio‘auto’ 会把部分 MoE 悄悄放在 CPU 上——把卸载拉到最大可以拿回 23~31%(techfuelhq,5080 实测)。
- 不压缩 KV:仅开启 q8_0 KV 缓存,以 8B 为基准就能省下 0.7GB — 比用 IQ2 更划算。
12GB 档的计算见VRAM 分用途指南,笔记本则TGP 指南.
撰写于 2026-09-28 · 文件大小为 Hugging Face 在线列表实测 · 速度仅采用注明出处的公开测量和我的实测 · 无本地运行 ·查看完整枢纽 · 量化阶梯 104 个构建 · 47 款生成速度图表