GPU 시세 · VRAM · 온디바이스 AI

笔记本跑 LLM 的上限由 VRAM 决定,不是 CPU。算法很简单:标称 VRAM × 0.88 得到可用量,减去 Q4 权重(每 B 约 0.61GB)和 KV 缓存就有答案;本文按 8GB、12GB、16GB、24GB 四档,用表格算出真正能跑的模型大小。再叠加 2026 年 9 月 Danawa 笔记本行情,”我的预算能跑几 B”一段话讲清。

🌐 · English · 中文 · Español · 한국어 · · 中文 Hub

笔记本跑 LLM 的第一个问题不是 CPU,而是 VRAM

在量化本地 LLM 推理中,瓶颈依次是:装载量、内存带宽、核心数。模型装不进 VRAM,速度问题都谈不上——要么根本跑不起来,要么挪到系统 RAM 里慢 5~10 倍。而且同名笔记本 GPU 的 VRAM 往往不同。2026 款 RTX 5070 笔记本标配 8GB(128-bit,约 384GB/s),但因内存供应问题,2026 年 4 月又追加了 12GB 版本,两个型号并排销售。Danawa 搜索结果里混着 “VRAM: 8GB” 和 “VRAM: 12GB” 两种标注,所以即使型号名相同,也务必核对规格表。

VRAM 计算式的三个数字:0.88、0.61、KV 缓存

计算分三步。第一,在 Windows 上由于 CUDA 开销,实际可用显存约为标称值的 88%。第二,按 llama.cpp 系 Q4_K_M 量化标准,权重约为每 1B 参数 0.61GB。第三,还要加上承载上下文的 KV 缓存:每 token 字节数 = 2(K,V) x 层数 x KV 头数 x 头大小(128) x 2字节(FP16),再乘以上下文长度。例如 Llama 3.1 8B(32 层、8 个 KV 头)为 2 x 32 x 8 x 128 x 2 = 131,072 字节/token,8K 上下文约需 1.0GB。再加上为操作系统和运行时预留的 1GB 缓冲,就是最终所需容量。

档位 标称 VRAM 可用量(x0.88) 8K标准下日常使用有余
入门 8 GB 7.0 GB 8B Q4是极限,没有上下文余量
主力 12 GB 10.6 GB 到 12B Q4 为止,14B 会被截断
准旗舰 16 GB 14.1 GB 可跑 14B Q4 + 8K 上下文
最高级 24 GB 21.1 GB 至 24B·30B MoE 为止

笔记本 GPU VRAM 地图:名字相同,容量不同

2026 款 RTX 50 系列笔记本产品线的官方 VRAM:5070 8GB(128-bit)、5070 Ti 12GB(192-bit)、5080 16GB(256-bit)、5090 24GB(256-bit)。此外新增了 5070 12GB 变体。Framework 模块定价是展示 VRAM 溢价有多大的实例:同样的 5070 模块,8GB 卖 699 美元,12GB 卖 1,199 美元,多花 500 美元买 4GB VRAM。买笔记本时不要只看 GPU 名称,要在丹那哇(Danawa)规格筛选器里直接过滤 VRAM 一项。

笔记本GPU VRAM 总线宽度 8K标准下的可运行线
RTX 5070(含变体) 8 / 12 GB 128-bit 8B 稳跑,12B 只限 12GB 版
RTX 5070 Ti 12 GB 192-bit 至 12B Q4 为止
RTX 5080 16 GB 256-bit 14B Q4+长上下文
RTX 5090 24 GB 256-bit 24B、30B MoE 级

笔记本 LLM 按模型体积的必要 VRAM 实测计算表

下面的权重 GB 是我在 M5 Max MacBook 上用 llama.cpp 实跑的 GGUF 文件实测大小(Q4_K_M 系列,截至 2026-09-27)。Q4 8K 的 KV 用上面的算式算出,所需合计 = 权重 + KV + 1GB 缓冲。

模型(Q4) 权重 KV (8K) 合计 最低 VRAM 档位
Llama 3.1 8B 4.9 GB 1.0 GB 6.9 GB 8GB(可用 7.0,刚好合适)
12B 级 GQA 7.3 GB 1.25 GB 9.6 GB 12GB
Phi-4 14B 9.1 GB 1.56 GB 11.7 GB 16GB
gpt-oss 20B (MoE) 13.8 GB 0.75 GB 15.6 GB 24GB
Mistral Small 24B 14.3 GB 1.25 GB 16.6 GB 24GB
Qwen3 Coder 30B (MoE) 18.6 GB 0.75 GB 20.4 GB 24GB(最后一栏)
70B 级 42.5 GB 2.5 GB 46.0 GB 笔记本单卡不可行

读法如下:8B 在 8GB 笔记本上也能跑,但可用 7.0GB 对 6.9GB 只剩 0.1GB 余量,上下文必须压到 4K 以下。12B 是 12GB 档的第一格;14B 进不了 14.1GB 档,需要 16GB。70B 则根本不适用于任何笔记本显卡档位。

跑不起来怎么办:量化、MoE、RAM 卸载

第一个手段是更强的量化。把 Q4 降到 Q3 或 IQ2,权重减少 25~45%,但句子理解能力明显下降。第二个是 MoE 模型。gpt-oss 20B 权重为 13.8GB,但激活参数只有 3.6B,即使开启 RAM 卸载、token 速度变慢,体感降幅也比稠密模型小。第三个是 RAM 卸载:DDR5-5600 双通道带宽约 90GB/s,只有笔记本 GPU 的四分之一,把权重挪进 RAM 速度会掉 5~10 倍。也就是说,”能跑”和”能用”是两回事。RAM 至少装满 32GB,才是给卸载留余地的底线。

按预算的选购标准:学生·实验室·上班族

学生(笔记本预算₩200万上下):RTX 5070 8GB 笔记本是入门线。以Danawa为准,ASUS TUF A18 5070 8GB 配置券后价2,₩099,000,MSI Crosshair 16 5070 8GB 在2,₩729,000档。现实用途大致是8B Q4推理和课程用编程助手。实验室(₩300万档):同样的钱选5070 Ti 12GB或5070 12GB变体。装上12B Q4,实用性直接上一个台阶。若能兼作台式机,RTX 5070 12GB显卡1,₩383,800(Danawa中位价,9月28日为准),连主机总价更便宜。上班族·高预算:5080 16GB或5090 24GB笔记本;移动性需求低的话,二手3090 24GB台式机每GB成本仍然更划算。同名显卡因TGP性能可差40%的问题笔记本 GPU TGP 完全攻略中讲过了。

与台式机的分岔口

笔记本 5070 8GB 和桌面 5070 12GB 名字相近,实际是两码事。桌面版 5070 总线更宽,达 192-bit,同样跑 8B 推理 token 速度明显更快,VRAM 也多 4GB。12GB 卡的实战上限是RTX 5070 VRAM 12GB 的实战极限中计算得出,覆盖全部用途的最小/推荐量是深度学习 GPU 分用途 VRAM 基准表一起看。只要不是必须便携,桌面版在每 GB 价格上占优的格局到 2026 年依然没变。

常见问题

8GB 笔记本上 Llama 3.1 8B 到底能不能跑?

能跑。但可用 7.0GB 对权重 4.9GB + KV 1.0GB + 缓冲,是严丝合缝地塞进去——得把上下文降到 4K、关掉后台应用才行。想舒服点,建议上 12GB 档。

70B在笔记本上永远没戏吗?

单卡装不下。光 Q4 权重就 42.5GB,拆到两张 24GB 卡上也紧张。RAM 卸载能跑,但在笔记本 DDR5 带宽下,token 速度会掉到个位数。

5070 12GB 变体和 5070 Ti 12GB 怎么选?

两者都是 12GB,但 Ti 的总线宽度为 192-bit,带宽更宽,在长上下文下占优。预算相同就选 Ti;价差较大则 12GB 变体更合理。两者都请先确认与 5080 16GB 的价差。

把内存加到 64GB,大模型不就跑起来了?

「能跑」是能把玩,但权重放在 RAM 里时用的是内存带宽而非 GPU 带宽,速度会掉 5~10 倍。只有像 MoE 这种活跃参数很小的系列,才能保住可用速度。

来源:NVIDIA官方规格表、Framework公开定价、Danawa实际在售(2026年9月27~28日采集)、笔者M5 Max llama.cpp实测GGUF大小。价格与规格会变动,购买前请确认最新信息。