笔记本跑 LLM 的上限由 VRAM 决定,不是 CPU。算法很简单:标称 VRAM × 0.88 得到可用量,减去 Q4 权重(每 B 约 0.61GB)和 KV 缓存就有答案;本文按 8GB、12GB、16GB、24GB 四档,用表格算出真正能跑的模型大小。再叠加 2026 年 9 月 Danawa 笔记本行情,”我的预算能跑几 B”一段话讲清。
🌐 · English · 中文 · Español · 한국어 · · 中文 Hub
笔记本跑 LLM 的第一个问题不是 CPU,而是 VRAM
在量化本地 LLM 推理中,瓶颈依次是:装载量、内存带宽、核心数。模型装不进 VRAM,速度问题都谈不上——要么根本跑不起来,要么挪到系统 RAM 里慢 5~10 倍。而且同名笔记本 GPU 的 VRAM 往往不同。2026 款 RTX 5070 笔记本标配 8GB(128-bit,约 384GB/s),但因内存供应问题,2026 年 4 月又追加了 12GB 版本,两个型号并排销售。Danawa 搜索结果里混着 “VRAM: 8GB” 和 “VRAM: 12GB” 两种标注,所以即使型号名相同,也务必核对规格表。
VRAM 计算式的三个数字:0.88、0.61、KV 缓存
计算分三步。第一,在 Windows 上由于 CUDA 开销,实际可用显存约为标称值的 88%。第二,按 llama.cpp 系 Q4_K_M 量化标准,权重约为每 1B 参数 0.61GB。第三,还要加上承载上下文的 KV 缓存:每 token 字节数 = 2(K,V) x 层数 x KV 头数 x 头大小(128) x 2字节(FP16),再乘以上下文长度。例如 Llama 3.1 8B(32 层、8 个 KV 头)为 2 x 32 x 8 x 128 x 2 = 131,072 字节/token,8K 上下文约需 1.0GB。再加上为操作系统和运行时预留的 1GB 缓冲,就是最终所需容量。
| 档位 | 标称 VRAM | 可用量(x0.88) | 8K标准下日常使用有余 |
|---|---|---|---|
| 入门 | 8 GB | 7.0 GB | 8B Q4是极限,没有上下文余量 |
| 主力 | 12 GB | 10.6 GB | 到 12B Q4 为止,14B 会被截断 |
| 准旗舰 | 16 GB | 14.1 GB | 可跑 14B Q4 + 8K 上下文 |
| 最高级 | 24 GB | 21.1 GB | 至 24B·30B MoE 为止 |
笔记本 GPU VRAM 地图:名字相同,容量不同
2026 款 RTX 50 系列笔记本产品线的官方 VRAM:5070 8GB(128-bit)、5070 Ti 12GB(192-bit)、5080 16GB(256-bit)、5090 24GB(256-bit)。此外新增了 5070 12GB 变体。Framework 模块定价是展示 VRAM 溢价有多大的实例:同样的 5070 模块,8GB 卖 699 美元,12GB 卖 1,199 美元,多花 500 美元买 4GB VRAM。买笔记本时不要只看 GPU 名称,要在丹那哇(Danawa)规格筛选器里直接过滤 VRAM 一项。
| 笔记本GPU | VRAM | 总线宽度 | 8K标准下的可运行线 |
|---|---|---|---|
| RTX 5070(含变体) | 8 / 12 GB | 128-bit | 8B 稳跑,12B 只限 12GB 版 |
| RTX 5070 Ti | 12 GB | 192-bit | 至 12B Q4 为止 |
| RTX 5080 | 16 GB | 256-bit | 14B Q4+长上下文 |
| RTX 5090 | 24 GB | 256-bit | 24B、30B MoE 级 |
笔记本 LLM 按模型体积的必要 VRAM 实测计算表
下面的权重 GB 是我在 M5 Max MacBook 上用 llama.cpp 实跑的 GGUF 文件实测大小(Q4_K_M 系列,截至 2026-09-27)。Q4 8K 的 KV 用上面的算式算出,所需合计 = 权重 + KV + 1GB 缓冲。
| 模型(Q4) | 权重 | KV (8K) | 合计 | 最低 VRAM 档位 |
|---|---|---|---|---|
| Llama 3.1 8B | 4.9 GB | 1.0 GB | 6.9 GB | 8GB(可用 7.0,刚好合适) |
| 12B 级 GQA | 7.3 GB | 1.25 GB | 9.6 GB | 12GB |
| Phi-4 14B | 9.1 GB | 1.56 GB | 11.7 GB | 16GB |
| gpt-oss 20B (MoE) | 13.8 GB | 0.75 GB | 15.6 GB | 24GB |
| Mistral Small 24B | 14.3 GB | 1.25 GB | 16.6 GB | 24GB |
| Qwen3 Coder 30B (MoE) | 18.6 GB | 0.75 GB | 20.4 GB | 24GB(最后一栏) |
| 70B 级 | 42.5 GB | 2.5 GB | 46.0 GB | 笔记本单卡不可行 |
读法如下:8B 在 8GB 笔记本上也能跑,但可用 7.0GB 对 6.9GB 只剩 0.1GB 余量,上下文必须压到 4K 以下。12B 是 12GB 档的第一格;14B 进不了 14.1GB 档,需要 16GB。70B 则根本不适用于任何笔记本显卡档位。
跑不起来怎么办:量化、MoE、RAM 卸载
第一个手段是更强的量化。把 Q4 降到 Q3 或 IQ2,权重减少 25~45%,但句子理解能力明显下降。第二个是 MoE 模型。gpt-oss 20B 权重为 13.8GB,但激活参数只有 3.6B,即使开启 RAM 卸载、token 速度变慢,体感降幅也比稠密模型小。第三个是 RAM 卸载:DDR5-5600 双通道带宽约 90GB/s,只有笔记本 GPU 的四分之一,把权重挪进 RAM 速度会掉 5~10 倍。也就是说,”能跑”和”能用”是两回事。RAM 至少装满 32GB,才是给卸载留余地的底线。
按预算的选购标准:学生·实验室·上班族
学生(笔记本预算₩200万上下):RTX 5070 8GB 笔记本是入门线。以Danawa为准,ASUS TUF A18 5070 8GB 配置券后价2,₩099,000,MSI Crosshair 16 5070 8GB 在2,₩729,000档。现实用途大致是8B Q4推理和课程用编程助手。实验室(₩300万档):同样的钱选5070 Ti 12GB或5070 12GB变体。装上12B Q4,实用性直接上一个台阶。若能兼作台式机,RTX 5070 12GB显卡1,₩383,800(Danawa中位价,9月28日为准),连主机总价更便宜。上班族·高预算:5080 16GB或5090 24GB笔记本;移动性需求低的话,二手3090 24GB台式机每GB成本仍然更划算。同名显卡因TGP性能可差40%的问题笔记本 GPU TGP 完全攻略中讲过了。
与台式机的分岔口
笔记本 5070 8GB 和桌面 5070 12GB 名字相近,实际是两码事。桌面版 5070 总线更宽,达 192-bit,同样跑 8B 推理 token 速度明显更快,VRAM 也多 4GB。12GB 卡的实战上限是RTX 5070 VRAM 12GB 的实战极限中计算得出,覆盖全部用途的最小/推荐量是深度学习 GPU 分用途 VRAM 基准表一起看。只要不是必须便携,桌面版在每 GB 价格上占优的格局到 2026 年依然没变。
常见问题
8GB 笔记本上 Llama 3.1 8B 到底能不能跑?
能跑。但可用 7.0GB 对权重 4.9GB + KV 1.0GB + 缓冲,是严丝合缝地塞进去——得把上下文降到 4K、关掉后台应用才行。想舒服点,建议上 12GB 档。
70B在笔记本上永远没戏吗?
单卡装不下。光 Q4 权重就 42.5GB,拆到两张 24GB 卡上也紧张。RAM 卸载能跑,但在笔记本 DDR5 带宽下,token 速度会掉到个位数。
5070 12GB 变体和 5070 Ti 12GB 怎么选?
两者都是 12GB,但 Ti 的总线宽度为 192-bit,带宽更宽,在长上下文下占优。预算相同就选 Ti;价差较大则 12GB 变体更合理。两者都请先确认与 5080 16GB 的价差。
把内存加到 64GB,大模型不就跑起来了?
「能跑」是能把玩,但权重放在 RAM 里时用的是内存带宽而非 GPU 带宽,速度会掉 5~10 倍。只有像 MoE 这种活跃参数很小的系列,才能保住可用速度。
来源:NVIDIA官方规格表、Framework公开定价、Danawa实际在售(2026年9月27~28日采集)、笔者M5 Max llama.cpp实测GGUF大小。价格与规格会变动,购买前请确认最新信息。