挑选深度学习 GPU 时,第一个问题不是性能而是装载量。即便预算相同,VRAM 12GB 与 24GB 会实际改变能装下的模型大小本身。本文用表格和算式整理出深度学习 GPU 分用途的 VRAM 基准表,并给每一行附上示例 GPU。
🌐 · English · 中文 · Español · 한국어 · · 中文 Hub
为什么不同用途所需显存不同
训练按VRAM容量、内存带宽、核心的顺序卡脖子;推理时VRAM就是能装下的模型大小。图像生成8GB是实际下限;LLM必须权重和KV cache同时就位才能跑。所以每个用途的最低/推荐值都不同。
| 用途 | 最低 VRAM | 推荐显存 | 注意事项 | 示例 GPU |
|---|---|---|---|---|
| 图像分类训练(迁移学习) | 8 GB | 12 GB | 批次大小与 VRAM 成正比 | RTX 4060 8GB / 5060 Ti 16GB |
| Stable Diffusion / 视频生成 | 8 GB | 16 GB 以上 | 分辨率越高,显存暴涨 | RTX 4060 Ti 16GB |
| LLM推理(7~8B量化) | 8 GB | 12~16 GB | token 速度由带宽决定 | RTX 5070 12GB |
| LLM 推理(13~24B 4bit) | 12 GB | 24 GB | 16GB以下基本放弃 | 二手 RTX 3090 24GB |
| 3D Gaussian Splatting / 神经辐射场(NeRF) | 12 GB | 24 GB | 大型场景必须 24GB | RTX 4090 24GB |
本地运行 LLM 所需 VRAM 的计算方法
按 llama.cpp 系的 Q4_K_M 标准,权重约为每 1B 参数 0.61GB。Windows 上扣除 CUDA 开销后,实际可用只有标称 VRAM 的 88%:12GB 约 10.6GB,24GB 约 21.1GB。用这两个数字就能算出这张表。
| 模型大小(Q4_K_M) | 权重(B x 0.61) | KV 缓存余量 | 合计所需 | 最低显卡 |
|---|---|---|---|---|
| 8B | 4.9 GB | 3.0 GB | 7.9 GB | 12GB(可用 10.6GB,宽裕) |
| 12B | 7.3 GB | 3.3 GB | 10.6 GB | 12GB(可用 10.6GB,刚好合适) |
| 24B | 14.6 GB | 6.5 GB | 21.1 GB | 24GB(可用 21.1GB) |
| 70B | 42.7 GB | 4.0 GB | 46.7 GB | 48GB 级或拆到 2 张卡分摊 |
分岔口在 12B 和 24B 之间。24B 合计需要 21.1GB,光权重(14.6GB)就进不了 12GB 卡;70B 需要 46.7GB,超过 48GB 单卡的可用量(42.2GB),消费级单卡从一开始就不成立。5070 12GB 能跑到哪一步,RTX 5070 VRAM 12GB 的实战极限我在……里算得更详细
Stable Diffusion 需要多少 GB
基于 SD 1.5 的 512px 生成在 8GB 上能跑。但一旦转到 SDXL 1024px 批次 4 以上、LoRA 训练、视频生成,需求量立刻飙到 16GB 以上。在这个区间,8GB 卡不会报错,而是以生成被截断的方式无声失败,所以图像用途我建议一开始就上 16GB。
入门训练 PC 该配什么 GPU
如果是新购入门训练,RTX 4060 Ti 16GB 是最合理的落点。SD 默认分辨率生成和 7B 微调还能扛得住,系统 RAM 也请配到 32GB 以上。但带宽只有 288GB/s,在大批次训练或快速推理上瓶颈明显。对急于装得下而非急于算得快的新手,容量优先。
按实验室预算的现实选择
- 低预算:二手 RTX 3090 24GB——用预算一半在同一个位置装进 24GB 的唯一答案
- 中档:RTX 5060 Ti 16GB(慢但容量大)或 RTX 5070 12GB(快但容量浅)——按用途优先级选择
- 高预算:RTX 4090 24GB,售罄后转 5090——24GB 与 1TB/s 级带宽一起拿下
2026年价格,表中数字何时更新
截至 2026 年 9 月第 4 周的实时数据:RTX 5070 ₩1,383,800 · RTX 5060 Ti 8GB ₩801,200 · RTX 3060 12GB ₩540,300(Danawa实际在售中位价·每日09:00自动采集)。上表的VRAM判定与价格无关、维持不变,仅价格在本段每周更新。每周每GB分析见价格追踪周报在……继续
常见问题
显存越大,训练也会按比例变快吗?
不是。容量决定能装下几个模型,速度由带宽和核心决定。二手 3090 与 4090 容量相同,但速度落后一代。请在表中把这两个轴分开来看。
12GB 卡能做微调吗?
上限是 7B 级 LoRA。继续预训练或微调 13B 以上,连优化器状态都要占地方,得 24GB——所以目的是学习的话,直接从 3090/4090 级起步,报价才不会白做。
同一套标准表也能用在笔记本上吗?
不能照搬。笔记本 GPU 即使同型号,受 TGP 影响只有桌面的 60~80% 性能,VRAM 也常缩水。默认”笔记本做开发和推理、训练放服务器”,把 VRAM 8GB 以上、RAM 32GB 以上当底线。
来源与基准:llama.cpp Q4_K_M 权重每 1B 0.61GB 及扣除 12% CUDA 开销(可用 88%)的假设与 5070 实测专栏一致;价格区间为 2026 年 5 月按 Namuwiki RTX 50 词条和 Danawa 的统计;GPU 规格以厂商公开资料为准。实际价格会波动,购买前请确认最新行情。
按现价入手——9 款 GPU 行情
Danawa 实卖价 + 二手市场片段聚合 · 每日 09:00 KST 自动更新 ·DAILY 09:00
| GPU | 今日中位市价 | 价位位置 | 趋势 | 较前一日 |
|---|---|---|---|---|
| RTX 5090 32GB | 8,699,990 韩元 | ▼ -0.0% | ||
| RTX 5080 16GB | 2,599,000 韩元 | ▲ +3.4% | ||
| RTX 5070 Ti 16GB | ₩1,959,000 | ▼ -1.6% | ||
| RX 9070 XT 16GB | 1,501,600 韩元 | ▲ +0.2% | ||
| RTX 5070 12GB | 1,383,800 韩元 | ▲ +0.3% | ||
| RTX 5060 Ti 8GB | 801,200 韩元 | ▲ +1.2% | ||
| RTX 5060 8GB | 757,000 韩元 | ▲ +3.3% | ||
| RTX 5050 8GB | 605,200 韩元 | ▲ +5.8% | ||
| RTX 3060 12GB | 540,300 韩元 | ▲ +0.2% |
最后更新 2026-09-28 09:02 KST
.