GPU 시세 · VRAM · 온디바이스 AI

一张 4090 24GB 能训练什么、要花多少钱——配方表基于 gigagpu 的实测,并按我机器的特性补上了 Qwen 对应方案。

🌐 · English · 中文 · Español · 한국어 · · 中文 Hub

配方 模型 序列 批次 处理速度 50k 样本 1 epoch
LoRA bf16 Llama-3-8B(相当于 Qwen3-8B) 2048 8 ~18,000 tok/s 约 1.6 小时
LoRA bf16 Mistral-7B 2048 8 ~21,000 tok/s 约 1.4 小时
LoRA bf16 Qwen2.5-14B 2048 2 ~6,400 tok/s 约 4.4 小时
QLoRA NF4 Llama-3-8B 2048 8 ~14,500 tok/s 约 2.0 小时
QLoRA NF4 Llama-3-70B 2048 1 ~1,800 tok/s 约 16 小时
Unsloth LoRA Llama-3-8B 2048 8 ~32,000 tok/s(1.78 倍) 约0.9小时
Unsloth QLoRA Llama-3-70B 2048 1 ~3,200 tok/s(1.78 倍) 约 9 小时

24GB 上限线

方式 上限 必选配置
LoRA fp16/bf16 ~14B seq 超过 2048 就用 gradient checkpointing
QLoRA NF4 ~70B 必须 paged AdamW + FlashAttention-2 + double-quant
全参数 SFT ~3B 优化器 CPU 卸载 + 8-bit Adam
DPO/RLHF ~13B (LoRA) 共享 reference 策略 LoRA 是关键
继续预训练 ~1~3B 8-bit Adam + grad checkpointing

电费与体感

8B LoRA 跑 1 个 epoch(1.6 小时)的增量耗电是 350W×1.6h=0.56kWh,按 214.6 韩元/kWh 合 120 韩元。70B QLoRA 周末任务(16 小时)电费也只有 3,500 韩元。训练中贵的不是电,而是卡和时间——显卡折旧(356 万韩元/24 个月)摊到每小时约 615 韩元/时,是电费的 5 倍。

推理侧的显存计算见VRAM指南,运行时是运行时对比.

撰写于 2026-09-28 · 文件大小为 Hugging Face 在线列表实测 · 速度仅采用注明出处的公开测量和我的实测 · 无本地运行 ·查看完整枢纽 · 量化阶梯 104 个构建 · 47 款生成速度图表