一张 4090 24GB 能训练什么、要花多少钱——配方表基于 gigagpu 的实测,并按我机器的特性补上了 Qwen 对应方案。
🌐 · English · 中文 · Español · 한국어 · · 中文 Hub
| 配方 | 模型 | 序列 | 批次 | 处理速度 | 50k 样本 1 epoch |
|---|---|---|---|---|---|
| LoRA bf16 | Llama-3-8B(相当于 Qwen3-8B) | 2048 | 8 | ~18,000 tok/s | 约 1.6 小时 |
| LoRA bf16 | Mistral-7B | 2048 | 8 | ~21,000 tok/s | 约 1.4 小时 |
| LoRA bf16 | Qwen2.5-14B | 2048 | 2 | ~6,400 tok/s | 约 4.4 小时 |
| QLoRA NF4 | Llama-3-8B | 2048 | 8 | ~14,500 tok/s | 约 2.0 小时 |
| QLoRA NF4 | Llama-3-70B | 2048 | 1 | ~1,800 tok/s | 约 16 小时 |
| Unsloth LoRA | Llama-3-8B | 2048 | 8 | ~32,000 tok/s(1.78 倍) | 约0.9小时 |
| Unsloth QLoRA | Llama-3-70B | 2048 | 1 | ~3,200 tok/s(1.78 倍) | 约 9 小时 |
24GB 上限线
| 方式 | 上限 | 必选配置 |
|---|---|---|
| LoRA fp16/bf16 | ~14B | seq 超过 2048 就用 gradient checkpointing |
| QLoRA NF4 | ~70B | 必须 paged AdamW + FlashAttention-2 + double-quant |
| 全参数 SFT | ~3B | 优化器 CPU 卸载 + 8-bit Adam |
| DPO/RLHF | ~13B (LoRA) | 共享 reference 策略 LoRA 是关键 |
| 继续预训练 | ~1~3B | 8-bit Adam + grad checkpointing |
电费与体感
8B LoRA 跑 1 个 epoch(1.6 小时)的增量耗电是 350W×1.6h=0.56kWh,按 214.6 韩元/kWh 合 120 韩元。70B QLoRA 周末任务(16 小时)电费也只有 3,500 韩元。训练中贵的不是电,而是卡和时间——显卡折旧(356 万韩元/24 个月)摊到每小时约 615 韩元/时,是电费的 5 倍。
撰写于 2026-09-28 · 文件大小为 Hugging Face 在线列表实测 · 速度仅采用注明出处的公开测量和我的实测 · 无本地运行 ·查看完整枢纽 · 量化阶梯 104 个构建 · 47 款生成速度图表