GPU 시세 · VRAM · 온디바이스 AI

先说结论:只做 LLM 推理,RTX 4090 的优势体感是 1.4~1.5 倍,不是参数表上的 2.7 倍。按 2026 年 9 月 27 日今日行情,全新 RTX 5070 约 137 万韩元档,二手 RTX 4090 约 334 万韩元档 — 价差拉开到 2.4 倍时,不能把规格表的 2.7 倍率照单全收。本文把两张卡的差异拆成”运算”与”装载”两个轴,并以含电费的月维护费做最终判定。

🌐 · English · 中文 · Español · 한국어 · · 中文 Hub

规格表上的 2.7 倍:哪些运算为真,哪里是假

FP32 82.58 对 30.84 TFLOPS——单看纯矩阵乘密度,4090 确实是 2.7 倍。图像生成批次大、训练迭代以计算为主时,这个差距能直接感受到。但 LLM 推理每次只生成一个 token,必须先把全部模型参数从内存读出。在这种每次都要流式读取 7B Q4 量化模型所在约 4.5GB 的结构里,瓶颈不是核心而是内存带宽。带宽差距只有 672 对 1,008,即 1.5 倍。

项目 RTX 5070(新款) RTX 4090(二手)
CUDA 核心 6,144 16,384(2.7倍)
FP32 性能 30.84 TFLOPS 82.58 TFLOPS(2.7 倍)
VRAM 12GB GDDR7 24GB GDDR6X(2 倍)
内存带宽 672 GB/s 1,008 GB/s(1.5倍)
显存位宽 192-bit 384-bit
TDP 250W 450W (+80%)
能效比(FP32/W) 0.123 0.183(5070 敏捷 44%)
世代·接口 Blackwell · PCIe 5.0 Ada · PCIe 4.0
今日行情 ₩137万档(新型、3年保修) 334 万韩元档(二手、无保)

那么7B推理速度到底差几倍

1,008 GB/s ÷ 模型约 4.5GB × 30% 实际效率

672 GB/s ÷ 模型约 4.5GB × 30% 实际效率

推理的瓶颈不是核心而是带宽

7B Q4 推理(单流) 依据算式
RTX 4090:上限约 224,实测体感约 67 tok/s
RTX 5070:上限约149,实测体感约44 tok/s
→ 差距:1.5 倍(不是参数表的 2.7 倍)

搭载 GDDR7 的 5070 凭借世代优势进一步缩小差距。在带 GPU-Direct 类优化的 llama.cpp 系运行时上,两张卡的 7B 推理差距通常会缩小到体感 1.3~1.4 倍。如果你是照参数表心算出“买 4090 就快 2.7 倍”,那得重新算一遍。

即便如此,该买 4090 的唯一条件是什么

VRAM 12GB 对 24GB — 这不是性能差距,而是’可能与不可能’的差别。详细计算已整理在 [VRAM 基准表](https://daily-llm.com/2026-09-25/vram-guide-by-usecase-2609/),但 32B 级 Q4 模型需要约 19.5GB。在 5070 上根本无从尝试,在 4090 上则能装下。直接实测 RTX 5070 实战极限的 [实测专栏](https://daily-llm.com/2026-09-27/rtx-5070-vram-12gb-deep-learning-limit/) 也得出同样结论。如果你的主要用途是比’能不能运行’而非’快几倍’的场景 — 长上下文推理、中等批次的微调、同时驻留多个模型的 agent 栈 — 就该上 24GB。

加上电费后,每月持有成本差多少

假设 720 小时(按每天 24 小时扣除闲置后 60% 利用率),如上表所示,5070 每月 6.5 万韩元,二手 4090 每月 18.8 万韩元。在 44% 能效优势之上,再叠加二手 4090 相对价格的折旧速度,差距会拉大到每年 147 万韩元。反过来说,334 万韩元的二手 4090,等于用约 51 个月的电费+折旧去换一台全新 5070;想把那“2.7 倍”完全赚回来,得有很高的利用率才行。

—— 4090 每年多花 147 万韩元

月度持有成本(720 小时 × 60% 负载) RTX 5070 二手 RTX 4090
电费(250 韩元/kWh) 27,000 韩元 48,600 韩元
折旧(5070 按 36 个月 / 二手 4090 按 24 个月) 38,115 韩元 138,958 韩元
合计 约 6.5 万韩元/月 约₩18.8万/月
年度差距

常见问题

买两张把 VRAM 合起来不行吗?

用张量并行可以凑出 24GB 配置,但在没有 NVLink 的 5070 上,分层切分的通信开销会让总吞吐量在 1.5~1.8 倍左右饱和。功耗 500W,发热和机箱宽度也一起上涨。单张 24GB 显卡通常在维护成本上更划算。

电费真的差那么多吗?

200W的持续差值按432小时算是每月21.6kWh,₩250/kWh即每月5,₩400——按上表60%负载假设约₩2.2万。再算上四季制冷负担,实际差距更大。

验二手 4090 要看哪些地方?

比起挖矿史,更要盯的是接口接触不良、风扇噪音和重新涂硅脂的历史。由于没有保修,要避开那些兜售延保的卖家,选支持一周测试使用的渠道。

行情每日更新——要看今日最低价和环比变化GPU 行情看板请查看