GPU 시세 · VRAM · 온디바이스 AI

从ChatGPT界面下载?那不算本地。把权重文件下到自家硬盘、在自己的GPU上直接推理,才叫本地。2026年的今天,DeepSeek V4、Qwen3.5,连OpenAI gpt-oss都公开了权重,许可也是宽松的Apache/MIT。本文把安装、下载、实际运行,以及我们各种设备的现实边界一次讲完。

🌐 · English · 中文 · Español · 한국어 · · 中文 Hub

2026 开放权重格局——什么真能跑起来

模型(2026) 结构 激活参数 轻量发行版 上下文
DeepSeek V4 Flash MoE 284B 13B GGUF 3bit 103GB 1M
DeepSeek V4.1 Flash MoE 552B 8B/16B Ollama 仅限云端 1M
Qwen3.5 9B Dense 9.7B 全部 Ollama Q4_K_M 6.6GB 256K
Qwen3.5 35B-A3B MoE 35B 3B Ollama 24GB (MLX 22GB) 256K
gpt-oss 120B MoE 117B 5.1B Ollama 65GB 128K
gpt-oss 20B MoE 21B 3.6B Ollama 14GB 128K

核心是 MoE(混合专家)。即便参数总量很大,每个 token 唤醒的激活部分只有 3~16B 水平,所以 35B 级的 Qwen3.5-A3B 实际上以 3B 的代价运行。表中的发行版大小是我今天在 ollama.com 实时标签页和 Hugging Face unsloth GGUF 仓库直接核对的实测大小。

第 1 步——选择运行器(Ollama / llama.cpp / LM Studio / vLLM)

  • Ollama—— macOS/Windows 一键安装,内置模型池、自动分层卸载、OpenAI 兼容 API。第一次入门,务必从这里开始。
  • LM Studio——用图形界面挑选 GGUF、聊天的应用。适合不习惯终端的人。
  • llama.cpp——顶级控制(量化、GPU 层数、服务器参数)。像 DeepSeek V4 这样的大型 MoE,实际上只能从这扇门进来。
  • vLLM——面向大批量处理服务器。相比个人台式机,它在 2 张卡以上跑 llama 的配置里才显出真价值。

第 2 步——安装与首次运行(已验证的实战日志)

以 macOS 为准。Windows 上 ollama.com 的安装程序 .exe 结构相同。

brew install ollama        # 或从 ollama.com 下载
ollama pull qwen3.5:9b     # 下载 6.6GB 权重
ollama run qwen3.5:9b      # 立即开始聊天

这是我在自己的工作机(M5 Max 128GB)上刚跑的真实日志。下载量 6.6GB,完成后的模型信息:

$ ollama show qwen3.5:9b
  architecture        qwen35
  parameters          9.7B
  context length      262144
  quantization        Q4_K_M
  Capabilities: completion, vision, tools, thinking
  License: Apache 2.0

模型文件像容器镜像一样按层堆叠在 ~/.ollama/models。我自己的机器上现在装了 14 个模型、共 222GB,并且ollama list随时查看账本。

第 3 步——在我的 PC 上跑 DeepSeek V4——现实检查

按官方发布口径,V4 Flash(284B,活跃 13B)已以 MIT 许可证公开权重。但今天到 ollama.com 线上核实的结果是deepseek-v4.1-flash 标签仅限云端——运行它时,提示词是发给 Ollama 服务器的,而不是这台电脑。要真正本地化,唯一路径是用 llama.cpp 直接拉取 Hugging Face 的 GGUF:

# unsloth GGUF, 3bit(103GB) — 以128GB RAM级设备为基准
llama-cli -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-IQ3_S \
  --temp 1.0 --top-p 1.0 --min-p 0.01

64GB 及以下设备的现实:V4 Flash 的 8bit 完整版 162GB,太奢侈;3bit(103GB)也悬。32GB 及以下就别在本地跑 V4 系列了,同样的问题去问 Qwen3.5 27b——最近差距已经小了不少。

第 4 步——你的 GPU 上装什么(与行情直接挂钩)

你的设备 可运行阵容 被放弃的产品线
VRAM 8GB(5050/5060 级) Qwen3.5 4B·2B,gpt-oss 20B部分卸载 9B 以上全部
VRAM 12GB (5070) Qwen3.5 9B Q4(6.6GB)+KV余量,4B MXFP4 13B+ 常驻
VRAM 16GB (5060Ti16/5080) Qwen3.5 9B + 128K 上下文,gpt-oss 20b 35B 级常驻
VRAM 24GB (3090/4090) Qwen3.5 27b Q4(17GB),35b-a3b 正好 24GB 120B 级
Mac 统一内存 128GB(M5 Max) Qwen3.5 122b-a10b(81GB)、gpt-oss 120b(65GB)、V4-Flash IQ3 临界 V4 Pro 1.6T

要让装载计算简单VRAM 按用途基准表以及刚刚被监控的RTX 5070 12GB 极限实验一起看。新系列的行情价在价格追踪仪表盘每日更新。

第5步——直接实测自己机器的速度

curl http://localhost:11434/api/generate -d '{"model":"qwen3.5:9b",
  "prompt":"什么是混合专家?","stream":false,
  "options":{"temperature":0.2,"num_predict":60}}' | jq '.eval_count, .eval_duration'
# tok/s = eval_count ÷ (eval_duration ÷ 1e9)

把同一条命令按不同显卡、不同量化各跑一遍,做出你自己的t/s表。别人的基准不能直接照搬——内存频率和量化规格都不一样。

常见问题

下载到一半断了,必须从头重下吗?

不会。ollama pull 按层续传,已下载的层会跳过。重新执行同一条命令即可。

下载过的模型可以删掉吗?

ollama rm qwen3.5:9b删除,磁盘空间立刻释放。模型列表与实际大小合计见ollama list随时自查——我自己的设备上也堆了14个模型、222GB。

量化标注(Q4_K_M、IQ3_S、MXFP4)该选哪个?

第一颗扣子是容量:算一下,权重GB≒参数量×比特÷8。Q4_K_M已是行话——「9B就是6.6GB」成了标准;IQ3_x是llama.cpp专用格式,在3比特上下做OS-preserve。VRAM有了富余,就从那里再往上加一档。