从ChatGPT界面下载?那不算本地。把权重文件下到自家硬盘、在自己的GPU上直接推理,才叫本地。2026年的今天,DeepSeek V4、Qwen3.5,连OpenAI gpt-oss都公开了权重,许可也是宽松的Apache/MIT。本文把安装、下载、实际运行,以及我们各种设备的现实边界一次讲完。
🌐 · English · 中文 · Español · 한국어 · · 中文 Hub
2026 开放权重格局——什么真能跑起来
| 模型(2026) | 结构 | 激活参数 | 轻量发行版 | 上下文 |
|---|---|---|---|---|
| DeepSeek V4 Flash | MoE 284B | 13B | GGUF 3bit 103GB | 1M |
| DeepSeek V4.1 Flash | MoE 552B | 8B/16B | Ollama 仅限云端 | 1M |
| Qwen3.5 9B | Dense 9.7B | 全部 | Ollama Q4_K_M 6.6GB | 256K |
| Qwen3.5 35B-A3B | MoE 35B | 3B | Ollama 24GB (MLX 22GB) | 256K |
| gpt-oss 120B | MoE 117B | 5.1B | Ollama 65GB | 128K |
| gpt-oss 20B | MoE 21B | 3.6B | Ollama 14GB | 128K |
核心是 MoE(混合专家)。即便参数总量很大,每个 token 唤醒的激活部分只有 3~16B 水平,所以 35B 级的 Qwen3.5-A3B 实际上以 3B 的代价运行。表中的发行版大小是我今天在 ollama.com 实时标签页和 Hugging Face unsloth GGUF 仓库直接核对的实测大小。
第 1 步——选择运行器(Ollama / llama.cpp / LM Studio / vLLM)
- Ollama—— macOS/Windows 一键安装,内置模型池、自动分层卸载、OpenAI 兼容 API。第一次入门,务必从这里开始。
- LM Studio——用图形界面挑选 GGUF、聊天的应用。适合不习惯终端的人。
- llama.cpp——顶级控制(量化、GPU 层数、服务器参数)。像 DeepSeek V4 这样的大型 MoE,实际上只能从这扇门进来。
- vLLM——面向大批量处理服务器。相比个人台式机,它在 2 张卡以上跑 llama 的配置里才显出真价值。
第 2 步——安装与首次运行(已验证的实战日志)
以 macOS 为准。Windows 上 ollama.com 的安装程序 .exe 结构相同。
brew install ollama # 或从 ollama.com 下载
ollama pull qwen3.5:9b # 下载 6.6GB 权重
ollama run qwen3.5:9b # 立即开始聊天
这是我在自己的工作机(M5 Max 128GB)上刚跑的真实日志。下载量 6.6GB,完成后的模型信息:
$ ollama show qwen3.5:9b
architecture qwen35
parameters 9.7B
context length 262144
quantization Q4_K_M
Capabilities: completion, vision, tools, thinking
License: Apache 2.0
模型文件像容器镜像一样按层堆叠在 ~/.ollama/models。我自己的机器上现在装了 14 个模型、共 222GB,并且ollama list随时查看账本。
第 3 步——在我的 PC 上跑 DeepSeek V4——现实检查
按官方发布口径,V4 Flash(284B,活跃 13B)已以 MIT 许可证公开权重。但今天到 ollama.com 线上核实的结果是deepseek-v4.1-flash 标签仅限云端——运行它时,提示词是发给 Ollama 服务器的,而不是这台电脑。要真正本地化,唯一路径是用 llama.cpp 直接拉取 Hugging Face 的 GGUF:
# unsloth GGUF, 3bit(103GB) — 以128GB RAM级设备为基准
llama-cli -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-IQ3_S \
--temp 1.0 --top-p 1.0 --min-p 0.01
64GB 及以下设备的现实:V4 Flash 的 8bit 完整版 162GB,太奢侈;3bit(103GB)也悬。32GB 及以下就别在本地跑 V4 系列了,同样的问题去问 Qwen3.5 27b——最近差距已经小了不少。
第 4 步——你的 GPU 上装什么(与行情直接挂钩)
| 你的设备 | 可运行阵容 | 被放弃的产品线 |
|---|---|---|
| VRAM 8GB(5050/5060 级) | Qwen3.5 4B·2B,gpt-oss 20B部分卸载 | 9B 以上全部 |
| VRAM 12GB (5070) | Qwen3.5 9B Q4(6.6GB)+KV余量,4B MXFP4 | 13B+ 常驻 |
| VRAM 16GB (5060Ti16/5080) | Qwen3.5 9B + 128K 上下文,gpt-oss 20b | 35B 级常驻 |
| VRAM 24GB (3090/4090) | Qwen3.5 27b Q4(17GB),35b-a3b 正好 24GB | 120B 级 |
| Mac 统一内存 128GB(M5 Max) | Qwen3.5 122b-a10b(81GB)、gpt-oss 120b(65GB)、V4-Flash IQ3 临界 | V4 Pro 1.6T |
要让装载计算简单VRAM 按用途基准表以及刚刚被监控的RTX 5070 12GB 极限实验一起看。新系列的行情价在价格追踪仪表盘每日更新。
第5步——直接实测自己机器的速度
curl http://localhost:11434/api/generate -d '{"model":"qwen3.5:9b",
"prompt":"什么是混合专家?","stream":false,
"options":{"temperature":0.2,"num_predict":60}}' | jq '.eval_count, .eval_duration'
# tok/s = eval_count ÷ (eval_duration ÷ 1e9)
把同一条命令按不同显卡、不同量化各跑一遍,做出你自己的t/s表。别人的基准不能直接照搬——内存频率和量化规格都不一样。
常见问题
下载到一半断了,必须从头重下吗?
不会。ollama pull 按层续传,已下载的层会跳过。重新执行同一条命令即可。
下载过的模型可以删掉吗?
ollama rm qwen3.5:9b删除,磁盘空间立刻释放。模型列表与实际大小合计见ollama list随时自查——我自己的设备上也堆了14个模型、222GB。
量化标注(Q4_K_M、IQ3_S、MXFP4)该选哪个?
第一颗扣子是容量:算一下,权重GB≒参数量×比特÷8。Q4_K_M已是行话——「9B就是6.6GB」成了标准;IQ3_x是llama.cpp专用格式,在3比特上下做OS-preserve。VRAM有了富余,就从那里再往上加一档。