本地模型•(更新于 2026-09-25)
我用 RTX 3080 跑本地模型时,最后留下的量化选择
记录在 10GB 显存的 RTX 3080 上跑 4B/8B/14B 模型时的实际取舍与显存分配。
一句话结论:对于 10GB 显存的 RTX 3080,8B 模型的 Q4_K_M 是日常响应和长上下文显存不溢出的折中选择;14B 勉强能跑但上下文稍长就会爆显存溢出到系统内存。
我的测试环境
| 系统 | Windows 11 专业版 |
| GPU | RTX 3080 (10GB) |
| 系统内存 | 24GB |
| 运行环境 | Ollama / llama.cpp |
测试情况与记录
- 4B 模型(如 Qwen2.5-Coder 3B/4B):权重仅占约 2.5GB 显存,推理速度极快,适合做单行代码补全。
- 8B 模型(Q4_K_M):权重约占用 4.9GB 显存,留有 4~5GB 给 KV Cache 缓冲,8k 上下文内运行平稳,不卡死。
- 14B 模型:Q4 权重直接占掉 9.2GB 显存,长对话很容易将显存撑爆回退到 CPU,速度骤降。
最终结论
10GB 卡日常主力用 8B Q4_K_M 最省心,不要花时间死磕 14B 本地推理,复杂的长推理直接调外部接口更划算。