本地模型•(更新于 2026-09-25)

我用 RTX 3080 跑本地模型时,最后留下的量化选择

记录在 10GB 显存的 RTX 3080 上跑 4B/8B/14B 模型时的实际取舍与显存分配。

一句话结论:对于 10GB 显存的 RTX 3080,8B 模型的 Q4_K_M 是日常响应和长上下文显存不溢出的折中选择;14B 勉强能跑但上下文稍长就会爆显存溢出到系统内存。

我的测试环境

系统Windows 11 专业版
GPURTX 3080 (10GB)
系统内存24GB
运行环境Ollama / llama.cpp

测试情况与记录

  • 4B 模型(如 Qwen2.5-Coder 3B/4B):权重仅占约 2.5GB 显存,推理速度极快,适合做单行代码补全。
  • 8B 模型(Q4_K_M):权重约占用 4.9GB 显存,留有 4~5GB 给 KV Cache 缓冲,8k 上下文内运行平稳,不卡死。
  • 14B 模型:Q4 权重直接占掉 9.2GB 显存,长对话很容易将显存撑爆回退到 CPU,速度骤降。

最终结论

10GB 卡日常主力用 8B Q4_K_M 最省心,不要花时间死磕 14B 本地推理,复杂的长推理直接调外部接口更划算。