Win11 + RTX 5080 本地 Coding 模型测试笔记
测试环境:Windows 11 + NVIDIA GeForce RTX 5080 16GB + AMD Ryzen 7 9800X3D + llama.cpp
主要目标:寻找适合OpenCode 本地编程的模型及最佳量化/Context 配置。
先看结果 (还是留着买5080的钱去订阅吧)
| 排名 | 模型 | 量化 | Context | Prompt | Generation | VRAM |
|---|---|---|---|---|---|---|
| 🥇 | Qwen3-14B | Q4_K_M | 16K | 1247.1 | 84.5 | 12.68GB |
| 🥇 | Qwen3-14B | Q4_K_M | 32K | 1170.8 | 85.8 | 15.12GB |
| 🥈 | Qwen3-14B | Q4_K_M | 4K | 715.1 | 83.5 | 10.75GB |
| 🥉 | Qwen3-14B | Q8_0 | 8K | 363.8 | 27.8 | 15.95GB |
| 4 | Qwen3-Coder-30B-A3B | Q4_K_M | 8K | 120.5 | 16.3 | ~15.7GB |
| 5 | GLM-4.7-Flash | Q4_K | — | 82.2 | 12.4 | — |
不同测试的 prompt、Context 和运行状态并不完全一致,因此表格主要用于实际体验和硬件适配参考,不能视为严格的模型 benchmark。
1. 测试环境
硬件
| 项目 | 配置 |
|---|---|
| CPU | AMD Ryzen 7 9800X3D |
| CPU 核心 | 8 核 / 16 线程 |
| GPU | NVIDIA GeForce RTX 5080 |
| GPU 显存 | 16303 MiB ≈ 16GB |
| NVIDIA Driver | 610.52 |
| CUDA | 13.3 |
| 系统 | Windows 11 |
| llama.cpp | b10375 / build 10417 等测试版本 |
| GPU Backend | CUDA |
| Flash Attention | -fa on |
llama.cpp 目录
D:\AI\llama-cuda模型目录
D:\AI\models2. 测试参数说明
本次主要使用:
-ngl 999含义:
尽可能将模型层全部卸载到 GPU。
-c 8192Context Window:
8192 tokens = 8K测试过程中还使用:
16384 = 16K 32768 = 32K-fa on开启 Flash Attention。
当前 llama.cpp 版本要求明确指定:
-fa on不能写成单独的:
-fa否则会被解析成:
--flash-attn '-p'导致:
unknown value for --flash-attn: '-p'3. Qwen3-Coder-30B-A3B-Q4_K_M
模型:
qwen3-coder-30b-a3b-instruct-q4_k_m.gguf文件大小:
18,556,688,704 bytes ≈ 17.27 GiB模型:
Qwen3-Coder-30B-A3B-Instruct Q4_K_M测试参数
.\llama-cli.exe `-m"D:\AI\models\qwen3-coder-30b-a3b-instruct-q4_k_m.gguf"`-ngl 999 `-c 8192 `-fa on `-p"用 TypeScript 实现一个 LRU Cache,要求支持泛型、最大容量和 TTL。"测试结果:
Prompt: 120.5 tok/s Generation: 16.3 tok/s VRAM: ≈ 15.7GB评价
优点:
- Coding 能力较强
- 30B 级别模型
- 复杂代码理解能力较好
缺点:
- RTX 5080 16GB 显存压力非常大
- Generation 只有约16 tok/s
- OpenCode Agent 多轮工作时等待时间明显
结论
复杂架构 / 深度代码分析:★★★★☆ 日常 Coding:★★☆☆☆ 速度:★★☆☆☆ 显存效率:★★☆☆☆4. GLM-4.7-Flash-Q4_K
测试模型:
GLM-4.7-Flash-Q4_K.gguf注意:
本次使用的是
Q4_K,不是Q4_K_M。
测试结果:
Prompt: 82.2 tok/s Generation: 12.4 tok/s评价
Generation:
12.4 tok/s明显低于 Qwen3-14B-Q4_K_M:
84.5 tok/s因此在当前硬件上的实际 Coding 体验并不理想。
结论
Coding:★★★☆☆ 速度:★☆☆☆☆ OpenCode:★★☆☆☆5. Qwen3-14B-Q4_K_M
模型:
Qwen3-14B-Q4_K_M.gguf这是目前测试中表现最好的模型。
5.1 4K Context
测试结果:
Prompt: 715.1 tok/s Generation: 83.5 tok/s VRAM: 10745 MiB约:
10.75GB结果
Generation = 83.5 tok/s已经非常快。
6. Qwen3-14B-Q4_K_M / 16K
测试结果:
Prompt: 1247.1 tok/s Generation: 84.5 tok/s VRAM: 12679 MiB显存:
12.68GB剩余:
16303 - 12679 = 3624 MiB约:
3.5GB评价
这是目前最推荐的配置。
Qwen3-14B-Q4_K_M + 16K Context + Full GPU Offload + Flash Attention速度:
≈84.5 tok/s显存:
≈12.7GB具有比较充足的显存余量。
7. Qwen3-14B-Q4_K_M / 32K
测试结果:
Prompt: 1170.8 tok/s Generation: 85.8 tok/s VRAM: 15115 MiB显存:
15.12GB剩余:
16303 - 15115 = 1188 MiB约:
1.16GB评价
非常值得注意:
16K: 84.5 tok/s 32K: 85.8 tok/sGeneration 基本没有下降。
但:
16K: 12.68GB 32K: 15.12GB显存已经达到:
92.7%因此:
日常 OpenCode
推荐:
16K大型项目临时分析
可以:
32K但不建议长期作为默认配置。
8. Qwen3-14B-Q8_0
模型:
Qwen3-14B-Q8_0.gguf测试参数:
.\llama-cli.exe `-m"D:\AI\models\Qwen3-14B-Q8_0.gguf"`-ngl 999 `-c 8192 `-fa on `-p"用 TypeScript 实现一个高性能 LRU Cache,要求支持泛型、最大容量、TTL,并解释设计思路和时间复杂度。"测试结果:
Prompt: 363.8 tok/s Generation: 27.8 tok/s VRAM: 15950 MiB显存:
15.95GB剩余:
16303 - 15950 = 353 MiB仅约:
0.35GB9. Q4_K_M vs Q8_0
这是本次最有价值的对比之一。
| 项目 | Q4_K_M | Q8_0 |
|---|---|---|
| 模型 | Qwen3-14B | Qwen3-14B |
| Context | 8K~32K | 8K |
| Generation | 83~86 tok/s | 27.8 tok/s |
| VRAM | 10.7~15.1GB | 15.95GB |
| 显存余量 | 较充足 | 仅353MB |
| OpenCode | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ |
| 综合推荐 | ★★★★★ | ★★★ |
Q8 的问题非常明显:
84.5 tok/s ↓ 27.8 tok/s速度下降约:
67%同时显存几乎完全占满。
10. 当前所有模型测试汇总
| 排名 | 模型 | 量化 | Context | Prompt | Generation | VRAM |
|---|---|---|---|---|---|---|
| 🥇 | Qwen3-14B | Q4_K_M | 16K | 1247.1 | 84.5 | 12.68GB |
| 🥇 | Qwen3-14B | Q4_K_M | 32K | 1170.8 | 85.8 | 15.12GB |
| 🥈 | Qwen3-14B | Q4_K_M | 4K | 715.1 | 83.5 | 10.75GB |
| 🥉 | Qwen3-14B | Q8_0 | 8K | 363.8 | 27.8 | 15.95GB |
| 4 | Qwen3-Coder-30B-A3B | Q4_K_M | 8K | 120.5 | 16.3 | ~15.7GB |
| 5 | GLM-4.7-Flash | Q4_K | — | 82.2 | 12.4 | — |
不同测试的 prompt、Context 和运行状态并不完全一致,因此表格主要用于实际体验和硬件适配参考,不能视为严格的模型 benchmark。
11. 当前最佳配置
🥇 日常 OpenCode
模型: Qwen3-14B-Q4_K_M.gguf 参数: -ngl 999 -c 16384 -fa on实际测试:
Generation: 84.5 tok/s VRAM: 12679 MiB / 16303 MiB这是目前最推荐的配置。
🥈 大型项目
Qwen3-14B-Q4_K_M -ngl 999 -c 32768 -fa on实测:
85.8 tok/s 15115 / 16303 MiB适合临时进行:
- 大型代码库分析
- 多文件重构
- 架构分析
- 大量代码上下文
但是不建议长期默认使用。
🥉 高质量代码分析
Qwen3-Coder-30B-A3B-Q4_K_M虽然:
≈16.3 tok/s但模型规模更大,可以作为:
复杂架构 复杂重构 代码 Review 困难问题的备用模型。
12. 最终推荐
针对:
RTX 5080 16GB Ryzen 7 9800X3D Windows 11 llama.cpp OpenCode目前推荐:
┌─────────────────────┐ │ OpenCode │ └──────────┬──────────┘ │ ┌──────────▼──────────┐ │ Qwen3-14B-Q4_K_M │ └──────────┬──────────┘ │ ┌──────────▼──────────┐ │ 16K Context │ │ -ngl 999 │ │ -fa on │ └──────────┬──────────┘ │ ┌──────────▼──────────┐ │ ~84.5 tok/s │ │ ~12.7GB VRAM │ └─────────────────────┘推荐等级
Qwen3-14B-Q4_K_M:★★★★★
目前它是你这张RTX 5080 16GB上测试出来的最佳速度 / 显存 / Coding / Context综合平衡点。