Win11 + RTX 5080 本地 Coding 模型测试笔记(已弃坑)
2026/8/15 1:55:39 网站建设 项目流程

Win11 + RTX 5080 本地 Coding 模型测试笔记

测试环境:Windows 11 + NVIDIA GeForce RTX 5080 16GB + AMD Ryzen 7 9800X3D + llama.cpp
主要目标:寻找适合OpenCode 本地编程的模型及最佳量化/Context 配置。


先看结果 (还是留着买5080的钱去订阅吧)

排名模型量化ContextPromptGenerationVRAM
🥇Qwen3-14BQ4_K_M16K1247.184.512.68GB
🥇Qwen3-14BQ4_K_M32K1170.885.815.12GB
🥈Qwen3-14BQ4_K_M4K715.183.510.75GB
🥉Qwen3-14BQ8_08K363.827.815.95GB
4Qwen3-Coder-30B-A3BQ4_K_M8K120.516.3~15.7GB
5GLM-4.7-FlashQ4_K82.212.4

不同测试的 prompt、Context 和运行状态并不完全一致,因此表格主要用于实际体验和硬件适配参考,不能视为严格的模型 benchmark。

1. 测试环境

硬件

项目配置
CPUAMD Ryzen 7 9800X3D
CPU 核心8 核 / 16 线程
GPUNVIDIA GeForce RTX 5080
GPU 显存16303 MiB ≈ 16GB
NVIDIA Driver610.52
CUDA13.3
系统Windows 11
llama.cppb10375 / build 10417 等测试版本
GPU BackendCUDA
Flash Attention-fa on

llama.cpp 目录

D:\AI\llama-cuda

模型目录

D:\AI\models

2. 测试参数说明

本次主要使用:

-ngl 999

含义:

尽可能将模型层全部卸载到 GPU。


-c 8192

Context Window:

8192 tokens = 8K

测试过程中还使用:

16384 = 16K 32768 = 32K

-fa on

开启 Flash Attention。

当前 llama.cpp 版本要求明确指定:

-fa on

不能写成单独的:

-fa

否则会被解析成:

--flash-attn '-p'

导致:

unknown value for --flash-attn: '-p'

3. Qwen3-Coder-30B-A3B-Q4_K_M

模型:

qwen3-coder-30b-a3b-instruct-q4_k_m.gguf

文件大小:

18,556,688,704 bytes ≈ 17.27 GiB

模型:

Qwen3-Coder-30B-A3B-Instruct Q4_K_M

测试参数

.\llama-cli.exe `-m"D:\AI\models\qwen3-coder-30b-a3b-instruct-q4_k_m.gguf"`-ngl 999 `-c 8192 `-fa on `-p"用 TypeScript 实现一个 LRU Cache,要求支持泛型、最大容量和 TTL。"

测试结果:

Prompt: 120.5 tok/s Generation: 16.3 tok/s VRAM: ≈ 15.7GB

评价

优点:

  • Coding 能力较强
  • 30B 级别模型
  • 复杂代码理解能力较好

缺点:

  • RTX 5080 16GB 显存压力非常大
  • Generation 只有约16 tok/s
  • OpenCode Agent 多轮工作时等待时间明显

结论

复杂架构 / 深度代码分析:★★★★☆ 日常 Coding:★★☆☆☆ 速度:★★☆☆☆ 显存效率:★★☆☆☆

4. GLM-4.7-Flash-Q4_K

测试模型:

GLM-4.7-Flash-Q4_K.gguf

注意:

本次使用的是Q4_K,不是Q4_K_M

测试结果:

Prompt: 82.2 tok/s Generation: 12.4 tok/s

评价

Generation:

12.4 tok/s

明显低于 Qwen3-14B-Q4_K_M:

84.5 tok/s

因此在当前硬件上的实际 Coding 体验并不理想。

结论

Coding:★★★☆☆ 速度:★☆☆☆☆ OpenCode:★★☆☆☆

5. Qwen3-14B-Q4_K_M

模型:

Qwen3-14B-Q4_K_M.gguf

这是目前测试中表现最好的模型。


5.1 4K Context

测试结果:

Prompt: 715.1 tok/s Generation: 83.5 tok/s VRAM: 10745 MiB

约:

10.75GB

结果

Generation = 83.5 tok/s

已经非常快。


6. Qwen3-14B-Q4_K_M / 16K

测试结果:

Prompt: 1247.1 tok/s Generation: 84.5 tok/s VRAM: 12679 MiB

显存:

12.68GB

剩余:

16303 - 12679 = 3624 MiB

约:

3.5GB

评价

这是目前最推荐的配置。

Qwen3-14B-Q4_K_M + 16K Context + Full GPU Offload + Flash Attention

速度:

≈84.5 tok/s

显存:

≈12.7GB

具有比较充足的显存余量。


7. Qwen3-14B-Q4_K_M / 32K

测试结果:

Prompt: 1170.8 tok/s Generation: 85.8 tok/s VRAM: 15115 MiB

显存:

15.12GB

剩余:

16303 - 15115 = 1188 MiB

约:

1.16GB

评价

非常值得注意:

16K: 84.5 tok/s 32K: 85.8 tok/s

Generation 基本没有下降。

但:

16K: 12.68GB 32K: 15.12GB

显存已经达到:

92.7%

因此:

日常 OpenCode

推荐:

16K

大型项目临时分析

可以:

32K

但不建议长期作为默认配置。


8. Qwen3-14B-Q8_0

模型:

Qwen3-14B-Q8_0.gguf

测试参数:

.\llama-cli.exe `-m"D:\AI\models\Qwen3-14B-Q8_0.gguf"`-ngl 999 `-c 8192 `-fa on `-p"用 TypeScript 实现一个高性能 LRU Cache,要求支持泛型、最大容量、TTL,并解释设计思路和时间复杂度。"

测试结果:

Prompt: 363.8 tok/s Generation: 27.8 tok/s VRAM: 15950 MiB

显存:

15.95GB

剩余:

16303 - 15950 = 353 MiB

仅约:

0.35GB

9. Q4_K_M vs Q8_0

这是本次最有价值的对比之一。

项目Q4_K_MQ8_0
模型Qwen3-14BQwen3-14B
Context8K~32K8K
Generation83~86 tok/s27.8 tok/s
VRAM10.7~15.1GB15.95GB
显存余量较充足仅353MB
OpenCode⭐⭐⭐⭐⭐⭐⭐⭐
综合推荐★★★★★★★★

Q8 的问题非常明显:

84.5 tok/s ↓ 27.8 tok/s

速度下降约:

67%

同时显存几乎完全占满。


10. 当前所有模型测试汇总

排名模型量化ContextPromptGenerationVRAM
🥇Qwen3-14BQ4_K_M16K1247.184.512.68GB
🥇Qwen3-14BQ4_K_M32K1170.885.815.12GB
🥈Qwen3-14BQ4_K_M4K715.183.510.75GB
🥉Qwen3-14BQ8_08K363.827.815.95GB
4Qwen3-Coder-30B-A3BQ4_K_M8K120.516.3~15.7GB
5GLM-4.7-FlashQ4_K82.212.4

不同测试的 prompt、Context 和运行状态并不完全一致,因此表格主要用于实际体验和硬件适配参考,不能视为严格的模型 benchmark。


11. 当前最佳配置

🥇 日常 OpenCode

模型: Qwen3-14B-Q4_K_M.gguf 参数: -ngl 999 -c 16384 -fa on

实际测试:

Generation: 84.5 tok/s VRAM: 12679 MiB / 16303 MiB

这是目前最推荐的配置。


🥈 大型项目

Qwen3-14B-Q4_K_M -ngl 999 -c 32768 -fa on

实测:

85.8 tok/s 15115 / 16303 MiB

适合临时进行:

  • 大型代码库分析
  • 多文件重构
  • 架构分析
  • 大量代码上下文

但是不建议长期默认使用。


🥉 高质量代码分析

Qwen3-Coder-30B-A3B-Q4_K_M

虽然:

≈16.3 tok/s

但模型规模更大,可以作为:

复杂架构 复杂重构 代码 Review 困难问题

的备用模型。


12. 最终推荐

针对:

RTX 5080 16GB Ryzen 7 9800X3D Windows 11 llama.cpp OpenCode

目前推荐:

┌─────────────────────┐ │ OpenCode │ └──────────┬──────────┘ │ ┌──────────▼──────────┐ │ Qwen3-14B-Q4_K_M │ └──────────┬──────────┘ │ ┌──────────▼──────────┐ │ 16K Context │ │ -ngl 999 │ │ -fa on │ └──────────┬──────────┘ │ ┌──────────▼──────────┐ │ ~84.5 tok/s │ │ ~12.7GB VRAM │ └─────────────────────┘

推荐等级

Qwen3-14B-Q4_K_M:★★★★★

目前它是你这张RTX 5080 16GB上测试出来的最佳速度 / 显存 / Coding / Context综合平衡点。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询