Qwen3 本地部署教程:Ollama 30 秒跑通,llama.cpp 深挖性能
2026/9/4 9:46:30 网站建设 项目流程

Qwen3 本地部署教程:Ollama 30 秒跑通,llama.cpp 深挖性能

【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5

公司内网的机器连不上外网,但你想在本地跑一个能读代码、能写注释的模型,数据又不能丢给云端 API。Qwen3 本地部署解决的就是这个问题:把模型拉到自己机器上,推理全程离线,几条命令就能看到第一条回复。

⏱️ 先 30 秒跑通

下面两条命令:第一条装 Ollama(一个专门在本地跑大模型的工具),第二条拉取 Qwen3 并直接开聊。

curl -fsSL https://ollama.ai/install.sh | sh ollama run qwen3

屏幕先滚过模型下载进度,出现>>>提示符就是就绪了,你输入问题、它逐字回你。Windows 和 macOS 装好官方客户端后,同样用ollama run qwen3

这是接上本地聊天界面后的样子:左边会话列表,右边模型回复带代码块,到这里 Qwen3 本地部署就算走通了。

环境门槛一张表说清

项目最低线舒服线
系统macOS 10.15+ / Ubuntu 18.04+ / Windows 10+同上
内存8GB16GB 以上
磁盘10GB(模型文件)20GB
GPU可选NVIDIA 或 Apple Silicon
依赖Ollama,或 C++ 编译器 + cmake同上

只有 CPU 就选小尺寸加量化版本;16GB 内存跑 8B 量化版基本无压力。

用 Ollama 部署的完整主线

30 秒那节只给了最短路径,这一节把主线走完,每步按"敲什么 → 屏幕上出现什么 → 卡住怎么办"来说。

第 1 步:选尺寸跑起来。

ollama run qwen3:8b

出现pulling manifestsuccess,就进了>>>对话界面。内存紧张选 4b 起步,想要更强选 14b 或 32b。下载卡住:先查网络,或换个网络环境再试,仓库里的 Ollama 文档 讲了更多尺寸选项。

第 2 步:打开本地 API。

Ollama 默认监听http://localhost:11434,这条命令发一个生成请求:

curl http://localhost:11434/api/generate -d '{"model":"qwen3","prompt":"用一句话打个招呼"}'

返回 JSON 文本回复。把你现有程序里调云 API 的 base_url 指过来,二次接入就完成了。报 connection refused 说明服务没起,先跑ollama serve

用 llama.cpp 压榨性能

如果你的目标是榨干单机吞吐,或者想逐条控制上下文和采样参数,换 llama.cpp。

拿程序。macOS 一条命令装好预编译二进制:

brew install llama.cpp

Linux 没有 Homebrew 就搞到源码后本地编译,两条命令,第二条按 8 路并行加速:

cmake -B build cmake --build build --config Release -j 8

编译产物在build/bin/。报cmake: command not found就先装构建工具:macOS 跑xcode-select --install,Ubuntu 跑sudo apt install build-essential

命令行对话。这条命令会自动下载 8B 的 Q8_0 量化 GGUF 并进入聊天模式:

llama-cli -hf Qwen/Qwen3-8B-GGUF:Q8_0 --jinja -ngl 99 -fa

-ngl 99把全部层丢到 GPU 上算;纯 CPU 机器去掉它,用-t 8指定线程数。生成慢、还反复输出,多半是模型超出内存,换小尺寸或更低量化。

起 API 服务。

llama-server -hf Qwen/Qwen3-8B-GGUF:Q8_0 --jinja -ngl 99

浏览器开http://localhost:8080/有网页聊天界面,OpenAI 兼容接口在http://localhost:8080/v1/。不想要模型"思考"、只想要直接答案,用--chat-template-file传一个非思考模板,仓库里就有一份现成的:docs/source/assets/qwen3_nonthinking.jinja。参数细节看仓库里的 llama.cpp 文档。

选 Ollama 还是 llama.cpp

更在意 5 分钟跑通、有图形界面、基本不用调参,就选 Ollama。更在意单机吞吐、想完整控制上下文长度和采样参数,就选 llama.cpp。Mac 上又不想碰编译,brew install llama.cpp是折中。两者共用 GGUF 模型生态,模型文件互相通用,以后切换没有成本。

🧩 避坑笔记

  1. 加载时直接 OOM 崩掉→ 模型尺寸超出内存 → 换更小尺寸或 q4_k_m 量化版本。
  2. 生成速度个位数 tok/s→ 层全压在 CPU 上 → 用带 GPU 支持的构建并加-ngl 99,同时把-c上下文调小到 8192。
  3. 输出开始复读、停不下来→ 采样参数没设 → 加--presence-penalty 1.5,temperature 收到 0.7。
  4. llama-server 起了但页面打不开→ 只听 localhost 或端口被占 → 用--host--port改监听,或先杀掉旧进程。

下一步清单

  • 今天跑一遍ollama run qwen3,完成一轮真实对话,记下下载耗时
  • 生成速度慢的话切 llama.cpp,把 GPU 层拉满-ngl 99再测一次
  • 挑一个现有程序,把 API 地址指到llama-server/v1/,完成接入

【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询