Windows下载、安装llama.cpp-b10068(附安装包llama-b10068-bin-win-cuda-12.4-x64.zip)
2026/7/25 18:45:24 网站建设 项目流程

文章目录

    • 1. llama.cpp 简介
    • 2. b10068 版本亮点
    • 3. 获取安装包
    • 4. 快速开始

1. llama.cpp 简介

llama.cpp 是使用纯 C/C++ 实现的大语言模型(LLM)推理引擎,由保加利亚软件工程师 Georgi Gerganov 于 2023 年 3 月创建。最初是作为一个周末项目,目标是在 MacBook 上运行 Meta 的 LLaMA 模型,无需 Python、PyTorch 或 CUDA 依赖。如今,它已成为全球最受欢迎的本地 LLM 推理框架之一,截至 2026 年中,GitHub Stars 突破 11.7 万,拥有超过 700 位贡献者和近 2 万个 fork。

2026 年 2 月,Gerganov 与核心团队成员(Xuan-Son Nguyen、Aleksander Grygier)加入 Hugging Face 成为全职员工,llama.cpp 仓库也从ggerganov/llama.cpp迁移至ggml-org/llama.cpp,但项目始终保持 100% 开源(MIT 许可证)和完全的技术自主权。llama.cpp 是 Ollama、LM Studio、GPT4All、LocalAI 等数十个知名本地 AI 工具的底层推理引擎,生态影响力极其广泛。

llama.cpp 的核心目标是以最低的设置成本在各种硬件上实现最先进的 LLM 推理性能——无论是在本地还是在云端。其核心特色包括:

  • 零依赖:纯 C/C++ 实现,无需 Python、PyTorch 等环境,下载即可运行
  • 广泛硬件支持:Apple Silicon(ARM NEON、Accelerate、Metal)、NVIDIA GPU(CUDA)、AMD GPU(HIP)、Intel GPU(SYCL、OpenVINO)、Vulkan、WebGPU 等
  • 灵活量化:支持 1.5 位至 8 位整数量化,显著降低内存占用和提升推理速度
  • CPU+GPU 混合推理:支持超出显存容量的大模型部分加速
  • OpenAI API 兼容服务:通过llama-server一键启动与 OpenAI API 兼容的 HTTP 服务
  • 庞大模型生态:支持 LLaMA、Mistral、Qwen、Deepseek、Gemma、Phi 等近百种模型架构的 GGUF 格式

2. b10068 版本亮点

llama.cpp 采用持续构建(build number)版本号体系,b10068 发布于 2026-07-18,主要包含以下更新:

  • DFlash 注入 K/V 缓存旋转:修复了在使用 K/V 量化时,DFlash 注意力机制中注入的 K/V 缓存需要旋转的问题,提升了量化场景下的推理正确性。

本整合包选用llama-b10068-bin-win-cuda-12.4-x64.zip,适用于 Windows x64 系统,使用 NVIDIA CUDA 12.4 后端进行 GPU 加速推理。

环境要求:需安装 NVIDIA CUDA Toolkit 12.4 或更新版本,并配备支持 CUDA 的 NVIDIA 显卡(计算能力 ≥ 5.0,推荐 GTX 10 系列及以上)。若未安装 CUDA 或使用非 NVIDIA 显卡,请改用 CPU 版本或 Vulkan 版本。

3. 获取安装包

如果访问 GitHub 不便,安装包及中文文档:https://hanshuixin.org/go/223T(内含 llama-b10068-bin-win-cuda-12.4-x64.zip、README 中英对照、发布说明中英对照和 LICENSE)。

Windows安装llama.cpp-b10068(llama-b10068-bin-win-cuda-12.4-x64).zip ├── llama-b10068-bin-win-cuda-12.4-x64.zip ← 官方预编译包(解压后为各工具 .exe) ├── Windows安装llama.cpp-b10068(llama-b10068-bin-win-cuda-12.4-x64).pdf ├── README/ │ ├── README.md │ └── README-中文版.md ├── 发布说明/ │ ├── RELEASE-NOTES.md │ └── RELEASE-NOTES-中文版.md └── LICENSE

适用显卡:本整合包内为 CUDA 版本,仅适用于NVIDIA 显卡(GTX 10 系列及以上,计算能力 ≥ 5.0)。若您使用AMD 显卡,请选用 HIP(Radeon)版本;若使用Intel 显卡,请选用 SYCL 或 OpenVINO 版本;若无独立显卡或使用其他品牌,请选用 CPU 或 Vulkan 版本。

4. 快速开始

将整合包根目录中的llama-b10068-bin-win-cuda-12.4-x64.zip解压到任意目录,即可得到以下命令行工具:

工具用途
llama-cli.exe命令行对话推理
llama-server.exeOpenAI API 兼容 HTTP 服务
llama-perplexity.exe模型困惑度评测
llama-bench.exe推理性能基准测试
llama-simple.exe最小推理示例

解压后,打开命令提示符(cmd)或 PowerShell,进入解压目录,执行以下常用命令:

# 使用本地 GGUF 模型文件进行对话llama-cli-mmy_model.gguf# 直接从 Hugging Face 下载并运行模型llama-cli-hfggml-org/gemma-3-1b-it-GGUF# 启动 OpenAI 兼容 API 服务(默认端口 8080)llama-server-mmy_model.gguf--port8080# 启动服务并支持多用户并行请求llama-server-mmy_model.gguf-c16384-np4# 使用推测解码加速推理llama-server-mmodel.gguf-mddraft.gguf# 运行性能基准测试llama-bench-mmy_model.gguf# 使用自定义语法约束 JSON 输出llama-cli-mmy_model.gguf-n256--grammar-file grammars/json.gbnf

提示:模型文件(.gguf 格式)可从 Hugging Face GGUF 模型库 获取。也可通过-hf参数直接从 Hugging Face 下载。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询