Sakura启动器怎么装:从零跑通本地AI翻译服务的完整指南
【免费下载链接】Sakura_Launcher_GUISakura模型启动器项目地址: https://gitcode.com/gh_mirrors/sa/Sakura_Launcher_GUI
手上有一批待译的英文技术文档,想在本地跑Sakura机翻?Sakura启动器(Sakura Launcher GUI)就是为这件事做的图形化工具:帮你下载模型、选对llama.cpp框架、启动本地翻译服务,并把这个服务共享给局域网里的其他机器。下面按实际操作顺序走一遍。
适用场景
Sakura启动器主要面向三类情况,各用几句话说清楚。
做机翻翻译工作时,传统做法要自己找模型下载地址、装依赖、背一串llama.cpp的命令行参数、处理驱动问题。用Sakura启动器,这些动作变成从列表里选模型、点下载、点启动。
局域网里有多人或多台机器需要翻译服务时,在显存较大的那台机器上启动服务并开启共享功能,其他机器不必重复部署,直接复用已上线的翻译槽位。
第一次接触本地大模型、不熟悉命令行的人,也可以从这里入手:下载模型、启动服务、调整参数全部在界面上完成,不用记环境变量和参数顺序。
快速上手
从克隆到启动只需要四行命令,前置条件只有 Python 3.x(官方推荐 3.12):
git clone https://gitcode.com/gh_mirrors/sa/Sakura_Launcher_GUI cd Sakura_Launcher_GUI pip install -r requirements.txt python main.py启动后主流程三步:在"下载"页选模型下载 → 在"llama.cpp"页下载对应显卡的框架 → 回到"启动"页点击启动。服务默认监听127.0.0.1:8080,启动成功后,翻译工具里填入该地址即可调用。
核心功能
程序共五个页面(下载、llama.cpp、启动、共享、设置),前四个与日常使用直接相关。
📦 模型下载
下载页内置六个 Sakura 模型,均为 Qwen 底座、IQ4_XS 或 Q4_K_M 量化。7B 系列要求 8G 显存起,14B 系列要求 10G 起,文件下载后会做 SHA256 校验;下载源同时提供 HuggingFace 与 hf-mirror 两个地址。
选择要点:
- 8G 显存选 7B,10G 以上再考虑 14B
- 同规格模型按量化版本(IQ4_XS / Q4_K_M)在体积与质量之间取舍
- 模型清单由 data.json 驱动,程序启动时会尝试拉取远端更新
llama.cpp 框架按显卡选
llama.cpp 版本必须和显卡匹配,下载页已备好现成安装包:CUDA(NVIDIA 独显)、HIP(大部分 AMD 独显)、Apple M 系列、Vulkan(其他显卡兜底,官方标注不推荐);AMD 核显有单独的 ROCm 包,同样标注不推荐。
服务启动
启动页负责选模型、选显卡、调参数。首次使用建议选完模型后直接点"自动配置",程序会按模型规格和你的显存算出上下文长度与线程数;进阶选项包括 Flash Attention、--no-mmap、自定义命令模板,以及一键性能测试(自动运行 llama-batched-bench 并展示 S_TG 结果)。
模型共享
共享页可以把本地启动的服务挂上共享网络:上线后刷新在线槽位数量,查看本地请求统计数据。共享的 API(src/sakura_share_api.py)与 GUI 完全解耦,另附带一个 CLI 工具,可以脱离界面单独使用。
参数配置速查
下表收拢了启动页最常碰的几个参数,默认值均为程序内置值:
| 参数 | 作用 | 默认值 | 按显存的建议值 |
|---|---|---|---|
| 上下文长度 (-c) | 模型单次可处理文本的长度上限 | 2048 | 8G 用 2048–4096 足够;16G 以上可试 8192 |
| 并行线程 (-np) | 并行翻译任务数,上下文会被线程均分 | 1 | 7B:8G 给 2 / 10G 给 4 / 16G 给 16;14B:10G 给 4 |
| GPU层数 (-ngl) | 放到 GPU 上计算的模型层数 | 200(全部上卡) | 显存充裕保持 200,出现 OOM 时下调 |
| 主机端口 | 本地服务监听地址 | 127.0.0.1:8080 | 端口被占用时改端口,需局域网访问时改 host |
另外两条来自官方手册的硬性要求:GalTransl 这类批量翻译工具,每线程上下文不应小于 1536;LunaTranslator 这类即时翻译工具不应小于 512。程序会把每个线程的实际上下文显示在界面上,不足时会提示。
避坑与调优
以下几条是实际使用中最高频的问题,按"问题→原因→做法"列出:
- 模型下载失败或中断:多为网络波动。清理已下载的失败文件后重新下载;或手动下载模型文件,再在设置页"模型搜索路径"中指定存放目录。
- AMD 显卡错误启动到核显:7000 系 AMD 平台容易识别错。在自定义命令填
HIP_VISIBLE_DEVICES=x %cmd%(x 依次试 0、1)指定独显;N 卡多卡场景用CUDA_VISIBLE_DEVICES=a,b %cmd%同理。 - 显存溢出或启动失败:通常是上下文或线程数开得过高。先跑一次"自动配置"拿到基准值,再手动下调 -np 和 -c 逐项排查。
- 线程加上去速度反而变慢:线程会均分上下文,单线程上下文低于 1536 时质量和速度都会受损,注意看 UI 显示的每线程上下文。
- GPU 层数不知道设多少:保持默认 200。它是层数而不是百分比,显存不够时再往下调。
进阶
想改代码或做二次开发,关键模块如下:
src/ ├── section_download.py # 模型与 llama.cpp 下载页 ├── section_run_server.py # 服务启动、GPU选择、性能测试 ├── section_share.py # 模型共享 ├── sakura.py # 模型清单与显存推荐计算 └── llamacpp.py # llama.cpp 版本与下载管理启动出来的服务是标准 llama-server,对外提供 OpenAI 兼容 API,基础地址http://127.0.0.1:8080,各类翻译工具填入地址即可调用。要改参数逻辑或新增功能,从 section_run_server.py 和 setting.py 入手即可。
写在最后
更完整的参数说明和故障排查,见仓库根目录的《Sakura Launcher GUI 用户手册.md》。Sakura启动器的定位是命令行与使用者之间的一层翻译:把模型与框架的下载、显存适配、多机共享都放到界面上,让翻译工作本身重新成为重点。
【免费下载链接】Sakura_Launcher_GUISakura模型启动器项目地址: https://gitcode.com/gh_mirrors/sa/Sakura_Launcher_GUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考