Eigent 本地模型部署:vLLM、Ollama、LM Studio 三条路线怎么走
【免费下载链接】eigentEigent: The Open Source Cowork Desktop - Local and Free Alternative to Claude Cowork and Codex项目地址: https://gitcode.com/GitHub_Trending/ei/eigent
Eigent 本地模型部署通过 OpenAI 兼容 API 把 Ollama、vLLM、LM Studio 等本地推理引擎接入 Eigent,让整个 AI 工作流在本机完成推理。本文讲清机制、选型与连接验证。
一、本地模型部署在 Eigent 里是怎么运作的?
机制很简单:本地推理引擎对外暴露一个 OpenAI 兼容的 API 端点(通常是.../v1),Eigent 在设置里填入这个端点 URL 和模型类型,之后所有请求都发往本机。
也就是说,Eigent 本身不关心你底层用的是哪套推理框架——只要它提供/v1/chat/completions这类标准接口,Eigent 就能像调用云端模型一样调用它。推理数据不离开你的机器。
二、选型:vLLM / Ollama / LM Studio 怎么选?
三个引擎的定位差异可以一张表看明白:
| 维度 | Ollama | vLLM | LM Studio |
|---|---|---|---|
| 适用场景 | 日常开发、快速试验 | 高吞吐、批量或多并发推理 | 不想碰命令行、图形化试用 |
| 上手难度 | 低,一条命令拉模型 | 中,需了解 GPU 显存与参数 | 最低,全程鼠标操作 |
| 性能取向 | 够用即可,CPU/单卡均可 | 追求吞吐和延迟,显存利用率高 | 跟随本地硬件,无性能调优空间 |
如果还看到 SGLang,它是另一类面向大规模服务的推理框架,Eigent 同样支持,默认端点为http://localhost:30000/v1,本文不展开。Eigent 里还预置了 LLaMA.cpp(http://localhost:8080/v1),配置方式相同。
三、5 分钟跑通:用 Ollama 接入第一个本地模型
Ollama 是路径最短的起点,装好后只需一条命令拉取模型:
ollama pull qwen2.5:7b拉取完成后,Ollama 服务默认监听http://localhost:11434。Eigent 的默认端点已预填为http://localhost:11434/v1。注意末尾的/v1:OpenAI 兼容 API 挂在这个路径下,如果你手填了裸地址http://localhost:11434,Eigent 会检测并在输入框失焦时自动补上/v1。
模型类型(model type)填qwen2.5:7b,与ollama list里显示的模型名一致,验证即可。
四、追求性能:用 vLLM 起一个高吞吐服务
当你需要同时跑多个智能体任务、批量生成,或者加载较大的开源模型时,vLLM 的 PagedAttention 与连续批处理能把显存利用率和吞吐拉满:
vllm serve Qwen/Qwen2.5-1.5B-Instruct服务起来后默认端点为http://localhost:8000/v1,模型类型填实际加载的模型名,例如Qwen/Qwen2.5-1.5B-Instruct。显存不足时可通过启动参数控制上下文长度,避免加载即 OOM。
五、不想敲命令:LM Studio 图形化接入
LM Studio 把"下载模型、本地推理、起服务"合并进一个界面:
- 在 LM Studio 中下载并打开一个 Chat 模型;
- 在 Developer 页启动本地服务器;
- 记下服务端口(默认 1234)。
Eigent 端预填端点为http://localhost:1234/v1,模型类型填 LM Studio 里显示的名称即可。
六、把三种引擎接进 Eigent:端点、模型类型与连接验证
三种引擎在 Eigent 里的配置入口完全一致,集中在设置页的「本地模型」区域,只是填的端点不同:
| 引擎 | 默认端点 URL | 模型类型示例 |
|---|---|---|
| Ollama | http://localhost:11434/v1 | qwen2.5:7b |
| vLLM | http://localhost:8000/v1 | Qwen/Qwen2.5-1.5B-Instruct |
| LM Studio | http://localhost:1234/v1 | 与 LM Studio 显示名一致 |
填写要点:
- 端点 URL:必须是 OpenAI 兼容路径,一般以
/v1结尾。本地引擎不需要 API Key,Eigent 会按"无需密钥"处理。 - 模型类型:与服务端实际加载的模型名严格一致,这是最常见的报错来源。
- 验证:点验证后,Eigent 会向后端发起一次真实调用检查模型可用性,并额外确认该模型支持 function calling——这是多智能体工作流的硬性要求。验证通过会弹出成功提示;不通过会显示服务端返回的具体错误信息。
- 设为默认:验证成功后可以把它设为默认工作模型。之后新建会话默认走本地推理,切回云端模型只需在模型选择处改回。
七、踩坑排查:连接失败、验证报错、性能不达预期怎么定位
| 现象 | 排查方向 |
|---|---|
| 验证时连接超时或被拒绝 | 确认推理服务进程在跑、端口未被占用;跨机器访问时检查防火墙是否放行 11434/8000/1234 端口 |
| 请求返回 404(Ollama) | 端点缺少/v1后缀;确认填的是http://localhost:11434/v1而不是裸地址 |
| 验证提示模型不支持 function calling | 换用 Instruct/Chat 版模型;纯基座模型或小型模型通常不具备工具调用能力 |
| 模型类型与端点都正确但仍报错 | 核对模型名拼写(区分大小写),并确认该模型已在服务端加载完成 |
| 生成速度慢于预期 | 换低参数或量化版本模型;检查 GPU 显存是否充足;vLLM 下调上下文长度 |
收尾
回顾这条主线:本地引擎负责推理,OpenAI 兼容 API 负责协议统一,Eigent 负责把端点、模型类型和验证收进同一套配置界面。无论换 Ollama、vLLM 还是 LM Studio,你改的只是端点地址。更多本地模型支持的默认端点与自动纠错逻辑,可以参考仓库里的 src/pages/Agents/localModels.ts 和 backend/app/controller/model_controller.py。
【免费下载链接】eigentEigent: The Open Source Cowork Desktop - Local and Free Alternative to Claude Cowork and Codex项目地址: https://gitcode.com/GitHub_Trending/ei/eigent
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考