如何 10 分钟上手 UI-TARS Desktop:用自然语言操控电脑的完整指南
2026/9/2 11:25:27 网站建设 项目流程

如何 10 分钟上手 UI-TARS Desktop:用自然语言操控电脑的完整指南

【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop

你是否还在重复"打开应用 → 找到设置入口 → 改参数 → 保存"这条固定路线?每次想让电脑干点活,都得自己挪动鼠标、点开菜单、逐项填写。UI-TARS Desktop 是一款开源的桌面应用,它把"用自然语言操控电脑"这件事做成了开箱即用的体验:你在输入框里打一句人话,它就截屏、看懂界面,然后替你点击、输入、滚动,直到任务完成。整个过程你不需要写任何脚本,也不用关心界面上哪个按钮叫什么 ID。

当鼠标也开始"上班"

想象一个普通的下午:你想给 VS Code 开自动保存并调成 500 毫秒延迟,又想在电商网站比较几款手机的价格,还想看看某个开源项目最新的 issue。这些事单独做都不难,但每一步都要你亲手完成——打开哪个窗口、点哪个菜单、在哪一格输入,全凭记忆。

UI-TARS Desktop 想接管的正是这部分重复劳动。它的核心思路很直白:不让电脑读代码结构,而是让一个视觉语言模型(VLM)"看"屏幕。

它是怎么替你干活的

一句话版本:你说话,它看屏,它动手。

每一轮任务里,程序会截一张当前屏幕的图,连同你的指令一起交给 UI-TARS-1.5 这类视觉语言模型;模型返回下一步动作(比如"在坐标 (27, 496) 处点击"或"输入一段文字"),程序执行这个动作,再截屏、再决策,循环往复,直到模型判断任务结束。因为它是"看图办事",所以不依赖页面源码或控件树,桌面应用和网页对它来说是同一种输入——一张图。

这个设计带来两个实际好处:一是桌面软件和浏览器共用一套操作逻辑;二是你在界面里能实时看到它每一步的截图和推理,任务失败时很容易看出它卡在哪一步。

最快上手路径:4 步跑起来

第 1 步:下载安装

macOS 用户如果装了 Homebrew,一行命令即可:

brew install --cask ui-tars

否则从 releases 页下载后,把UI TARS拖进"应用程序"文件夹就行。Windows 用户双击安装包按向导走完即可。

第 2 步:macOS 用户打开两个权限

应用要替你动鼠标、读屏幕,系统会先拦一下。进入"系统设置 → 隐私与安全性",分别给 UI TARS 开启:

  • 辅助功能(Accessibility)
  • 屏幕录制(Screen Recording)

第 3 步:配置模型(全程唯一"硬核"的部分)

应用本身不带模型,需要指向一个 UI-TARS-1.5 的推理端点。国际网络用户可以走 Hugging Face 托管:在端点目录里找到 UI-TARS-1.5-7B,点右上角的Deploy from Hugging Face,按部署指引拿到Base URL、API Key、模型名称三样东西。

然后打开应用左下角的 Settings → VLM Settings,填入四项:

VLM Provider: Hugging Face for UI-TARS-1.5 VLM Base URL: https://your-endpoint/v1/ VLM API KEY: your_api_key VLM Model Name: your_model_name

两个容易踩的坑先说在前面:VLM Provider 必须选和模型对应的那一项(这里是 Hugging Face for UI-TARS-1.5),它决定动作解析方式;Base URL 要以/v1/结尾。国内网络用户可以直接用火山引擎 Ark 上的 Doubao-1.5-UI-TARS,Provider 选VolcEngine Ark for Doubao-1.5-UI-TARS即可,具体参数对照 docs/quick-start.md 里的火山引擎小节。

第 4 步:选一个模式,发出第一条指令

启动应用后你会看到两块卡片:Computer Operator(操作本机)和 Browser Operator(操作浏览器)。点击Use Local ComputerUse Local Browser进入对应会话,在下方的输入框里敲一句指令,回车,任务就开始了。

用浏览器模式前,确保机器上装了 Chrome、Edge 或 Firefox 之一。

3 个真实用例:你下什么指令,它做什么

用例一:改桌面软件设置

"请帮我在 VS Code 设置中打开自动保存功能,并把 AutoSave 延迟设为 500 毫秒。"

它会打开 VS Code,进入设置页,搜到 auto save 相关选项,把触发方式改成延迟保存并填上 500,最后确认改完。全程你只做一件事:看它操作。

用例二:查项目的最新 issue

"帮我看看 UI-TARS-Desktop 项目在 GitHub 上最新的 open issue 是什么?"

它会自己打开浏览器、访问 GitHub、定位到仓库的 Issues 列表,按排序找到最新一条,并把标题和摘要反馈给你。这是官方 README 里的演示任务之一,适合作为你的第一个验收标准。

用例三:跨站比价

"帮我比较一下 iPhone 的售价。"

走 Browser Operator 模式,它会在浏览器里打开搜索引擎和电商页,来回切换记录不同渠道的价格,最后汇总给你。比价、查天气、填表单这类"多页面来回跳"的活,正是浏览器模式的用武之地。

云端浏览器试用:不想动本机时的快捷方式

界面里还提供 Remote Computer / Remote Browser 入口,选进去后你会看到右上角"30 分钟免费额度"的倒计时,云端浏览器跑起来后,你可以用鼠标随时接管那个标签页。需要说明的是,官方免费试用服务已于 2025 年 8 月 20 日下线,界面上的入口可能还在,但日常使用建议以本地操作器为主。

踩坑速查:任务跑不动时依次检查这 7 项

  1. 点了没反应 / 鼠标不动:回到第 2 步,确认辅助功能和屏幕录制权限都已勾选,改完权限后重启应用。
  2. 点 "Check Model Availability" 失败:依次核对 Base URL 是否以/v1/结尾、API Key 是否过期、模型名称是否与端点页显示的一致。
  3. 能跑但点歪、动作解析错乱:十有八九是 VLM Provider 选错了。Provider 与模型必须配对,1.5 模型就选Hugging Face for UI-TARS-1.5,火山引擎的 Doubao 模型就选对应 Ark 选项。
  4. 多显示器环境任务失败:目前只支持单显示器,先断开副屏再跑。
  5. 浏览器模式起不来:检查是否安装了 Chrome、Edge 或 Firefox。
  6. 任务做到一半停了:每轮对话有最大步数上限(Max Loop,默认 100,范围 25–200)。任务太大就拆成小步分几次下;页面加载慢的话可以调大 Loop Wait Time(默认 1000 毫秒),让它截图前多等一会儿。
  7. 想继续调参:完整的字段说明(VLM、Chat、Operator、Report 四组)都在 docs/setting.md。

进阶玩法与开发者入口

预设一键切换环境。UI-TARS Desktop 支持把一组设置打包成 YAML 预设,从本地文件导入,或从 URL 导入(URL 预设每次启动应用时自动拉取更新)。团队里多人共用同一套模型配置时特别顺手,示例可以看 examples/presets/default.yaml,规则详见 docs/preset.md。

任务报告可导出可分享。每轮任务结束后,点界面上的导出按钮即可把执行报告存成本地 HTML 文件;如果你配置了报告存储服务,还能直接上传拿到一个可分享的链接。数据流向可以用下图的 UTIO(UI-TARS Insights and Observation)机制理解。

SDK 把整套 Agent 逻辑搬进你的代码。仓库里自带跨平台的@ui-tars/sdk(位于 packages/ui-tars/sdk/),一条命令先在命令行体验:

npx @ui-tars/cli start

在代码里,你只需要组合"模型 + 操作器":内置操作器覆盖桌面(nut-js)、浏览器、ADB 手机、远程浏览器等场景,目录见 packages/ui-tars/operators/。想接自己的设备也很直接——自定义操作器只需实现screenshot()(截屏)和execute()(执行模型预测的动作)两个方法,再声明自己的动作空间。完整 API 参考见 docs/sdk.md。

另外,同一个仓库还维护着 Agent TARS 命令行工具(npx @agent-tars/cli@latest即可运行),面向终端、Web UI 和无界面服务端场景,如果你想把 GUI Agent 能力嵌进自己的产品,可以顺着 multimodal/ 目录继续看。

今天就动手:两件 5 分钟的小事

  1. 打开应用,选本地计算机模式,输入"打开记事本,写今天日期然后保存",看它完整走完一遍——这是验证权限、模型、执行链路全通的最短任务。
  2. 跑完点 "New Chat" 换个任务试试,再把上一轮任务导出成 HTML 报告,看看它每一步的截图和推理记录。

跑通之后,剩下的只是把日常里最烦的那件重复操作丢给它。更多细节可以回 docs/quick-start.md 对照检查,遇到权限或模型配置问题,按上面的"踩坑速查"顺序排一遍,基本都能定位到原因。

【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询