Mobile-Agent GUI 智能体家族全景指南:从单机手机助手到多平台基础 GUI 智能体的技术演进与实战部署
2026/9/16 15:27:36 网站建设 项目流程

Mobile-Agent GUI 智能体家族全景指南:从单机手机助手到多平台基础 GUI 智能体的技术演进与实战部署

【免费下载链接】MobileAgentMobile-Agent: The Powerful GUI Agent Family项目地址: https://gitcode.com/GitHub_Trending/mo/MobileAgent

Mobile-Agent 是通义实验室(Tongyi Lab,阿里巴巴集团)开源的 GUI 智能体家族,覆盖手机、PC、浏览器等多端 GUI 自动化场景。本篇技术指南以仓库根目录 README.md 为骨架,结合 Mobile-Agent-v1、Mobile-Agent-v2、Mobile-Agent-v3、Mobile-Agent-v3.5、Mobile-Agent-E、PC-Agent、GUI-Critic-R1、UI-S1 等系列工作的文档与源码,完整梳理家族演进脉络、核心能力、评测表现与真实设备部署方法。读完你将掌握:如何为 Android 手机、PC 桌面、浏览器配置并运行 Mobile-Agent,如何理解 GUI-Owl 系列模型的定位与坐标输出约定,以及如何在自己的研究中引用这套开源体系。

项目定位:一套覆盖手机 / PC / 浏览器的 GUI 智能体家族

Mobile-Agent 并非单一模型或单一框架,而是一个持续演进的GUI 智能体家族(GUI Agent Family),由阿里巴巴通义实验室(Tongyi Lab, Alibaba Group)开源维护。家族以"纯视觉感知 + 自主操作"为核心设计哲学:智能体通过截图理解界面状态,直接输出点击、滑动、输入等操作指令,从而完成跨 App、跨平台的自动化任务。

从根目录 README 的架构总览(见 assets/framework.png)可以直观看到,家族的技术栈自底向上分为三层:

  1. 基础模型层:从早期的 GPT-4V / Qwen-VL 等通用多模态大模型调用,演进到自研的 GUI 原生基础模型GUI-OwlGUI-Owl-1.5(基于 Qwen3-VL 构建);
  2. 智能体框架层:在模型之上封装规划、执行、记忆、反思、错误诊断等多智能体协作能力,形成 Mobile-Agent-v3 / v3.5 等跨平台框架;
  3. 评测与训练层:配套 OSWorld、AndroidWorld、ScreenSpot 等公开基准评测,以及 UI-S1 半在线强化学习、GUI-Critic-R1 事前错误诊断等训练与质量保障工作。

整个家族在 README_zh.md 中被定位为"强大的 GUI 智能体家族",其 GitHub 仓库地址为https://github.com/X-PLUG/MobileAgent(当前镜像仓库即为其本地副本),可通过git clone获取。

系列工作图谱:八个子项目的演进脉络

根目录 README 的"Series of Work"章节按时间线列出了家族的全部核心工作,本仓库中每个子项目均保留了完整独立的代码与文档。下面按演进顺序逐一展开。

Mobile-Agent-v1:单智能体纯视觉手机操作(ICLR 2024 Workshop)

v1 项目文档 是家族的起点,对应论文Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception(arXiv:2401.16158)。其核心特性包括:

  • 纯视觉方案:完全依赖视觉感知,不依赖 XML 与系统元数据;
  • 操作范围不受限:支持跨 App 的多应用连续操作;
  • 多视觉感知工具:通过 icon 定位、文本定位等模块完成操作坐标定位;
  • 即插即用:无需探索与训练,开箱即用。

仓库中保留了完整的实现代码(Mobile-Agent-v1/MobileAgent 目录下的api.pycontroller.pyicon_localization.pytext_localization.pyprompt.py等模块),以及基于免费多模态模型 Qwen-vl-max 的 Mobile-Agent-qwen 版本。

v1 时代的运行方式分为两种:

# 方式一:使用在线 API(无需自己的 OpenAI Key) python run_api.py --adb_path /path/to/adb --url "The url you got" --token "The token you got" --instruction "your instruction" # 方式二:使用自己的 API Key(需有权访问 gpt-4-vision-preview) python run.py --grounding_ckpt /path/to/GroundingDION --adb_path /path/to/adb --api "your API_TOKEN" --instruction "your instruction"

v1 还配套发布了Mobile-Eval基准,包含 10 个主流单 App 场景与 1 个多 App 场景,每个场景设计 3 档难度的指令(基础任务、叠加附加要求、无明确任务指示的用户需求),用于评估手机端智能体的真实操作能力。

Mobile-Agent-v2:多智能体协作解决长上下文导航(NeurIPS 2024)

v2 项目文档 针对单智能体在长对话上下文中导航能力衰减的问题,提出了多智能体协作架构:由不同的子智能体分别承担感知与操作职责,配合增强的视觉感知模块显著提升操作精度,并在 GPT-4o 的支持下兼顾性能与速度。

v2 的运行方式在 run.py 中进行配置(约第 22 行起为 "Edit your Setting" 配置区,可填写 ADB 路径、指令、GPT-4 API URL 与 Token),并支持两种 icon caption 模型调用方式:

  • local 模式:在本机部署 icon caption 模型,适合配备高性能 GPU 的设备,效率更高;
  • api 模式:通过 API 并行调用,适合无法本地运行 7B 级模型的设备。

Mobile-Agent-E:自进化式复杂任务手机助手(Preprint)

Mobile-Agent-E 文档 对应论文Self-Evolving Mobile Assistant for Complex Tasks(arXiv:2501.11733),由 UIUC 与阿里巴巴合作完成。其核心思路是通过经验库与反思机制让智能体在执行复杂任务时不断积累可复用的操作经验。仓库提供了 Mobile-Eval-E 数据集(data/Mobile-Eval-E 下的 5 个场景 JSON 文件)与scripts/run_task.shrun_tasks_evolution.sh等运行脚本,官方注明所有实验在 Samsung Galaxy A15 上完成,并鼓励用户针对自己的设备与任务自定义初始提示(custom tips,示例见 custom_tips_example_for_cn_apps.txt)。

PC-Agent:PC 端层次化多智能体协作框架(ICLR 2025 Workshop)

PC-Agent 文档 将家族能力拓展到 PC 平台,支持 Chrome、Word、微信等生产力场景的自动化控制。其技术要点是:

  • 面向 PC 平台密集多样的可交互元素设计主动感知模块;
  • 采用层次化多智能体协作结构提升复杂任务序列的成功率。

仓库同时支持 Windows 与 Mac(安装依赖分别为 requirements.txt 与 requirements_mac.txt),并提供两套实现:PCAgent(当前版本)与 PCAgent_v1(含 Chrome 下载论文、搜索 NBA FMVP 并发给好友、在 Word 中撰写阿里简介等演示视频)。配置通过 config.json 完成,可设置vl_model_namellm_model_nametokenurl等 API 参数。

GUI-Critic-R1:执行前的 GUI 错误诊断(NeurIPS 2025)

GUI-Critic-R1 文档 对应论文Look Before You Leap: A GUI-Critic-R1 Model for Pre-Operative Error Diagnosis in GUI Automation(arXiv:2506.04614)。其出发点非常务实:GUI 自动化是在线交互式任务,每步决策容错率低,一次误操作可能造成删除、支付等不可逆后果。为此该工作提出:

  • 术前批评模型(pre-operative critic model):在实际执行前,推理当前动作的潜在后果与正确性并给出反馈;
  • S-GRPO 训练策略:在 GRPO 基础上引入 suggestion reward,提升反馈可靠性;
  • 基于推理引导的数据构建管线:产出 GUI-Critic-Train 与 GUI-Critic-Test 数据集。

仓库中的 test.py 为主评测脚本,statistic.py 提供评估函数与指标计算,测试数据位于 test_files(gui_i.jsonlgui_s.jsonlgui_web.jsonl分别对应 GUI-I、GUI-S、GUI-W 三个数据集)。

UI-S1:半在线强化学习推进 GUI 自动化(ACL 2026)

UI-S1 文档 对应论文Advancing GUI Automation via Semi-online Reinforcement Learning(arXiv:2509.11543),提出**半在线强化学习(Semi-online RL)**范式:用离线轨迹模拟在线强化学习,从而高效训练具备多轮交互能力的 MLLM 基 GUI 智能体。其 7B 模型在 AndroidWorld 在线评测与 SOP 半在线指标上均取得突出表现。仓库的安装与训练方式为:

conda create -n ui-s1 python=3.11 conda activate ui-s1 cd UI-S1 pip install -e . pip install vllm==0.8.2 pip install flash-attn==2.7.4.post1 --no-build-isolation

训练数据源自 AndroidControl(示例见 datasets/android_control_train_example.jsonl),训练框架深度定制了 verl(位于 UI-S1/verl),覆盖从模型加载(Qwen2.5-VL 等)、分布式训练到 vLLM / sglang 推理加速的全链路,同时附带多个现成训练脚本(如 run_qwen2_5_vl-7b.sh)。

Mobile-Agent-v3:基于 GUI-Owl 的跨平台多智能体框架

v3 项目文档 于 2025 年 8 月发布,同时开源了GUI-Owl模型系列(GUI-Owl-7B / 32B)与 Mobile-Agent-v3 框架本身。GUI-Owl 是跨平台 GUI VLM,具备 GUI 感知、接地(grounding)与端到端操作能力;Mobile-Agent-v3 则基于 GUI-Owl 提供规划、进度管理、反思与记忆能力,并可将模型实例化为框架中的多种专职智能体。

从 run_mobileagentv3.py 的源码结构看,v3 的移动端运行核心是一个多智能体协作循环

  • InfoPool:全局信息池,承载用户指令、附加知识与错误计数(err_to_manager_thresh=2,连续出错阈值触发返回管理器);
  • Manager / Executor / Notetaker / ActionReflector:分别承担任务规划、动作执行、要点记录、动作反思四个角色;
  • GUIOwlWrapper:封装 vLLM 服务的api_key / base_url / model调用;
  • 主循环默认max_step=25,每步截图(失败自动重试至多 5 次)、生成操作、执行并记录日志到logs/{时间戳}_{指令前缀}目录。

v3 的移动端运行命令(Android 与 HarmonyOS 二选一):

cd Mobile-Agent-v3/mobile_v3 # Android 使用 adb python run_mobileagentv3.py \ --adb_path "Your ADB path" \ --api_key "Your api key of vllm service" \ --base_url "Your base url of vllm service" \ --model "Your model name of vllm service" \ --instruction "The instruction you want Mobile-Agent-v3 to complete" \ --add_info "Some supplementary knowledge, can also be empty" # HarmonyOS 使用 hdc(将 --adb_path 换成 --hdc_path) python run_mobileagentv3.py --hdc_path "Your HDC path" ... (其余参数相同)

需要注意两个关键参数约定:

  • 坐标类型:若模型输出 0–1000 的相对坐标(如 Seed-VL、Qwen-VL-2 / Qwen-VL-3),需追加--coor_type "qwen-vl"将相对坐标映射到真实设备分辨率;若模型输出绝对坐标(如 Qwen-VL-2.5 或 GUI-Owl),则无需设置坐标映射;
  • 记忆开关:若指令需要记住中间内容,追加--notetaker True启用记录员智能体。

v3 同时开源了在 OSWorld(os_world_v3)、AndroidWorld(android_world_v3)以及真实移动场景(mobile_v3)上的评测代码,并提供run_guiowl.sh/run_ma3.sh一键评测脚本。此外还提供了 cookbook 形式的端到端使用示例(end2end_usage.ipynb)与 docker_setup 环境脚本。

Mobile-Agent-v3.5:GUI-Owl-1.5 多平台基础 GUI 智能体(Preprint)

v3.5 项目文档 是家族目前最新的重大发布,对应论文Multi-platform Fundamental GUI Agents(arXiv:2602.16855),核心成果是GUI-Owl-1.5原生多平台 GUI 智能体基础模型系列:

模型定位
GUI-Owl-1.5-2B/4B/8B-Instruct小尺寸指令模型,适合快速推理与边缘部署
GUI-Owl-1.5-8B/32B-Thinking推理型模型,面向需要规划与反思的复杂任务
GUI-Owl-1.5-32B/235B(家族全谱系)更大参数规模的指令与思考版本

GUI-Owl-1.5 建立在 Qwen3-VL 之上,通过**可扩展的混合数据飞轮、统一智能体能力增强、多平台环境强化学习(MRPO)**三项技术训练而成,关键能力包括:

  • 工具与 MCP 调用:原生支持外部工具调用与 MCP 服务器协同(对应 OSWorld-MCP 等评测);
  • 长时域记忆(long-horizon memory):内置记忆能力,无需外部工作流编排;
  • 多智能体就绪:既可作为独立端到端智能体,也可在 Mobile-Agent-v3.5 框架中充当 planner、executor、verifier、notetaker 等专职角色。

v3.5 的模型加载可直接基于 Transformers 完成(见 Mobile-Agent-v3.5/README.md 的 Quick Start):

from transformers import Qwen3VLForConditionalGeneration, AutoProcessor model_name = "mPLUG/GUI-Owl-1.5-8B-Instruct" model = Qwen3VLForConditionalGeneration.from_pretrained( model_name, torch_dtype="auto", device_map="auto" ) processor = AutoProcessor.from_pretrained(model_name) messages = [ { "role": "user", "content": [ {"type": "image", "image": "screenshot.png"}, {"type": "text", "text": "Click on the search bar."}, ], } ] inputs = processor.apply_chat_template( messages, tokenize=True, add_generation_prompt=True, return_dict=True, return_tensors="pt" ) inputs = inputs.to(model.device) generated_ids = model.generate(**inputs, max_new_tokens=128) generated_ids_trimmed = [ out_ids[len(in_ids):] for in_ids, out_ids in zip(inputs.input_ids, generated_ids) ] output_text = processor.batch_decode( generated_ids_trimmed, skip_special_tokens=True, clean_up_tokenization_spaces=False ) print(output_text)

多平台部署实战:手机、PC 与浏览器的完整配置

v3 与 v3.5 提供了几乎一致的设备接入流程(详见各自 README),核心步骤可归纳为一条通用的设备接入流水线

第一步:安装依赖

pip install qwen_agent pip install qwen_vl_utils pip install numpy

其中qwen_agent提供智能体框架底座,qwen_vl_utils提供视觉输入的编解码工具。PC 端部署需额外安装pyautogui(屏幕控制)与pyperclip(剪贴板);浏览器端则建议创建独立虚拟环境并安装 Playwright:

python -m venv .venv source .venv/bin/activate pip install -r requirements.txt playwright install chromium

第二步:通过 ADB 连接 Android 真机

  1. 下载 Android Debug Bridge(platform-tools);
  2. 在 Android 手机上开启开发者选项并打开USB 调试;若为 HyperOS(小米澎湃 OS)系统,还需同时开启"USB 调试(安全设置)";
  3. 用数据线连接手机并选择"传输文件"模式;
  4. 验证环境:执行/path/to/adb devices,能列出已连接设备即准备就绪;
  5. Mac / Linux 下为 adb 添加执行权限:sudo chmod +x /path/to/adb;Windows 下路径形如xx/xx/adb.exe
  6. 安装 ADB Keyboard APK 并在系统设置中把默认输入法切换为 "ADB Keyboard",这是智能体注入文本的必要通道。

第三步:启动移动端任务

cd Mobile-Agent-v3.5/mobile_use python run_gui_owl_1_5_for_mobile.py \ --adb_path "Your ADB path" \ --api_key "Your api key of vllm service" \ --base_url "Your base url of vllm service" \ --model "Your model name of vllm service" \ --instruction "The instruction you want Mobile-Agent-v3.5 to complete" \ --add_info "Some supplementary knowledge, can also be empty"

PC 端与浏览器端的命令结构类似:PC 端运行 run_gui_owl_1_5_for_pc.py,无需 adb 参数;浏览器端运行 run_gui_owl_1_5_for_web.py,支持--web(起始网址)、--headless(无头模式)、--use_css_som(CSS SOM 标记)、--image_type base64/file等参数,并需配置API_KEYEVAL_API_KEY等环境变量。

坐标输出约定(重要)

v3.5 文档特别强调:GUI-Owl 1.5 默认输出 0–1000 的相对坐标,框架会在执行层将相对坐标映射到设备真实分辨率。这与 v3 中--coor_type "qwen-vl"的映射逻辑一致——理解这一约定,是正确解析模型输出、避免点击错位的关键。

在线体验与云端 API

如果不想本地部署,根目录 README 提供了多条零门槛体验路径:

  • Mobile-Agent-v3 在线 Demo:基于无影云桌面与云手机构建,无需本地部署模型或准备设备,输入指令即可体验,同时提供限时免费的 Mobile-Agent-v3 API(对应阿里云 Model Studio 的 UI-Agent API);
  • Mobile-Agent-v3.5 在线 Demo 与 API:提供 Computer Use 场景的在线演示,以及基于百炼平台(Bailian)的 GUI+ 系列 API;
  • GUI-Owl 系列在线推理:GUI-Owl 与 GUI-Owl-1.5 系列模型已上线百炼与魔搭 API-Inference,可直接调用 7B / 32B / 1.5-8B-Think 等模型做在线推理;
  • 无影云手机:Mobile-Agent-v3.5 已在阿里云无影云手机上架,提供基于云端的 Android 环境,实现开箱即用的 Mobile Use 体验。

评测体系与代表性成绩

v3.5 在 Mobile-Agent-v3.5/README.md 中给出了 GUI-Owl-1.5 系列在 9 个端到端在线基准上的成绩(下表为原文档数据的完整整理):

模型OSWorld-VerifiedAndroidWorldOSWorld-MCPMobile-WorldWindowsAAWebArenaVisualWebArenaWebVoyagerOnline-Mind2Web
GUI-Owl-1.5-2B-Instruct43.567.933.031.325.8----
GUI-Owl-1.5-4B-Instruct48.269.831.732.329.4----
GUI-Owl-1.5-8B-Instruct52.369.041.841.831.745.739.469.941.7
GUI-Owl-1.5-8B-Thinking52.971.638.833.335.146.740.878.148.6
GUI-Owl-1.5-32B-Instruct56.569.447.646.844.8----
GUI-Owl-1.5-32B-Thinking56.068.243.842.844.148.446.682.1-

此外,家族在grounding 基准(ScreenSpot-v2、ScreenSpot-Pro、OSWorld-G、MMBench-GUI 等)与GUI 知识基准上的详细结果收录于技术报告;grounding_and_kb 目录提供了这两类基准的评测脚本(run_grounding.shrun_gui_kb.sh,需填写MODEL_PATH / DS_PATH / SAVE_PATH / EVAL_TYPE)。工具调用类评测(OSWorld-MCP、MobileWorld)与 Web 类评测(WebArena / VisualWebArena / WebVoyager / Mind2Web,脚本见 web_benchmark/main_for_eval.py)也均有对应代码可复现。

演进时间线与学术成果

根目录 README 的 News 章节完整记录了家族的发布轨迹,可作为检索与引用的时间轴:

  • 2024.3Mobile-Agent(v1)被 ICLR 2024 Workshop 录用;
  • 2024.7Mobile-Agent 获 CCL 2024 最佳演示奖;
  • 2024.9Mobile-Agent-v2 被 NeurIPS 2024 录用;
  • 2025.3PC-Agent 被 ICLR 2025 Workshop 录用;
  • 2025.8Mobile-Agent-v3 获 CCL 2025 最佳演示奖;同时发布 GUI-Owl 与 Mobile-Agent-v3;
  • 2025.9发布 UI-S1(半在线强化学习);GUI-Critic-R1 被 NeurIPS 2025 录用;
  • 2025.10发布 OSWorld-MCP 工具调用基准;
  • 2025.11GUI-Owl 系列模型上线百炼在线推理;
  • 2026.2发布 GUI-Owl-1.5 模型家族(基于 Qwen3-VL,支持桌面 / 移动 / 浏览器自动化);
  • 2026.3Mobile-Agent-v3.5 上线无影云手机;
  • 2026.5发布 ToolCUA——面向 GUI 与工具最优路径编排的端到端计算机使用智能体,通过"基于轨迹的工具合成 → 在线智能体强化学习"两阶段训练,学习何时使用 GUI 操作、何时调用工具及何时切换。

引用方式

如果 Mobile-Agent 家族对你的研究与应用有帮助,根目录 README 提供了完整的 BibTeX 引用列表,覆盖 v3.5、v3、UI-S1、GUI-Critic-R1、PC-Agent、Mobile-Agent-E、v2、v1 八篇论文,此处摘录家族最新两篇:

@article{xu2026mobile, title={Mobile-Agent-v3.5: Multi-platform Fundamental GUI Agents}, author={Xu, Haiyang and Zhang, Xi and Liu, Haowei and Wang, Junyang and Zhu, Zhaozai and Zhou, Shengjie and Hu, Xuhao and Gao, Feiyu and Cao, Junjie and Wang, Zihua and others}, journal={arXiv preprint arXiv:2602.16855}, year={2026} } @article{ye2025mobile, title={Mobile-Agent-v3: Foundamental Agents for GUI Automation}, author={Ye, Jiabo and Zhang, Xi and Xu, Haiyang and Liu, Haowei and Wang, Junyang and Zhu, Zhaoqing and Zheng, Ziwei and Gao, Feiyu and Cao, Junjie and Lu, Zhengxi and others}, journal={arXiv preprint arXiv:2508.15144}, year={2025} }

完整列表见 README.md 的 Citation 章节(中文版 内容一致),可直接复制使用。

【免费下载链接】MobileAgentMobile-Agent: The Powerful GUI Agent Family项目地址: https://gitcode.com/GitHub_Trending/mo/MobileAgent

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询