1. 服务概述
一句话简介:浏览器自动化MCP服务器,支持截图、HTML获取、JavaScript执行和控制台日志获取
- 服务名称:Browser Use MCP Server (cline-browser-use-mcp)
- 版本号:最新版本
- 开发者/提供方:ztobs
- 协议类型:MCP (Model Context Protocol)
2. 核心功能
列出该MCP服务提供的主要功能点:
- 截图捕获:捕获网页截图(整页或视口)
- HTML内容获取:获取网页的HTML内容
- JavaScript执行:在网页上执行自定义JavaScript代码
- 控制台日志访问:获取浏览器控制台日志
- 自定义交互步骤:执行操作序列(点击、滚动、表单填充、认证)
- 无头自动化:可选Xvfb支持,避免机器人检测
- LLM集成:支持多个LLM提供商(OpenAI、Groq、Gemini等)
- 视觉能力:可选的网页内容视觉理解
3. 使用场景
描述该服务适合在什么情况下使用:
- 网页测试:自动化测试网页功能和外观
- 数据抓取:从网页中提取数据和内容
- 表单填充:自动化填写和提交网页表单
- 认证流程:自动化处理登录和认证流程
- 网页交互:模拟用户点击、滚动等交互操作
- JavaScript调试:在网页上执行和测试JavaScript代码
- 视觉验证:捕获网页截图进行视觉验证
4. 接入方式
4.1 服务端点
该服务通过MCP协议提供接口,支持Python语言开发,采用混合托管模式。
4.2 认证与权限
需要配置至少一个LLM提供商的API密钥:
# 必需:设置至少一个API密钥 export GLHF_API_KEY=your_api_key export GROQ_API_KEY=your_api_key export OPENAI_API_KEY=your_api_key export OPENROUTER_API_KEY=your_api_key export GITHUB_API_KEY=your_api_key export DEEPSEEK_API_KEY=your_api_key export GEMINI_API_KEY=your_api_key export OLLAMA_API_KEY=your_api_key # 可选:覆盖默认配置 export MODEL=your_preferred_model export BASE_URL=your_custom_url export USE_VISION=false4.3 数据格式
服务使用Python脚本进行浏览器自动化,支持多种操作和数据格式。
4.4 服务器配置
在Cline MCP中配置:
"browser-use": { "command": "node", "args": [ "/home/YOUR_HOME/Documents/Cline/MCP/browser-use-server/build/index.js" ], "env": { "GLHF_API_KEY": "your_api_key", "GROQ_API_KEY": "your_api_key", "OPENAI_API_KEY": "your_api_key", "MODEL": "your_preferred_model", "USE_VISION": "false" }, "disabled": false, "autoApprove": [] }5. 接口定义
该服务提供的主要工具接口包括:
5.1 浏览器操作工具
| 工具名称 | 功能描述 | 参数说明 |
|---|---|---|
| screenshot | 捕获网页截图 | url: 网页URL(必需),full_page: 是否整页(可选),steps: 操作步骤(可选) |
| get_html | 获取网页HTML内容 | url: 网页URL(必需),steps: 操作步骤(可选) |
| execute_js | 在网页上执行JavaScript | url: 网页URL(必需),script: JavaScript代码(必需),steps: 操作步骤(可选) |
| get_console_logs | 获取浏览器控制台日志 | url: 网页URL(必需),steps: 操作步骤(可选) |
5.2 LLM提供商配置
| 提供商 | 默认模型 | 特点 |
|---|---|---|
| GLHF | deepseek-ai/DeepSeek-V3 | 深度学习模型 |
| Ollama | qwen2.5:32b-instruct-q4_K_M | 本地部署,32k上下文 |
| Groq | deepseek-r1-distill-llama-70b | 高性能推理 |
| OpenAI | gpt-4o-mini | OpenAI模型 |
| Gemini | gemini-2.0-flash-exp | Google模型 |
6. 快速开始
6.1 环境要求
- Miniconda或Anaconda
- Python 3.11
- Node.js运行环境
- Xvfb(可选,用于无头浏览器自动化)
6.2 安装步骤
安装Xvfb(可选但推荐):
# Ubuntu/Debian sudo apt-get install xvfb # CentOS/RHEL sudo yum install xorg-x11-server-Xvfb # Arch Linux sudo pacman -S xorg-server-xvfb创建Conda环境:
conda create -n browser-use python=3.11 conda activate browser-use pip install -r requirements.txt克隆和构建:
git clone https://github.com/ztobs/cline-browser-use-mcp.git cd cline-browser-use-mcp npm install npm run build运行服务器:
node build/index.js使用示例:
# 截图 "Take a screenshot of the homepage at https://example.com" # 获取HTML "Get the HTML content of the login page" # 执行JavaScript "Execute JavaScript to change the color of the heading" # 多步骤操作 "Open https://localhost:3000/auth, login with user:pass, navigate to /dashboard, and take a screenshot"7. 注意事项
重要提示:
- API密钥必需:必须设置至少一个LLM提供商的API密钥
- Xvfb推荐:安装Xvfb可避免机器人检测,提高自动化成功率
- 视觉能力:USE_VISION默认为false,需要时启用
- 超时设置:默认超时5分钟,可在build/index.js中修改TIMEOUT常量
- 多步骤支持:支持逗号分隔的多步骤操作序列
- 认证处理:可自动化处理登录和认证流程
- 调试工具:使用npm run inspector进行MCP调试
- MIT许可证:采用MIT许可证开源
- Browser Use库:基于Browser Use库构建