2026年最火的AI Agent Skill:browser-use 使用指南
95K+ GitHub Stars,让 AI 真正"会用浏览器"的开源神器
一、browser-use 是什么?
browser-use 是目前 GitHub 上最火的 AI 浏览器自动化开源项目,它的核心定位很简单:让 AI Agent 像人类一样操控浏览器完成任务。
你不需要写复杂的 Selenium/Playwright 脚本,只需要用自然语言描述你想做什么,AI 就会自动打开网页、点击按钮、填写表单、抓取数据——整个过程完全自主。
核心数据
- ⭐ GitHub Stars:95,000+
- 🍴 Forks:10,600+
- 📝 开源协议:MIT
- 🐍 技术栈:Python + Playwright
- 🤖 支持模型:GPT-4o、Claude 3.5、Gemini、DeepSeek、Ollama 等
一句话总结
传统浏览器自动化 = 你告诉它"点哪个按钮、填哪个输入框"
browser-use = 你告诉它"帮我对比一下这两款手机的价格",它自己搞定一切
二、为什么它这么火?解决了什么痛点?
痛点1:传统自动化脚本太脆弱
用 Selenium 或 Playwright 写过自动化的人都懂:
- 网站一改版,选择器就挂了
- 动态加载的页面,等待逻辑写死人
- 一个简单的表单填写,可能要调试半天
browser-use 的解法:用 LLM 理解页面结构,不需要写死选择器。网站改版了?没关系,AI 看得懂页面内容。
痛点2:非技术人员用不了自动化
传统自动化工具需要懂代码、懂前端,运营、产品、市场同学只能望洋兴叹。
browser-use 的解法:纯自然语言驱动,说人话就能干活。
痛点3:AI Agent 缺少"动手能力"
大模型再聪明,也只能输出文字。想让它真正帮你干活?必须有连接现实世界的接口。
browser-use 的解法:给 AI 装上了"浏览器之手",让它能真正操作 Web 世界。
三、核心功能与特点
1. 自然语言驱动
task = "去京东搜一下最新款的 MacBook Pro,对比 14寸和16寸的价格和配置"
就这一句话,剩下的 AI 自己搞定。
2. 多模型支持
- OpenAI 系列:GPT-4o、GPT-4o mini
- Anthropic 系列:Claude 3.5 Sonnet、Claude 3 Opus
- Google 系列:Gemini 3 Flash、Gemini 3 Pro
- 开源模型:Ollama 本地部署、DeepSeek 等
- 自带模型:ChatBrowserUse(官方提供的专用模型)
3. 智能页面理解
- 自动识别页面元素(按钮、输入框、链接)
- 理解页面语义,知道该点哪里
- 处理动态加载、弹窗、验证码等复杂场景
4. 任务完成率高
官方实测数据:
- 平均任务完成率:97%
- 比直接用 LLM + Playwright 节省 40% Token
- 平均任务执行时间:2-5 分钟
5. 云端模式(可选)
- Stealth 浏览器:专业指纹伪装,绕过反爬检测
- 代理管理:支持住宅代理、数据中心代理
- 会话持久化:保存登录状态,重复使用
四、典型应用场景
🛒 电商场景
- 商品价格监控与对比
- 自动下单、抢购
- 竞品信息采集
- 评论数据分析
📊 数据采集
- 新闻资讯聚合
- 社交媒体数据抓取
- 行业报告收集
- 招聘信息监控
🧪 测试自动化
- 网站功能测试
- 用户旅程测试
- 回归测试
- 兼容性测试
📝 办公自动化
- 自动填写各种在线表单
- 后台系统批量操作
- 数据录入与导出
- 多平台信息同步
🔍 研究与分析
- 市场调研
- 竞品分析
- 学术文献检索
- 信息核实与事实核查
五、安装教程
前置要求
- Python 3.11 或更高版本
- 一个可用的 LLM API Key(OpenAI / Anthropic / Google 任选其一)
步骤1:安装 browser-use
pip install browser-use
步骤2:安装浏览器依赖
playwright install chromium
这一步会自动下载 Chromium 浏览器(约 100-200MB),无需手动配置。
步骤3:配置 API Key
创建 .env 文件:
# 任选一个你想用的模型
OPENAI_API_KEY=sk-xxxxxxxxxxxxxxxx
# ANTHROPIC_API_KEY=sk-ant-xxxxxxxxxxxxxxxx
# GOOGLE_API_KEY=xxxxxxxxxxxxxxxx
或者直接在终端设置环境变量:
export OPENAI_API_KEY=sk-xxxxxxxxxxxxxxxx
(可选)使用虚拟环境
如果你习惯用虚拟环境隔离依赖:
# 使用 conda
conda create –name browser_use python=3.11
conda activate browser_use
# 或者使用 venv
python -m venv browser_use
source browser_use/bin/activate # Linux/Mac
# browser_use\\Scripts\\activate # Windows
六、快速上手:5分钟跑通第一个例子
最小可运行示例
# main.py
from browser_use import Agent
from langchain_openai import ChatOpenAI
import asyncio
async def main():
# 创建 Agent
agent = Agent(
task="去百度搜索 '2026年最火的AI技术',然后把前5条结果的标题和链接整理出来",
llm=ChatOpenAI(model="gpt-4o"),
)
# 运行任务
result = await agent.run()
# 输出结果
print("任务完成!")
print(result)
if __name__ == "__main__":
asyncio.run(main())
运行:
python main.py
你会看到什么?
想看浏览器界面?
加上 headless=False 参数:
agent = Agent(
task="…",
llm=ChatOpenAI(model="gpt-4o"),
headless=False, # 显示浏览器窗口
)
调试的时候强烈建议打开这个选项,看着 AI 操作浏览器非常有意思。
七、进阶使用技巧
1. 使用 Claude 模型
from langchain_anthropic import ChatAnthropic
agent = Agent(
task="你的任务描述",
llm=ChatAnthropic(model="claude-3-5-sonnet-20240620"),
)
2. 使用本地模型(Ollama)
from langchain_ollama import ChatOllama
agent = Agent(
task="你的任务描述",
llm=ChatOllama(model="llama3.1:70b"),
)
注意:本地模型效果会比商用模型差一些,建议至少用 70B 参数的模型。
3. 保存和加载会话
# 保存会话状态
await agent.browser.save_storage_state("session.json")
# 加载会话(保持登录状态)
from browser_use import BrowserConfig
browser_config = BrowserConfig(
storage_state="session.json",
)
agent = Agent(
task="…",
llm=...,
browser_config=browser_config,
)
4. 设置最大步骤数
防止 AI 无限循环:
agent = Agent(
task="…",
llm=...,
max_steps=50, # 最多执行50步
)
5. 批量执行任务
tasks = [
"去知乎搜一下 AI Agent 的热门话题",
"去掘金看看最新的前端技术文章",
"去微博看看今天的热搜榜",
]
for task in tasks:
agent = Agent(task=task, llm=ChatOpenAI(model="gpt-4o"))
result = await agent.run()
print(f"任务完成:{task}")
print(result)
print("—")
八、常见问题与坑
Q1:运行报错说找不到 playwright?
A:执行 playwright install chromium 安装浏览器。
Q2:任务执行太慢怎么办?
A:
- 用更快的模型(比如 GPT-4o mini 比 GPT-4o 快很多)
- 简化任务描述,不要太复杂
- 增加并发(但注意 API 限流)
Q3:AI 总是点错地方怎么办?
A:
- 换更强的模型(Claude 3.5 Sonnet 在页面理解上表现很好)
- 在任务描述里给更多提示
- 打开 headless=False 看看 AI 到底在干嘛
Q4:能绕过登录吗?
A:可以。先用手动登录,然后用 save_storage_state 保存会话,之后就可以复用登录状态了。
Q5:会被网站反爬检测到吗?
A:
- 本地模式:有一定概率被检测,因为 Playwright 有特征
- 云端模式:有 Stealth 浏览器和代理,检测概率低很多
- 建议加一些随机延迟,模拟人类操作
九、总结:值不值得学?
我的答案是:非常值得。
为什么推荐 browser-use?
谁最应该学?
- 🧑💻 开发者:快速搭建自动化工具、做原型验证
- 📊 运营/产品:数据采集、竞品监控、日常效率提升
- 🧪 测试工程师:快速写测试用例、探索性测试
- 📈 创业者:用 AI Agent 做业务流程自动化





