欢迎光临
我们一直在努力

95K Star!这个让 AI 自己逛网页的开源项目,彻底改变了我对自动化的认知

2026年最火的AI Agent Skill:browser-use 使用指南

95K+ GitHub Stars,让 AI 真正"会用浏览器"的开源神器

一、browser-use 是什么?

browser-use 是目前 GitHub 上最火的 AI 浏览器自动化开源项目,它的核心定位很简单:让 AI Agent 像人类一样操控浏览器完成任务。

你不需要写复杂的 Selenium/Playwright 脚本,只需要用自然语言描述你想做什么,AI 就会自动打开网页、点击按钮、填写表单、抓取数据——整个过程完全自主。

核心数据

  • ⭐ GitHub Stars:95,000+
  • 🍴 Forks:10,600+
  • 📝 开源协议:MIT
  • 🐍 技术栈:Python + Playwright
  • 🤖 支持模型:GPT-4o、Claude 3.5、Gemini、DeepSeek、Ollama 等

一句话总结

传统浏览器自动化 = 你告诉它"点哪个按钮、填哪个输入框"
browser-use = 你告诉它"帮我对比一下这两款手机的价格",它自己搞定一切


二、为什么它这么火?解决了什么痛点?

痛点1:传统自动化脚本太脆弱

用 Selenium 或 Playwright 写过自动化的人都懂:

  • 网站一改版,选择器就挂了
  • 动态加载的页面,等待逻辑写死人
  • 一个简单的表单填写,可能要调试半天

browser-use 的解法:用 LLM 理解页面结构,不需要写死选择器。网站改版了?没关系,AI 看得懂页面内容。

痛点2:非技术人员用不了自动化

传统自动化工具需要懂代码、懂前端,运营、产品、市场同学只能望洋兴叹。

browser-use 的解法:纯自然语言驱动,说人话就能干活。

痛点3:AI Agent 缺少"动手能力"

大模型再聪明,也只能输出文字。想让它真正帮你干活?必须有连接现实世界的接口。

browser-use 的解法:给 AI 装上了"浏览器之手",让它能真正操作 Web 世界。


三、核心功能与特点

1. 自然语言驱动

task = "去京东搜一下最新款的 MacBook Pro,对比 14寸和16寸的价格和配置"

就这一句话,剩下的 AI 自己搞定。

2. 多模型支持

  • OpenAI 系列:GPT-4o、GPT-4o mini
  • Anthropic 系列:Claude 3.5 Sonnet、Claude 3 Opus
  • Google 系列:Gemini 3 Flash、Gemini 3 Pro
  • 开源模型:Ollama 本地部署、DeepSeek 等
  • 自带模型:ChatBrowserUse(官方提供的专用模型)

3. 智能页面理解

  • 自动识别页面元素(按钮、输入框、链接)
  • 理解页面语义,知道该点哪里
  • 处理动态加载、弹窗、验证码等复杂场景

4. 任务完成率高

官方实测数据:

  • 平均任务完成率:97%
  • 比直接用 LLM + Playwright 节省 40% Token
  • 平均任务执行时间:2-5 分钟

5. 云端模式(可选)

  • Stealth 浏览器:专业指纹伪装,绕过反爬检测
  • 代理管理:支持住宅代理、数据中心代理
  • 会话持久化:保存登录状态,重复使用

四、典型应用场景

🛒 电商场景

  • 商品价格监控与对比
  • 自动下单、抢购
  • 竞品信息采集
  • 评论数据分析

📊 数据采集

  • 新闻资讯聚合
  • 社交媒体数据抓取
  • 行业报告收集
  • 招聘信息监控

🧪 测试自动化

  • 网站功能测试
  • 用户旅程测试
  • 回归测试
  • 兼容性测试

📝 办公自动化

  • 自动填写各种在线表单
  • 后台系统批量操作
  • 数据录入与导出
  • 多平台信息同步

🔍 研究与分析

  • 市场调研
  • 竞品分析
  • 学术文献检索
  • 信息核实与事实核查

五、安装教程

前置要求

  • Python 3.11 或更高版本
  • 一个可用的 LLM API Key(OpenAI / Anthropic / Google 任选其一)

步骤1:安装 browser-use

pip install browser-use

步骤2:安装浏览器依赖

playwright install chromium

这一步会自动下载 Chromium 浏览器(约 100-200MB),无需手动配置。

步骤3:配置 API Key

创建 .env 文件:

# 任选一个你想用的模型
OPENAI_API_KEY=sk-xxxxxxxxxxxxxxxx
# ANTHROPIC_API_KEY=sk-ant-xxxxxxxxxxxxxxxx
# GOOGLE_API_KEY=xxxxxxxxxxxxxxxx

或者直接在终端设置环境变量:

export OPENAI_API_KEY=sk-xxxxxxxxxxxxxxxx

(可选)使用虚拟环境

如果你习惯用虚拟环境隔离依赖:

# 使用 conda
conda create –name browser_use python=3.11
conda activate browser_use

# 或者使用 venv
python -m venv browser_use
source browser_use/bin/activate # Linux/Mac
# browser_use\\Scripts\\activate # Windows


六、快速上手:5分钟跑通第一个例子

最小可运行示例

# main.py
from browser_use import Agent
from langchain_openai import ChatOpenAI
import asyncio

async def main():
# 创建 Agent
agent = Agent(
task="去百度搜索 '2026年最火的AI技术',然后把前5条结果的标题和链接整理出来",
llm=ChatOpenAI(model="gpt-4o"),
)

# 运行任务
result = await agent.run()

# 输出结果
print("任务完成!")
print(result)

if __name__ == "__main__":
asyncio.run(main())

运行:

python main.py

你会看到什么?

  • 浏览器自动打开(默认是无头模式,看不到界面)
  • AI 自动导航到百度
  • 自动输入搜索词并搜索
  • 自动读取搜索结果
  • 整理成结构化的输出
  • 任务完成,浏览器关闭
  • 想看浏览器界面?

    加上 headless=False 参数:

    agent = Agent(
    task="…",
    llm=ChatOpenAI(model="gpt-4o"),
    headless=False, # 显示浏览器窗口
    )

    调试的时候强烈建议打开这个选项,看着 AI 操作浏览器非常有意思。


    七、进阶使用技巧

    1. 使用 Claude 模型

    from langchain_anthropic import ChatAnthropic

    agent = Agent(
    task="你的任务描述",
    llm=ChatAnthropic(model="claude-3-5-sonnet-20240620"),
    )

    2. 使用本地模型(Ollama)

    from langchain_ollama import ChatOllama

    agent = Agent(
    task="你的任务描述",
    llm=ChatOllama(model="llama3.1:70b"),
    )

    注意:本地模型效果会比商用模型差一些,建议至少用 70B 参数的模型。

    3. 保存和加载会话

    # 保存会话状态
    await agent.browser.save_storage_state("session.json")

    # 加载会话(保持登录状态)
    from browser_use import BrowserConfig

    browser_config = BrowserConfig(
    storage_state="session.json",
    )

    agent = Agent(
    task="…",
    llm=...,
    browser_config=browser_config,
    )

    4. 设置最大步骤数

    防止 AI 无限循环:

    agent = Agent(
    task="…",
    llm=...,
    max_steps=50, # 最多执行50步
    )

    5. 批量执行任务

    tasks = [
    "去知乎搜一下 AI Agent 的热门话题",
    "去掘金看看最新的前端技术文章",
    "去微博看看今天的热搜榜",
    ]

    for task in tasks:
    agent = Agent(task=task, llm=ChatOpenAI(model="gpt-4o"))
    result = await agent.run()
    print(f"任务完成:{task}")
    print(result)
    print("—")


    八、常见问题与坑

    Q1:运行报错说找不到 playwright?

    A:执行 playwright install chromium 安装浏览器。

    Q2:任务执行太慢怎么办?

    A:

    • 用更快的模型(比如 GPT-4o mini 比 GPT-4o 快很多)
    • 简化任务描述,不要太复杂
    • 增加并发(但注意 API 限流)

    Q3:AI 总是点错地方怎么办?

    A:

    • 换更强的模型(Claude 3.5 Sonnet 在页面理解上表现很好)
    • 在任务描述里给更多提示
    • 打开 headless=False 看看 AI 到底在干嘛

    Q4:能绕过登录吗?

    A:可以。先用手动登录,然后用 save_storage_state 保存会话,之后就可以复用登录状态了。

    Q5:会被网站反爬检测到吗?

    A:

    • 本地模式:有一定概率被检测,因为 Playwright 有特征
    • 云端模式:有 Stealth 浏览器和代理,检测概率低很多
    • 建议加一些随机延迟,模拟人类操作

    九、总结:值不值得学?

    我的答案是:非常值得。

    为什么推荐 browser-use?

  • 门槛极低:会说人话就能用,不需要懂前端、不需要写选择器
  • 适用性广:只要是浏览器里能干的事,它理论上都能做
  • 生态成熟:95K stars 不是白给的,社区活跃、文档完善
  • 扩展性强:可以和各种 Agent 框架、工作流结合
  • 谁最应该学?

    • 🧑‍💻 开发者:快速搭建自动化工具、做原型验证
    • 📊 运营/产品:数据采集、竞品监控、日常效率提升
    • 🧪 测试工程师:快速写测试用例、探索性测试
    • 📈 创业者:用 AI Agent 做业务流程自动化
    赞(0)
    未经允许不得转载:171主机测评 » 95K Star!这个让 AI 自己逛网页的开源项目,彻底改变了我对自动化的认知
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址