说实话现在各种CLI、SKILL、MCP太多了,我习惯性每天都要上Github看最新的AI插件,因为我经常要用WorkBuddy、DeepSeek Harness干活偷懒,这两个Agent太依赖插件了。
这两天在Github上发现一个CLI数据采集工具,专门用来复杂网页大规模爬虫,叫作Brightdata CLI,到目前Star数已经超过6K,在AI爬虫开源项目里算很高的热度,配置到WorkBuddy上用非常惊艳,后面会有案例。

简单说,这个CLI是终端直接调用的轻量工具,使用Bright Data采集API来实现爬虫,不用写复杂的Python代码,甚至压根不需要代码。
在终端输入一行指令就能完成网页抓取、控制浏览器、搜索引擎批量检索、AI关键词自动采集等操作,堪称网络数据采集百宝箱。

相比较之前用的requests、playwright脚本,这个CLI把数据请求求、HTML解析的活都干了,接受url和字段需求自动返回数据集。
比如你可以让它批量采集几万条亚马逊商品的价格、名称、销量等信息,也可以直接关键词搜索获得谷歌结果,实时监测热度,或者抓取领英岗位、帖子列表,这些都可以实现。

这里面涉及到一个很重要的网络采集技术,那就是针对网站爬虫检测的处理能力。
看readme介绍,Brightdata CLI能自动处理人机验证、动态页面渲染、浏览器指纹,等于打通了公开数据的采集通道,不需要再写脚本去处理反爬,替代了爬虫工程师的工作。
例如通过CLI采集领英上相关AI博主的公开信息,直接拿到明细数据:

采集到的结果能直接导出Markdown、CSV这样的结构化格式,很适合AI进行训练、分析。
除了CLI命令行形式,你还可以通过SKILL服务接入到WorkBuddy、DeepSeek Harness上,随时调用,口语化聊天就能采集复杂的网页数据。
以部署WorkBuddy为例,首先你需要在命令行安装Bright Data CLI,在mac终端输入以下命令,当然你的电脑得有Node.js。
curl -fsSL https://cli.brightdata.com/install.sh | sh
安装好后,再在终端输入brightdata init,出现下面界面代表安装好了。

然后你需要去Bright data官网注册key,配置到该CLI上,现在这个key是免费用的,每个月有5000次采集额度,测试数据完全够用了。
在以下链接注册并获取key,有5000次额度。
https://get.brightdata.com/weijun
拿到key后,在终端去配置。
# 直接配置key
brightdata login –api-key <your-api-key>
# 设置环境变量可完全跳过登录
export BRIGHTDATA_API_KEY=your-api-key
配置好后就可以直接在CLI上采集数据,比如抓取指定网站。

在谷歌、必应、Yandex上进行搜索。

自动化操作浏览器,比Playwright、Chrome MCP还要好用。

若想要在Wrokbuddy上配置Bright Data CLI,输入以下命令:
brightdata skill add

这个命令会导出SKILL文件到agent上,如果没有Workbuddy直接配置选项,可以先配置到Codex或者Trae上,然后找到SKILL md文件,再配置到WorkBuddy上。
假如你已经获取到SKILL,打开WorkBuddy上的技能-添加技能,上传该SKILL文件。

配置好就能在“我安装的“技能库里找到Bright Data CLI。 
接着使用WorkBuddy来调用Bright Data CLI采集数据。
比如:搜索谷歌上“agent”相关的新闻。

WorkBuddy会调用后台CLI来请求谷歌,拿到相应的搜索结果,既有json明细也有html可视化报告。

json明细数据如下:
html可视化报告如下:

再来个高难度的,查询亚马逊上销量前20的智能手机,需要搜集价格、名称、图片、优惠等信息。

最终结果交付了json、csv、html三种文件。

csv明细表格如下:

html可视化报告如下:

是不是很惊艳,这就是Bright Data CLI搭配Workbuddy的神奇效果。
如果想要用,可以注册个key,每月5000次免费额度可以抓很多数据了。
https://get.brightdata.com/dataforai
我感觉这类数据采集还非常适合大模型训练数据,比如视频、图片、音频等多模态数据,也可以作为电商运营数据源。
现在很多工具都CLI化,从速度、兼容性、系统支持上来说比传统app要好用很多,搭配Workbuddy用几乎零门槛。

