DC娱乐网

这两天在Github上发现一个CLI数据采集工具,专门用来复杂网页大规模爬虫,叫

这两天在Github上发现一个CLI数据采集工具,专门用来复杂网页大规模爬虫,叫作Brightdata CLI,到目前Star数已经超过6K,在AI爬虫开源项目里算很高的热度,配置到WorkBuddy上用非常惊艳。

简单说,这个CLI是终端直接调用的轻量工具,使用Bright Data采集API来实现爬虫,不用写复杂的Python代码,甚至压根不需要代码。

在终端输入一行指令就能完成网页抓取、控制浏览器、搜索引擎批量检索、AI关键词自动采集等操作,堪称网络数据采集百宝箱。

以部署WorkBuddy为例,首先你需要在命令行安装Bright Data CLI,在mac终端输入以下命令(见GitHub教程),当然你的电脑得有Node.js。

网页链接

然后你需要去Bright data官网注册key,配置到该CLI上,现在这个key是免费用的,每个月有5000次采集额度,测试数据完全够用了。

网页链接

安装好后,再在终端输入brightdata init打开cli,并用brightdata skill add 命令导出skill。

打开WorkBuddy上的技能-添加技能,上传该SKILL文件。配置好就能在“我安装的“技能库里找到Bright Data CLI。

接着使用WorkBuddy来调用Bright Data CLI采集数据。比如:搜索谷歌上“agent”相关的新闻。WorkBuddy会调用后台CLI来请求谷歌,拿到相应的搜索结果,既有json明细也有html可视化报告。

我感觉这类数据采集还非常适合大模型训练数据,比如视频、图片、音频等多模态数据,也可以作为电商运营数据源。现在很多工具都CLI化,从速度、兼容性、系统支持上来说比传统app要好用很多,搭配Workbuddy用几乎零门槛。