在Github上发现一个CLI工具,专门用来爬虫,叫作Brightdata CLI,到目前Star数已经超过5K。
简单说这个CLI是终端直接调用的轻量工具,不用写完整代码,登录后输入一行指令就能完成网页抓取、控制浏览器、搜索引擎批量检索、AI关键词自动采集等等,堪称网络数据采集百宝箱。
相比较之前用的requests、playwright脚本,这个CLI把数据请求、HTML解析的活都干了,接受url和字段需求自动返回数据集。
这里面涉及到一个很重要的网络采集技术,那就是针对网站爬虫检测的处理能力。
看readme介绍,Brightdata CLI还能自动处理人际验证、动态页面渲染、浏览器指纹,等于打通了公开数据的采集通道,不需要再写脚本去处理反爬,可以看这个演示。网页链接
采集到的结果能直接导出Markdown、CSV,还可以通过MCP服务接入到Codex、Claude code上,等于插座随处可用。
我感觉这类数据采集非常适合大模型训练数据,比如视频、图片、音频等多模态数据,也可以作为电商运营数据源。
安装这个CLI也很简单,mac用curl安装,win用npm安装,一句命令搞定。
现在很多工具都CLI化,从速度、兼容性、系统支持上来说比传统app要好用很多。人工智能aihow i aigithub爬虫


