兄弟们,今天挖到一个真·狠货。
GitHub上现在有个叫 Crawl4AI 的项目,星标已经冲到了8.1万+,Fork也有8千多。它不是什么新出的玩具,而是一个专门为LLM准备的开源网页爬虫和抓取工具。
作者被某家按月收费的爬虫服务(大概16美元左右一个月)坑得火大,一怒之下自己动手,几天时间就把这个东西写出来了,然后直接开源扔给全世界。结果现在成了GitHub上最火的LLM友好型爬虫之一。
简单说:你把任何网站URL丢进去,它吐出来的就是干净、结构化、LLM可以直接啃的Markdown。
不用API Key 不用注册账号 不用按页付费 支持JavaScript渲染(底层用Playwright) 输出干净Markdown,特别适合做RAG、Agent数据管道
速度也确实猛。很多人实测后都说,比那些收费服务还顺手。
现在最新版本是v0.9.3,Apache 2.0协议,商用免费,完全可以自己部署。安装也很简单:
pip install -U crawl4aicrawl4ai-setup
然后几行Python就能跑起来。
我自己试了下,那种“免费的才是最贵的”的错觉,确实被打碎了一半。
当然,现实使用中还是有坑的。登录态保持、反爬对抗、大规模并发这些,开源工具也得自己处理。但它至少把最基础、最核心的抓下来并洗干净给LLM吃这件事,做到了极致简单。
现在还有很多人在按月交钱用类似服务。看完这个项目,再回头看那些账单,感觉会有点微妙。
项目地址直接丢这里,自己掂量:
https://github.com/unclecode/crawl4ai感兴趣的直接Clone试试。
真正好用的工具,往往就是从一句“真TM贵”开始的。