阅读,与值得关注的内容Readance

挖到一个专门为AI准备的开源网页爬虫和抓取工具

兄弟们,今天挖到一个真·狠货。

GitHub上现在有个叫 Crawl4AI 的项目,星标已经冲到了8.1万+,Fork也有8千多。它不是什么新出的玩具,而是一个专门为LLM准备的开源网页爬虫和抓取工具。

作者被某家按月收费的爬虫服务(大概16美元左右一个月)坑得火大,一怒之下自己动手,几天时间就把这个东西写出来了,然后直接开源扔给全世界。结果现在成了GitHub上最火的LLM友好型爬虫之一。

简单说:你把任何网站URL丢进去,它吐出来的就是干净、结构化、LLM可以直接啃的Markdown。

  • 不用API Key
  • 不用注册账号
  • 不用按页付费
  • 支持JavaScript渲染(底层用Playwright)
  • 输出干净Markdown,特别适合做RAG、Agent数据管道

速度也确实猛。很多人实测后都说,比那些收费服务还顺手。

现在最新版本是v0.9.3,Apache 2.0协议,商用免费,完全可以自己部署。安装也很简单:

pip install -U crawl4aicrawl4ai-setup

然后几行Python就能跑起来。

我自己试了下,那种“免费的才是最贵的”的错觉,确实被打碎了一半。

当然,现实使用中还是有坑的。登录态保持、反爬对抗、大规模并发这些,开源工具也得自己处理。但它至少把最基础、最核心的抓下来并洗干净给LLM吃这件事,做到了极致简单。

现在还有很多人在按月交钱用类似服务。看完这个项目,再回头看那些账单,感觉会有点微妙。

项目地址直接丢这里,自己掂量:

https://github.com/unclecode/crawl4ai

感兴趣的直接Clone试试。
真正好用的工具,往往就是从一句“真TM贵”开始的。

前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →