应用介绍
给大模型准备网页数据,要写爬虫、清洗 HTML、转格式,工作量不小。WaterCrawl 是一个把网页内容转换成适合大模型使用的数据的爬取应用,抓取网页并提取相关内容。
它基于 Python、Django、Scrapy 和 Celery,可以用 Docker 在本地快速启动。
网页爬取:批量抓取站点内容。
内容提取:清洗并转成 Markdown。
任务队列:Celery 异步处理。
Docker:本地快速启动。
它基于 Python、Django、Scrapy 和 Celery,可以用 Docker 在本地快速启动。
软件功能
网页爬取:批量抓取站点内容。
内容提取:清洗并转成 Markdown。
任务队列:Celery 异步处理。
Docker:本地快速启动。

