MediaCrawler

MediaCrawler

全网内容选题 自媒体平台爬虫

Loading…

应用介绍

#数据采集 #内容分析 #Playwright #WebUI #Python #Windows #macOS #Linux
MediaCrawler 是一款开源的多平台内容采集工具,目前 GitHub 已获得超过 57k Star。它支持多个主流内容平台的公开数据采集,包括笔记、视频、评论、用户信息等,适用于内容分析、竞品研究、舆情监测以及 AI 数据集整理等场景。
与传统采集工具相比,MediaCrawler 更注重降低使用门槛。项目基于 Playwright 保留浏览器登录状态,无需研究复杂的签名算法或逆向加密流程,普通开发者也能较快完成环境配置和数据采集。同时提供 WebUI,可通过可视化界面完成参数配置、任务管理、日志查看和数据导出。

软件功能

- 多平台内容采集:支持小红书、抖音、快手、哔哩哔哩(B站)、微博、知乎、百度贴吧等多个平台的公开内容采集。
- 丰富的数据类型:可采集公开内容、评论、用户信息等数据,满足不同分析需求。
- 基于 Playwright:继承浏览器登录状态,减少复杂的逆向分析和签名处理流程。
- WebUI 可视化管理:支持图形化配置采集参数、启动任务、查看运行日志以及预览导出数据。
- 内容分析:适合整理热点内容、分析热门选题和研究内容传播规律。
- 竞品研究:采集公开账号和内容数据,辅助分析竞品账号运营策略。
- 舆情监测:持续采集公开讨论内容,用于关注品牌、产品或关键词动态。
- AI 数据集整理:可作为公开数据采集工具,为 AI 数据分析和训练提供素材来源。
- 开源免费:源码公开,支持根据业务需求进行扩展和二次开发。

应用截图