MediaCrawler 是一个基于 Playwright 浏览器自动化框架的多平台自媒体数据采集工具,支持小红书、抖音、快手、B站、微博、贴吧、知乎等主流平台的公开信息抓取。项目通过保留登录态的浏览器上下文环境,利用 JS 表达式获取签名参数,无需逆向复杂的加密算法,大幅降低技术门槛。
功能上覆盖关键词搜索、指定帖子 ID 爬取、二级评论、指定创作者主页、登录态缓存、IP 代理池以及评论词云图生成,七大平台均完整支持上述能力。数据可保存为 CSV、JSON、JSONL、Excel、SQLite 或 MySQL。项目同时提供 WebUI 可视化操作界面,支持可视化配置爬虫参数、实时查看运行状态和日志、数据预览与导出。
本次更新重点:
• 默认使用 CDP 模式连接已有 Chrome 浏览器,复用登录状态与 Cookie 以降低风控检测风险;推荐使用 uv 管理 Python 依赖;新增 WebUI 前后端分离的开发调试模式。项目同时推出付费的 MediaCrawlerPro 版本,新增自媒体内容拆解 Agent
• 断点续爬
• 多账号与 IP 代理池支持,并去除 Playwright 依赖
• 完整支持 Linux 环境
项目仅供学习与研究使用,禁止用于商业或非法用途。
GitHub
#GitHub #开源 #MediaCrawler #爬虫 #小红书 #抖音 #B站 #知乎 #数据采集 #Playwright
@GitHubTrendingHub