MediaCrawler 是一个功能强大的多平台自媒体数据采集工具,由开发者 NanmiCoder 开源,支持小红书、抖音、快手、B站、微博、贴吧、知乎等主流平台的公开信息抓取。
| 平台 | 关键词搜索 | 指定帖子爬取 | 二级评论 | 创作者主页 | 登录态缓存 | IP代理池 | 评论词云 |
|---|---|---|---|---|---|---|---|
| 小红书 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| 抖音 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| 快手 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| B站 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| 微博 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| 贴吧 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| 知乎 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
根据配置的关键词自动搜索相关帖子,爬取帖子详情与评论信息
提供帖子ID列表,精准获取指定帖子的完整信息与评论数据
支持爬取评论的回复内容,完整还原讨论区的对话结构
爬取指定创作者的主页内容,分析其发布策略和内容特征
保存登录状态避免频繁扫码登录,提升使用体验和爬取效率
内置代理池管理,自动切换IP应对平台反爬策略
自动生成评论关键词词云图,直观展示舆论热点
基于 FastAPI + Vite 的 Web 界面,无需命令行即可操作爬虫
项目默认使用 CDP 模式连接已有 Chrome 浏览器,使用前需:
chrome://inspect/#remote-debuggingServer running at: 127.0.0.1:9222| 功能维度 | 开源版 | Pro 版 |
|---|---|---|
| 平台支持 | 7大平台全覆盖 | 7大平台 + 持续扩展 |
| 核心功能 | 搜索/详情/评论/创作者主页 | 全部开源版功能 |
| 断点续爬 | 不支持 | ✅ 支持 |
| 多账号 | 单账号 | ✅ 多账号+IP代理池 |
| Playwright 依赖 | 需要 | ✅ 已去除 |
| Linux 支持 | 部分 | ✅ 完整支持 |
| AI Agent Skill | 不支持 | ✅ OpenClaw/Claude/Cursor |
| 首页信息流 | 不支持 | ✅ HomeFeed |
| 视频下载器 | 不支持 | ✅ 桌面端 |
| 代码质量 | 学习参考级 | 企业级架构 |
| 价格 | 免费 | 付费订阅 |