60K Star 的 MediaCrawler 深度调研:7大平台爬虫神器
调研日期:2026-08-09
数据来源:GitHub API 实时拉取、官方 README、Issues、社区讨论,非纸面转载
一、起因
最近公众号上疯传一篇文章《这个开源爬虫工具,让我每月省下199元》,把 NanmiCoder/MediaCrawler 吹上了天。作为技术博主,我习惯先验证再转述。这篇文章我对项目做了深度实测调研,结论是:工具本身是真·神器,但文章有 3 个关键说法不实,商用需谨慎。
先放结论速览:
| 项目真实性 | ✅ 真实,GitHub 60,369 Stars(推文说 30K,实际更多) |
| 七大平台 | ✅ 小红书/抖音/快手/B站/微博/贴吧/知乎 全部验证属实 |
| 技术原理 | ✅ 基于 Playwright 浏览器自动化,无需 JS 逆向,属实 |
| 开源协议 | ❌ 不是 MIT 协议,是作者自定义的非商用学习许可 |
| 商用限制 | ❌ 禁止任何商业用途,与文章营销话术自相矛盾 |
| 实际使用门槛 | ⚠️ “扫码就能用” 夸大,需命令行 + Python 环境 |
二、项目概况
仓库地址 : https://github.com/NanmiCoder/MediaCrawler
Stars : 60,369
Forks : 11,852
Watchers : 240
创建时间 : 2023-06-09
最近提交 : 2026-08-05(快手限流退避重试修复)
主要语言 : Python 95.8% + TypeScript 4.2%
Python 要求 : >= 3.11
贡献者 : 80 人
文档站点 : https://nanmicoder.github.io/MediaCrawler/
核心结论:项目是真实存在的,而且活跃度极高。 从 2023 年创建至今持续更新,最近一次提交就在 4 天前。作者 NanmiCoder(程序员阿江)是专注爬虫技术的开发者,其爬虫教程仓库 CrawlerTutorial 同样有大量关注。
三、功能矩阵实测
项目声称支持 7 大平台共 7 项核心能力,我逐项与 README 核对:
| 关键词搜索 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| 指定帖子 ID 爬取 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| 二级评论 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| 指定创作者主页 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| 登录态缓存 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| IP 代理池 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| 评论词云图 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
数据存储支持:CSV / JSON / JSONL / Excel / SQLite / MySQL / PostgreSQL / MongoDB。
补充能力:项目还提供基于 WebUI 的可视化操作界面,支持参数可视化配置、实时日志、数据预览导出,并非纯命令行工具。
四、技术原理深度解读
这是 MediaCrawler 的核心亮点,也是它能在爬虫圈封神的根本原因:
1. 从"逆向 JS"到"调用 JS"
传统爬虫需要逆向加密算法(比如小红书 X-Bogus、xsec_token),门槛极高。MediaCrawler 的解法是:
Playwright 模拟浏览器 → 打开目标平台 → 浏览器内 JS 表达式获取签名参数
↓
httpx 请求带上签名 → 结构化数据入库
它不逆向你使用 window._webmsxyw 生成加密参数,而是直接调用浏览器运行时中的 JS 函数,一次性解决了签名难题。
2. CDP 模式复用真实登录
最新版默认使用 CDP(Chrome DevTools Protocol)模式连接你本机的 Chrome,复用浏览器现有的登录状态、Cookie、扩展,大幅降低平台风控检测的嫌疑。这就解释了为什么它被封的频率比传统 Selenium 方案低得多。
3. 反爬三维防护
- stealth.min.js 注入,伪装 headless 浏览器指纹
- webId Cookie 绕过滑块验证码
- 可选 IP 代理池(支持快代理等)
技术上,这确实是教科书级的爬虫工程实现,学习价值极高。
五、与公众号文章的 3 个关键差异点(重要)
差异一:协议不是 MIT!
公众号原文:“开源免费,MIT 协议。”
实际:项目 LICENSE 文件是自定义的 NON-COMMERCIAL LEARNING LICENSE 1.1(非商用学习许可),不是 OSI 认可的 MIT/Apache/GPL 等标准协议。关键条款:
翻译:仅限学习研究,禁止大规模爬取,任何商业用途(包括接单、为企业采集数据、运营自媒体数据)都需要作者书面同意,否则构成侵权。
差异二:“完全免费,省下 199 元” 不准确
开源版确实免费,但作者有 MediaCrawlerPro 付费版(断点续爬、多账号 + IP 代理池、去 Playwright 依赖、完整 Linux 支持、内容拆解 Agent),README 顶部还挂着多个赞助商广告位。也就是说:开源版是引流入口,核心高级能力都指向付费升级。这本身没问题——作者需要收入来维持开源项目持续更新——但公众号"0 元替代八爪鱼"的营销话术存在明显误导。
差异三:账号被永久封禁的风险真实存在
GitHub Issue #865 —— “现在小红书风控的力度好像加强了,账号给永久封禁了”。
打开 issues 会发现作者对这类问题直接关闭删除,标签就是「风控问题不处理」。意味着:
- 平台风控升级(比如小红书 AI 操作检测)会导致偶尔抽查到你
- 用自己主账号爬数据,存在永久封号风险
- 抖音同样存在"第一次采集正常,第二次就采集为空"的限流问题
建议:永远不要用主账号,用专门的小号 + IP 代理,控制并发频率。
六、项目质量评分
| 功能完整度 | ⭐⭐⭐⭐⭐ | 7 平台 × 7 功能全覆盖,业界罕见 |
| 易用性 | ⭐⭐⭐ | 比逆向友好 10 倍,但仍是命令行 + Python |
| 稳定性 | ⭐⭐⭐ | 随平台风控变化,需不断跟进修复 |
| 合规性 | ⭐⭐⭐ | 学习用途免费,商用需授权 |
| 宣传准确性 | ⭐⭐ | “MIT + 0元替代” 带货文案不严谨 |
七、结论与建议
适合人群:
- 想学爬虫/反爬技术的学生、开发者 —— 强烈推荐,架构让人眼前一亮
- 自媒体内容运营者 —— 用小号 + 低频率,做竞品分析、选题参考可接受
- 数据分析师 —— 小批量采集有用
不适合:
- 想用爬虫直接接单、做商业数据服务的人 —— 协议禁止 + 法律风险
- 完全零基础的小白 —— 至少要懂命令行
给你的真建议:把它当技术学习项目用是 100% 超值的;当"免费商业采集工具"是 100% 不可靠的。想在真实项目里上量,要么联系作者买 Pro/授权,要么评估 TikHub 等合规 API。
