NanmiCoder

@NanmiCoder

MediaCrawler

NanmiCoder/MediaCrawler

小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 | 评论爬虫、微博帖子 | 评论爬虫、百度贴吧帖子 | 百度贴吧评论回复爬虫 | 知乎问答文章|评论爬虫

STARS59,639
FORKS11,741
ISSUES184
LANGUAGEPython

HISTORICAL INTELLIGENCE

历史情报摘要

按周期独立统计
日榜当前未记录
历史最佳#5最近排名#12

当前未进入本站记录范围

记录天数
2 天
记录期 Star
+945
本站共 12 天日榜快照 · 最近记录 2026-07-29
本站最早记录:2026-07-27

指标仅基于本站已保存快照,不代表项目在 GitHub 的首次上榜时间;同日多次抓取保留当日最新结果,负向 Star 差值按样本校正处理。

日榜历史趋势

2026-07-27 至 2026-07-29,掉榜日期保留为空缺。

排名,数字越小越靠前当日新增 Star
折线表示历史榜单排名,柱形表示相同快照记录的新增 Star。排名纵轴已反向,越靠上排名越高。 #1 #4 #7 #9 #12 2026-07-27:新增 349 Star 2026-07-29:新增 187 Star 2026-07-27:排名 #5,新增 349 Star2026-07-29:排名 #12,新增 187 Star 07-27 07-29 +349
图表仅使用本站保存的快照,不补零、不推算掉榜期间数据;下方历史明细继续保留原始日期、排名与 Star 数。

VERIFIABLE HEALTH SIGNALS

项目健康证据

维护、响应、交付与采用风险分开观察,不生成虚假的单一总分。
高可信度
MAINTENANCE

维护活性

核对提交
近 90 天 Commit
34
完整窗口
活跃贡献者
8
按公开提交账号去重
近 12 月活跃月份
12/12
有提交的自然月
RESPONSE

社区响应

核对样本
Issue 关闭率
50%
13/26 个同期新 Issue
Issue 关闭中位数
20 小时
仅统计已关闭样本
PR 合并率
22%
7/32 个同期新 PR
PR 合并中位数
8.9 天
仅统计已合并样本
DELIVERY

持续交付

核对发布
近 12 月正式 Release
0
排除草稿与预发布
最近正式 Release
暂无记录
以公开发布时间为准
发布间隔中位数
样本不足
至少两次正式发布才计算
ADOPTION

采用风险

查看仓库
仓库状态
正常开放
未发现归档标记
开源协议
未识别
仍需核对完整协议与依赖
Security Policy
未发现
仅检查 GitHub 社区资料

统计窗口 90 天快照样本 2 天计算规则 health-v1采集于 2026-08-03 07:40

公开样本完整,Issue 与 PR 合计样本量达到基本观察门槛。 这些信号不替代代码审计、安全测试和真实生产验证。

AI-ASSISTED PROJECT BRIEF

项目定位与辅助解读

来源边界与风险表述检查

AI 解读仅作初评参考,技术落地请以 GitHub 源码、README 和完整协议为准。

项目资料AI 整理

MediaCrawler 是一款基于 Playwright 的多平台社交媒体爬虫,支持小红书、抖音、B站等 7 个平台,利用浏览器登录态简化爬取过程。

MediaCrawler 是一个开源的多平台自媒体数据采集工具,基于 Python 和 Playwright 实现。它通过复用浏览器登录态(CDP 模式)绕过复杂的 JS 逆向,降低技术门槛。项目目前支持小红书、抖音、快手、B 站、微博、百度贴吧和知乎七家主流平台,提供关键词搜索、指定帖子爬取、二级评论、创作者主页数据采集等功能。同时支持 IP 代理池和登录态缓存,并有 WebUI 可视化界面。项目方提供了 Pro 版本(付费)用于更高级功能。

核心亮点

项目最值得关注的能力

AI 推断
  • 无需 JS 逆向,通过 Playwright 复用浏览器登录态实现数据采集
  • 覆盖 7 个主流中文社交平台(小红书、抖音、快手、B 站、微博、贴吧、知乎)
  • 支持关键词搜索、指定帖子/评论爬取、创作者主页采集等多种模式
  • 附带 WebUI 可视化界面,降低使用门槛

适用场景

它可以解决哪些实际问题

AI 推断
  • 社交媒体内容分析与舆情监控(从公开资料看)
  • 个人或小团队的数据收集与学术研究(需遵守平台规则)
  • 学习 Playwright 与爬虫技术架构的参考项目

技术观察

从公开资料提炼的实现特征

AI 推断
  • 基于 Playwright 浏览器自动化,通过 CDP 模式连接本地 Chrome 实例复用登录态
  • 使用 uv 作为 Python 包管理器,支持快速依赖安装
  • 支持 IP 代理池配置,降低 IP 封禁风险(项目方自述)
  • WebUI 基于 FastAPI + Vite 构建,提供前后端分离的交互界面

优势判断

相对明确的项目价值

AI 推断
  • 多平台统一框架,减少重复开发工作
  • 通过浏览器复用登录态,降低平台反爬检测概率
  • 活跃的开源社区,Stars 近 6 万,问题响应较快

局限与注意

评估和采用前需要留意

AI 推断
  • 依赖本地 Chrome 或 Playwright 浏览器驱动,无法完全无头运行
  • 爬取行为可能违反平台服务条款,需自行评估合规风险(项目方已附免责声明)
  • 高级功能(如断点续爬、多账号)需付费 Pro 版本

适用人群

哪些开发者和团队值得关注

AI 推断
  • 对社交媒体数据采集感兴趣的开发者和研究人员
  • 需要快速搭建多平台爬虫脚本的工程师
  • 学习 Playwright 和爬虫架构的技术爱好者
综合参考
MediaCrawler 是一个功能全面、技术门槛较低的多平台爬虫工具,适合学习和非商业性数据采集。其利用浏览器登录态的设计思路值得借鉴,但用户需自行评估合规性与稳定性,注意遵守相关平台规则。
由 AI 基于 GitHub 公开资料辅助生成,不构成安全审计、生产选型或专业建议。

依据与内容边界

区分可验证事实、项目方自述与 AI 推断

GitHub 可验证事实

Star、Fork、License、更新时间及健康证据样本来自 GitHub 公开接口。

项目方自述

功能与使用方式主要来自仓库描述和 README,未经本站独立验证。

AI 推断

适用场景、优势与局限属于辅助解读,应结合原始文档独立判断。

  • GitHub事实:该仓库拥有 59404 Stars 和 11709 Forks,Open Issues 186,语言为 Python,Topics 包括多个平台关键词。
  • 项目方自述:基于 Playwright 浏览器自动化框架登录保存登录态,无需 JS 逆向,支持 CDP 模式。
  • AI推断:从高 Star 数和活跃的 Issues 来看,项目社区关注度高,但 186 个未关闭问题可能表明存在一些待解决的维护项。
生成于 2026-07-30 19:15 规则版本 2026-07-v3
内容有误或您是项目作者?提交纠错
仅保存处理所需内容,不记录原始 IP;可信项目作者的高风险申诉会优先处理。