支持小红书、抖音、快手、B站、微博等平台的自媒体数据爬虫工具。

所在地:
美国
语言:
en
收录时间:
2026-08-27
MediaCrawlerMediaCrawler

项目定位

MediaCrawler 是一个面向自媒体从业者、市场研究人员与数据分析师的开源数据采集工具。它通过模拟用户行为与接口调用,实现对多个主流内容平台公开数据的结构化抓取,解决多平台数据分散、格式不统一的问题。

支持的平台

目前项目覆盖以下平台:

平台 可采集内容
小红书 笔记、评论、用户主页
抖音 视频、评论、用户信息
快手 视频、评论
B站 视频、弹幕、评论、用户数据
微博 博文、评论、用户信息

核心功能

  • 多平台统一接口:不同平台的数据通过一致的调用方式获取,降低接入成本
  • 关键词搜索采集:按关键词抓取相关笔记、视频或博文,适合舆情分析与竞品调研
  • 评论与弹幕抓取:支持对指定内容下的用户评论、弹幕进行批量采集
  • 用户主页数据:可获取指定用户的基础信息及其发布内容列表
  • 数据持久化:采集结果支持导出为 JSON、CSV 等常见格式,便于后续分析

技术特点

项目基于 Python 开发,主要依赖 Playwright 进行浏览器自动化操作,部分场景下直接调用平台接口以提升效率。代码结构按平台模块划分,各平台采集逻辑相对独立,便于按需扩展或单独调试。

使用方式

  1. 安装 Python 3.9 及以上版本
  2. 克隆项目并安装依赖
  3. 配置对应平台的登录 Cookie(部分平台需要)
  4. 按需修改配置文件中的关键词与采集参数
  5. 运行对应平台的采集脚本

适用场景

  • 竞品内容策略分析
  • 品牌舆情监测
  • 行业趋势研究
  • 学术数据采集(需遵守平台服务条款)

注意事项

使用前应确认目标平台的用户协议与 robots 规则。建议合理控制请求频率,避免对目标站点造成压力。项目仅供学习与技术研究使用,使用者需自行承担合规责任。

相关导航