
鱼C工作室
专注编程教育的平台,提供免费视频教程、原创书籍和AI助理,让零基础学习编程更简单有趣。
MediaCrawler 是一个面向自媒体从业者、市场研究人员与数据分析师的开源数据采集工具。它通过模拟用户行为与接口调用,实现对多个主流内容平台公开数据的结构化抓取,解决多平台数据分散、格式不统一的问题。
目前项目覆盖以下平台:
| 平台 | 可采集内容 |
|---|---|
| 小红书 | 笔记、评论、用户主页 |
| 抖音 | 视频、评论、用户信息 |
| 快手 | 视频、评论 |
| B站 | 视频、弹幕、评论、用户数据 |
| 微博 | 博文、评论、用户信息 |
项目基于 Python 开发,主要依赖 Playwright 进行浏览器自动化操作,部分场景下直接调用平台接口以提升效率。代码结构按平台模块划分,各平台采集逻辑相对独立,便于按需扩展或单独调试。
使用前应确认目标平台的用户协议与 robots 规则。建议合理控制请求频率,避免对目标站点造成压力。项目仅供学习与技术研究使用,使用者需自行承担合规责任。







