
MediaCrawler 多平台爬虫教程5 分钟跑通小红书、抖音、B 站数据采集【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler想批量拿到小红书、抖音、B 站上的笔记、视频和评论手动复制根本做不完MediaCrawler 就是干这个的——一个开源的多平台数据采集工具覆盖小红书、抖音、快手、B 站、微博、百度贴吧、知乎七个平台内容和评论一次采集全落盘。中断能续爬Windows、Linux 都能跑采集到一半断了它会从断点接着抓已采过的不重复跑。有多个账号时可以轮流切换分散压力。新版还把对浏览器自动化组件的依赖去掉了体积更轻Linux 上和 Windows 一样好使。5 分钟完成首次运行克隆仓库、装依赖两步就好git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler cd MediaCrawler pip install -r requirements.txt然后改一处配置默认项都集中在 config/base_config.py把PLATFORM改成目标平台比如 xhsKEYWORDS填上你的关键词CRAWLER_TYPE保持 search。回到终端敲python main.py首次会弹浏览器手机扫码登录后就开始自动采集了。两种最高频的用法按关键词采集——最常用的场景。KEYWORDS支持英文逗号分隔多个词工具会逐个搜索把该关键词下的笔记、视频、评论全部落盘。按用户主页采集——把CRAWLER_TYPE改成 creator再给一个用户 ID这个人的主页内容就一次性拿到想抓单篇帖子及其评论区就用 detail 模式贴一条链接。快手、微博、贴吧、知乎都是同一套玩法换个PLATFORM和对应的 config/ 文件就行。排坑指南被限流、数据找不到时怎么办采集频繁中断、疑似被风控上代理 IP。在基础配置里开启ENABLE_IP_PROXY再从 proxy/ 选一个提供商快代理、豌豆 HTTP 或自己的静态代理。原理不复杂从代理商拉 IP、存入 Redis、组成 IP 池每次请求从池里取一个用。采完的数据不知道去哪 / 想直接分析存储方式可切换——落盘文本文件、写入数据库MySQL、MongoDB、SQLite 均可、或直接导出 Excel细节看 docs/data_storage_guide.md。不确定程序是否在正常工作终端会滚动打印日志每行带平台、内容 ID 和标题卡住就看最后一条报错。扫码登录一直过不了把HEADLESS设为 False 弹出浏览器手动过一遍滑块再试。其他报错先翻 docs/常见问题.md命中率高。一句话改一处配置跑一行命令多平台数据就到手了。CDP 模式、词云等进阶玩法去 docs/ 目录里找。【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考