ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

一个开源爬虫框架,让小红书、抖音、B站等五大平台数据采集一学就会

2026/8/19 13:40:32 拓冰建站 浏览量
一个开源爬虫框架,让小红书、抖音、B站等五大平台数据采集一学就会 一个开源爬虫框架让小红书、抖音、B站等五大平台数据采集一学就会【免费下载链接】MediaCrawler-new项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler-new如果你还在用复制-粘贴-整理三件套处理社交媒体数据那么接下来的几分钟可能会帮你打开新世界的大门。MediaCrawler-new是一个基于 playwright 的 Python 开源爬虫框架一套代码同时覆盖小红书、抖音、快手、B站、微博五大平台支持关键词搜索、指定内容采集、评论抓取、代理IP轮换等能力最难得的是——它把上手门槛压到了新手十分钟跑通第一个任务的程度。为什么说手动采集社交数据是一条死路先聊一个很现实的问题为什么越来越多的人开始找工具代替手动采集答案藏在数据量里。做市场调研要分析几百条评价做内容运营要追热点话题做学术研究要汇总大量公开讨论——这些需求一旦超过几十条的量级手动操作就会彻底失控效率低一条一条复制、粘贴、归档一个小时可能只处理几十条易出错人工整理极易遗漏字段、混淆平台、弄丢格式风险高自己写脚本硬爬很容易被平台的反爬机制识别账号直接进小黑屋成本大每个平台的接口规则、加密参数、登录流程都不一样从零开发维护成本极高而市面上又几乎没有一套能同时覆盖多平台、还支持无头浏览器 登录态缓存 代理IP池的方案。这就是 MediaCrawler-new 存在的理由。一张能力清单看懂 MediaCrawler-new 能做什么MediaCrawler-new 的核心思路很有意思它不逆向平台的加密 JS 代码而是借助 playwright 模拟真实浏览器保留登录成功后的上下文环境再通过执行 JS 表达式拿到必要参数。这条路绕开了最难的逆向环节稳定性也大幅提升。五个平台的能力差异看这张表就一目了然平台Cookie 登录二维码登录指定创作者主页关键词搜索指定帖子/视频ID爬取登录状态缓存数据保存IP代理池滑块验证码小红书✅✅✅✅✅✅✅✅✕抖音✅✅✕✅✅✅✅✅✅快手✅✅✕✅✅✅✅✅✕B站✅✅✕✅✅✅✅✅✕微博✅✅✕✅✅✅✅✅✕除了表格里的常规项还有两个容易被忽略的亮点评论抓取默认不开启在配置文件中打开开关即可连评论一起采集对舆情分析、用户反馈研究特别有用B站视频下载video_download类型的爬取任务目前只支持 B 站内容创作者可以批量拉取视频做离线分析十分钟从零搭好运行环境上手前先做三件事装环境、装依赖、装浏览器驱动。整个过程纯命令行跟着敲就行git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler-new cd MediaCrawler-new # 创建并激活 Python 虚拟环境 python -m venv venv source venv/bin/activate # 安装依赖库 pip install -r requirements.txt # 安装 playwright 浏览器驱动 playwright install⚠️ 一个小提醒如果在爬抖音时报错缺少 ;说明机器上缺少 Node.js 环境安装v16.8.0 及以上版本即可解决。这是 playwright 正常运行的前提。写配置、跑命令五分钟搞定第一个采集任务安装完成后所有采集策略都集中在一个文件里config/base_config.py。它就像整个框架的总开关改几行就能换平台、换关键词、换抓取方式PLATFORM xhs # 平台xhs | dy | ks | bili | wb KEYWORDS python,数据分析 # 搜索关键词 LOGIN_TYPE qrcode # 登录方式qrcode | phone | cookie CRAWLER_TYPE search # 任务类型search | detail | creator | video_download SAVE_DATA_OPTION json # 数据保存csv | db | json ENABLE_GET_COMMENTS False # 是否连评论一起抓 CRAWLER_MAX_NOTES_COUNT 20 # 单次采集数量上限 MAX_CONCURRENCY_NUM 4 # 并发数配置就绪后用一行命令启动任务# 关键词搜索抓取小红书上和python相关的帖子 python main.py --platform xhs --lt qrcode --type search # 指定帖子ID抓取指定笔记的详细信息与评论 python main.py --platform xhs --lt qrcode --type detail # 换平台、换方式同理例如抖音 python main.py --platform dy --lt qrcode --type search任务类型共有四种search关键词搜索、detail指定帖子/视频详情、creator创作者主页数据、video_download视频下载仅限 B 站。记不清参数时随时敲python main.py --help查看。三种登录方式按需自取MediaCrawler-new 内置了三条登录路径覆盖不同场景二维码登录最推荐的方式。程序会自动打开浏览器弹出二维码手机 APP 扫码即过安全又省事手机号登录需要接收短信验证码适合要长期稳定跑采集任务的场景具体流程可参考项目内的 手机号登录说明Cookie 登录直接粘贴已有 Cookie免去重复登录适合已经登录过的老用户快速恢复状态更贴心的是登录状态默认会被缓存下来SAVE_LOGIN_STATE True下次启动不用重新登录。想换账号时删掉项目根目录下的brower_data/文件夹即可。如果遇到小红书反复扫码不通过可以把配置里的HEADLESS改成False手动打开浏览器过一下滑动验证码——这个技巧很实用。代理IP池与数据存储稳定和安全的双保险采集量一大账号被风控的风险就会直线上升。MediaCrawler-new 内置的代理IP池系统就是专门解决这个问题的![MediaCrawler-new代理IP池配置流程图](https://raw.gitcode.com/GitHub_Trending/me/MediaCrawler-new/raw/387f08701788e8e626b688ecf6ef50f669a80b75/static/images/代理IP 流程图.drawio.png?utm_sourcegitcode_repo_files)整个流程清晰且自动化从代理网站拉取 IP → 存入 Redis 缓存 → 创建 IP 代理池 → 按需分配可用 IP 给爬虫使用。你只需要在配置里打开开关、设定池子大小ENABLE_IP_PROXY True IP_PROXY_PROXY_POOL_COUNT 2IP 轮换、可用性检查这些脏活累活框架都替你包了。想深入了解代理模块的实现可以翻一翻 proxy/ 目录。至于采集结果存哪里项目给了三个选项对应SAVE_DATA_OPTION一个参数csv导出到 data/ 目录Excel 直接打开适合快速查看json保留完整结构化数据适合程序化二次处理db写入 MySQL、PostgreSQL 等关系型数据库适合海量数据与复杂查询配置见 config/db_config.py高频报错自救手册再顺手的工具也会遇到环境问题以下是社区里出现频率最高的几个坑和对应解法报错或现象原因解决办法缺少 ;的 JS 报错缺少 Node.js 环境安装 Node.js v16.8.0 及以上Timeout 30000ms exceeded网络无法访问目标平台检查网络连接或代理设置刚开始能爬后来频繁失效账号触发平台风控降低采集频率别大规模爬取登录状态异常浏览器缓存脏了删除brower_data/目录后重新登录更多细节都整理在项目的 常见问题文档 里遇到问题先去翻一翻八成能找到答案。这些真实场景它都能派上用场市场调研与竞品分析化妆品公司想了解小红书上热门美妆评价把关键词设成粉底液,遮瑕膏,口红开启评论采集跑一轮下来就能得到一批真实的用户反馈样本用于分析偏好、发现趋势。内容创作选题优化抖音创作者想知道什么内容更受欢迎按领域关键词采集视频数据分析点赞、评论、转发分布用数据反哺选题和内容策略。学术研究数据支持研究者可以把公开讨论数据批量归档分析舆情走向、传播模式、用户行为为理论模型提供实证支撑。写在最后社交媒体数据采集不该是一件靠体力硬扛的事。MediaCrawler-new 把多平台适配、登录、反爬、存储这些最麻烦的环节都封装好了你要做的只是改改配置、跑条命令。项目整体采用模块化设计media_platform/ 下每个平台都是独立实现想扩展新平台也有清晰的接口规范可以参考。现在就可以动手克隆仓库 → 按上文三步搭好环境 → 改一行PLATFORM→ 跑起你的第一个采集任务。从想想都很麻烦到数据已经到手中间只差一次尝试。最后必须强调请遵守各平台的使用规则与相关法律法规仅采集公开数据控制采集频率不用于任何商业或非法用途。技术本身没有立场如何合理地使用它取决于我们自己。尊重数据隐私才能让数据采集这条路走得更远。【免费下载链接】MediaCrawler-new项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler-new创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考