ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

MediaCrawler 一条命令采集七大平台笔记与评论:完整使用指南

2026/8/30 10:05:15 拓冰建站 浏览量
MediaCrawler 一条命令采集七大平台笔记与评论:完整使用指南 MediaCrawler 一条命令采集七大平台笔记与评论完整使用指南【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawlerMediaCrawler 是一个开源的多平台媒体数据采集工具扫码登录一次就能把小红书、抖音、快手、B 站、微博、百度贴吧、知乎上的笔记/视频、正文和评论抓下来落到本地文件或数据库里适合不想自己写爬虫、又需要做社媒数据采集与竞品监控的人。为什么不用自己写相比手写爬虫或手动复制数据它有两个实在的区别不用逆向签名各平台接口请求里都带签名参数手写爬虫得逐个破解加密算法。它直接驱动你本地的 Chrome 浏览器Playwright 自动化 CDP 协议连接在保留登录态的真实环境里取数门槛低很多。一套代码管七个平台关键词搜索、按帖子 ID 抓取、创作者主页三种模式统一走一条命令登录态缓存下来扫过一次后面就不用再扫。三分钟跑通采集环境要求Python 3.10 以上依赖基于 3.11 验证、Node.js 16 以上抖音和知乎的签名依赖它、uvPython 依赖管理工具。装好后执行git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler cd MediaCrawler uv sync然后打开 config/base_config.py 通读一遍里面全是中文注释关键词、平台、抓不抓评论、数据存哪都由这个文件控制。能力全景能采什么、数据落到哪采集模式说明关键词搜索按关键词找笔记/视频抓正文加一级评论二级评论可开指定帖子贴帖子 ID 列表适合单条爆款定向抓取创作者主页抓指定创作者的全部内容与数据媒体资源可额外下载帖子图片/视频默认关闭评论词云抓完生成一张评论词云图默认关闭数据落点由SAVE_DATA_OPTION开关选择保存方式数据去哪适合场景jsonl默认/ json / csvdata/目录随手查看、脚本加工exceldata/目录多工作表带格式直接在 Excel 里分析SQLite / MySQL / PostgreSQL数据库数据量大且写入自带去重docs/data_storage_guide.md 里有建库和字段细节。不想敲命令的话还有webui/可视化界面选参数、看日志都在网页上完成。实战抓小红书一个关键词下的笔记和评论以采集 30 条笔记及其评论为例在 config/base_config.py 里把KEYWORDS改成咖啡店推荐多个词用英文逗号隔开CRAWLER_MAX_NOTES_COUNT改成 30。确认ENABLE_GET_COMMENTS True默认就是开的。执行采集命令uv run main.py --platform xhs --lt qrcode --type search弹二维码时用手机端小红书扫码首次成功后登录态会缓存。跑完到data/xhs/目录看结果笔记、评论、创作者各是一个文件。进阶调优代理、限速、去重、解析限速MAX_CONCURRENCY_NUM管并发数CRAWLER_MAX_NOTES_COUNT管单次抓取量前期都建议调小。代理池打开ENABLE_IP_PROXYIP_PROXY_PROVIDER_NAME可选 kuaidaili、wandouhttp 或 static自备代理直接填STATIC_PROXY_URL配置流程见 docs/代理使用.md。去重存储切到数据库后重复抓取不会产生重复记录。自定义解析每个平台的代码都在media_platform/各自目录里client.py 负责取数、core.py 负责流程平台字段变化时能直接定位修改。![MediaCrawler 数据采集代理 IP 池流程图](https://raw.gitcode.com/GitHub_Trending/me/MediaCrawler/raw/5665a271ef15e0ec82b1f48a951b66760e054db9/docs/static/images/代理IP 流程图.drawio.png?utm_sourcegitcode_repo_files)避坑手册现象原因解决小红书扫码成功但滑块一直失败平台风控判定环境异常用默认 CDP 模式连接自己常用的 Chrome仍失败就删掉brower_data重新登录跑抖音/知乎报 缺少 ;没装 Node.js安装 Node.js 16 及以上版本开始能抓过段时间没数据了账号触发风控降并发和频率、删brower_data换号或挂上代理池更多情况可翻 docs/常见问题.md。谁适合用内容运营 / 自媒体盯竞品的更新节奏追热点选题产品 / 运营调研抓特定帖子下的评论看用户真实反馈数据与算法同学攒数据集做词频统计、话题分析爬虫学习者读源码看浏览器自动化和多平台适配怎么做先把一个关键词、默认 15 条笔记的流程完整跑通再慢慢加量规模以学习研究为度就够了。【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考