资讯动态

告别手动复制:MediaCrawler-new 轻松自动化采集小红书、抖音、B站等五大平台数据

发布时间:2026/8/20 16:08:33 来源:尧图企业网站定制
告别手动复制MediaCrawler-new 轻松自动化采集小红书、抖音、B站等五大平台数据【免费下载链接】MediaCrawler-new项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler-new凌晨两点你还在对着浏览器手动复制粘贴——一篇笔记的标题、点赞数评论区一条条留言挨个选中、复制、再粘进 Excel。十分钟才搞定一篇而你需要的是几百篇。这样的夜晚你是不是也经历过如果你想把小红书、抖音、快手、B站、微博的数据批量拿到手MediaCrawler-new就是那个能把你从复制粘贴里解放出来的工具它用 playwright 模拟真实浏览器登录一次配置即可自动抓取五大平台的视频、图片、评论、点赞和转发数据。接下来我会带你从零跑通第一个任务全程不超过 5 分钟。手动收集 vs 自动化采集差距有多大先看一组直观对比维度手动收集MediaCrawler-new采集 100 篇笔记数据数小时起步十几分钟自动跑完是否担心出错复制错行是常态字段由程序统一解析反爬应对封 IP 只能干瞪眼内置代理 IP 池自动轮换登录体验每次都要重新扫码登录状态自动缓存下次免登录看到区别了吗它把体力活变成了等结果。更关键的是五个平台共用同一套操作逻辑学会一个处处可用。5 分钟跑通你的第一个采集任务别被爬虫两个字吓到上手难度比想象中低得多你只需要四步第一步克隆项目并安装依赖# 克隆项目到本地 git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler-new cd MediaCrawler-new # 创建并激活虚拟环境Linux/Mac python -m venv venv source venv/bin/activate # 安装依赖 浏览器驱动 pip install -r requirements.txt playwright install第二步打开config/base_config.py改三个参数PLATFORM xhs # 想爬哪个平台xhs | dy | ks | bili | wb KEYWORDS python,数据分析 # 要搜索的关键词逗号分隔 LOGIN_TYPE qrcode # 登录方式qrcode | phone | cookie第三步运行爬虫python main.py --platform xhs --lt qrcode --type search程序会自动打开浏览器并弹出二维码掏出手机上的小红书 App 扫一扫。登录成功的瞬间采集就自动开始了——搜索关键词相关的笔记信息会一条条被收进data/目录。第四步查看成果。默认数据以 JSON 格式保存每篇笔记的标题、正文、点赞数、评论一目了然。想换格式把SAVE_DATA_OPTION改成csv或db就行。从装环境到拿到第一批数据多数人 5 分钟以内就能完成。是不是比你想象中简单如果你想做这些事它都接得住这套框架不是冷冰冰的功能列表而是一连串你想做的事追踪某个领域的热门内容把关键词设为粉底液,遮瑕膏,口红跑一次搜索小红书上的相关笔记与评论尽收囊中做竞品分析再也不用一条条刷。深挖指定作品的全部数据把帖子或视频 ID 填进XHS_SPECIFIED_ID_LIST命令改成--type detail就能拿到这篇内容的完整详情与互动数据。分析某个创作者的内容风格小红书支持指定创作者主页采集把作者 ID 填入XHS_CREATOR_ID_LIST发布规律、内容偏好轻松摸清。批量下载 B 站视频把 BV 号填进BILI_SPECIFIED_ID_LIST配合--type video_download收藏夹里的教学视频一键批量落地。把评论一起带走默认不采集评论需要时在配置里把ENABLE_GET_COMMENTS设为True互动数据立刻补全。每个平台的玩法略有差异比如抖音多了滑块验证码处理、B站支持视频下载但核心套路完全一致学会一个就等于会了五个。它凭什么能绕过平台的反爬机制你可能会好奇同样是抓数据为什么 MediaCrawler-new 更稳关键在于它的设计思路不逆向加密算法而是让浏览器自己干活。它借助 playwright 打开一个真实的浏览器环境等你扫码登录后把登录上下文完整保存下来后续需要加密参数时直接在页面里执行 JS 表达式获取。相当于你在前台正常操作它在后台悄悄记录并复用——绕开了最烧脑的逆向环节难度自然直线下降。再配合内置的 IP 代理池进一步降低被封的风险。所谓拉取 IP就是在代理服务商的提取页面生成一个 API 链接把一批代理地址批量领回来领回来的 IP 会按下面的流程统一管理从服务商拉取 → 存入 Redis 缓存 → 建池 → 爬虫按需取用。形象点说它像一个随时换装出门的访客每次访问都换一个身份平台很难盯住同一个来源![MediaCrawler-new代理IP池工作流程图](https://raw.gitcode.com/GitHub_Trending/me/MediaCrawler-new/raw/387f08701788e8e626b688ecf6ef50f669a80b75/static/images/代理IP 流程图.drawio.png?utm_sourcegitcode_repo_files)避坑手册这些坑我先替你踩过了坑一报错缺少 ;。症状是抖音爬取时直接抛 SyntaxError原因多半是本机缺少 Node.js 环境。解法安装Node.js v16.8.0或更高版本这是 playwright 正常工作的大前提。坑二Timeout 30000ms exceeded。症状是请求超时多半是你的网络访问不了目标平台检查一下代理设置和网络连通性。坑三爬着爬着突然没数据了。大概率是账号触发了平台风控。建议控制采集频率必要时停一停再继续别把账号薅没了。坑四想换账号却发现一直沿用旧身份。删掉项目根目录下的brower_data/文件夹重新扫码登录即可。坑五二维码一直登录不通过。把配置里的HEADLESS改为False打开浏览器手动过一下滑动验证码再回来继续。想要更稳定按你的使用强度升级轻度用户偶尔抓几个关键词默认配置就够用2-3 个代理 IP不开代理也基本能跑。中度用户定期采集、量级中等打开代理开关5-10 个代理 IP 轮换数据建议落到 MySQL 或 PostgreSQL查询分析更方便。重度用户规模化采集代理 IP 提到 10 个以上优先选住宅代理避开平台高峰时段配合无头浏览器模式降低资源占用。另外提醒一句代理密钥这类敏感信息记得通过环境变量注入别硬编码进代码里更完整的参数说明可以翻翻项目里的 docs/常见问题.md 和 docs/项目代码结构.md基本能覆盖你 90% 的疑惑。现在轮到你了回到开头那个凌晨两点还在手动复制的研究生——现在的他日常是这样的晚上把关键词填进配置运行命令扫码登录第二天早上打开data/目录几百条结构化数据整整齐齐躺在里面。省下来的时间全用来分析而不是复制粘贴。你也可以做到只要三步克隆项目、安装依赖约 3 分钟改好base_config.py里的三个参数约 1 分钟扫码登录跑完第一个任务约 1 分钟从零到拿到第一批数据一集综艺的时间都用不上。不过在动手之前请记住技术只是工具请尊重各平台的使用规则只采集公开数据仅用于合法的学习与研究用途。用好它让数据为你工作而不是让你为数据熬夜。【免费下载链接】MediaCrawler-new项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler-new创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价