资讯动态

零基础 30 分钟跑通:MediaCrawler 多平台数据采集完整上手指南

发布时间:2026/8/15 16:15:18 来源:尧图企业网站定制
零基础 30 分钟跑通MediaCrawler 多平台数据采集完整上手指南【免费下载链接】MediaCrawler-new项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler-new你不需要会逆向、也不需要从零写爬虫只要照着这篇指南一步步来用 MediaCrawler 这个免费开源的多平台数据采集工具最快半小时就能把小红书、抖音、快手、B站、微博上的关键词内容、帖子详情和评论批量抓下来存成 Excel 能直接打开的表格。全程有扫码登录兜底代码层面基本不用动脑。一、先聊聊你的真实需求手动翻页截图真的够用吗假设你正在给公司做竞品调研想统计某个品类在小红书上的热门内容或者你在运营自己的账号想研究同行的爆款选题有什么规律。一开始你可能习惯手动翻几页、截个图、复制进表格做二三十条还能忍做到两三百条就崩溃了——翻页翻到手酸数据还会漏更别提把评论一起收集下来。数据这东西零散着看没意义成批量拿到手才叫资产。而批量采集正是 MediaCrawler 的主场一个开源工具一个项目覆盖五个主流平台能抓帖子、视频、评论、点赞、转发等完整信息。最关键的是它用 Playwright 模拟真实浏览器去操作页面绕过了新手最怕的逆向加密算法环节把门槛从编程高手直接拉低到会用手机扫码。二、把项目请回家四条命令完成环境准备老规矩先把项目拿到本地。在你的终端里执行git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler-new cd MediaCrawler-new然后建一个独立的虚拟环境。你可以把虚拟环境理解成给这个项目安排的一间独立小房间——里面装的 Python 版本和依赖互不打扰不会污染你电脑上其他项目。python -m venv venv # Linux / Mac 激活 source venv/bin/activate # Windows 激活 venv\Scripts\activate接着安装依赖和浏览器驱动两条命令搞定pip install -r requirements.txt playwright install到这里环境就绪了。别小看最后那条playwright install它是爬虫能假装成真人浏览器的关键漏掉它后面会报各种莫名其妙的错。三、第一次跑通改两个配置搜出第一批小红书数据现在进入最激动人心的部分——拿到第一批数据。打开config/base_config.py你只需要关心几个值PLATFORM xhs # xhs | dy | ks | bili | wb KEYWORDS python,golang # 想搜什么就写什么逗号分隔 LOGIN_TYPE qrcode # qrcode | phone | cookie保存后运行python main.py --platform xhs --lt qrcode --type search程序会弹出一个真实浏览器窗口并显示二维码拿出手机小红书 App 扫码确认登录爬虫就自动开工了。跑完之后打开项目里的data/目录你会看到按时间命名的 JSON 文件里面就是带完整字段的帖子数据——标题、链接、点赞数、收藏数、发布时间全都齐了。这一趟下来你会发现所谓数据采集在配置层面其实就三步——选平台、填关键词、扫码登录。剩下的事情交给工具。四、登录不止一种姿势二维码、手机号、Cookie 怎么选第一次用扫码是因为它最省事但用得久了你会遇到更多场景登录方式也得跟着切换二维码登录qrcode日常首选安全又方便适合第一次上手。手机号登录phone支持短信验证码配合短信转发器可以实现无人值守。Cookie 登录cookie如果你手里已经有登录态的 Cookie直接在COOKIES里填进去秒进适合批量跑多个账号的场景。还有个特别贴心的设计登录状态会自动缓存到项目的browser_data目录。就像门禁卡被记住了下次启动不用再扫码直接延续上次的登录态。这也是为什么很多老手喜欢把它挂上定时任务长期跑数据。想切平台也简单把--platform换成dy、ks、bili、wb就行其他命令完全一样。五、从能搜到会挖按 ID 精爬、爬博主主页、连评论一起抓关键词搜索只是入门MediaCrawler 真正顺手的是精准挖取。按指定 ID 爬取detail你在平台上看到一个感兴趣的帖子或视频把它的 ID 填进XHS_SPECIFIED_ID_LIST、DY_SPECIFIED_ID_LIST这类列表就能单点抓取这条内容连评论区一起端走。爬博主主页creator想研究某个博主的全部作品把创作者 ID 填进XHS_CREATOR_ID_LIST一键拉全量主页数据。连评论一起抓默认不抓评论在配置里把ENABLE_GET_COMMENTS True打开评论数据就会一起入库。再配合CRAWLER_MAX_NOTES_COUNT控制单次爬取条数你就能把浅尝辄止和深度挖掘两种模式自由切换。六、数据存到哪JSON、CSV、数据库三选一辛辛苦苦抓下来的数据得找个好归宿。SAVE_DATA_OPTION给你三个选项json默认选项字段结构完整适合写代码做后续分析。csvExcel 双击就能打开运营同学最爱做报表、做透视都方便。db写入关系型数据库MySQL、PgSQL 等数据库连接信息在config/db_config.py里配置适合数据量大到需要用 SQL 查的场景。一个直观的类比JSON 像整箱货物格式严谨适合机器搬运CSV 像一张表格纸人眼看起来最舒服数据库像大仓库量大之后只有它能装得下。七、跑得稳不被封代理IP池和并发控制的正确打开方式数据量一旦上来就该考虑生存问题了。同一台机器、同一个 IP 高频请求很容易被平台的风控盯上。MediaCrawler 内置的代理IP池就是为此准备的从代理服务商拉一批 IP 存进 Redis用的时候按需取用、过期自动淘汰。![MediaCrawler 数据采集代理IP池管理流程图](https://raw.gitcode.com/GitHub_Trending/me/MediaCrawler-new/raw/387f08701788e8e626b688ecf6ef50f669a80b75/static/images/代理IP 流程图.drawio.png?utm_sourcegitcode_repo_files)开启方式在配置里就两行ENABLE_IP_PROXY True IP_PROXY_POOL_COUNT 5IP 从哪来项目默认对接了极速 HTTP 这类代理服务商你需要在它的后台申请提取 key 和加密签名然后在代理服务商界面选择 IP 时长、协议、地区生成专属的提取链接拿到 key 之后通过环境变量喂给程序密钥就不会硬编码在代码里安全性和可维护性都好很多jisu_key os.getenv(jisu_key, ) jisu_crypto os.getenv(jisu_crypto, )与此同时MAX_CONCURRENCY_NUM控制并发数HEADLESS控制是否无头运行。给你一个经验值轻度使用 2~3 个代理够用中度 5~10 个重度就上 10 个以上。并发也别贪多默认 4 就很稳盲目调高反而容易触发风控。八、新手最容易踩的四个坑提前帮你排掉我见过不少朋友卡在同一个地方提前说清楚能省下大把时间扫码一直失败先检查网络再清掉browser_data/目录重新登录实在不行就换手机号或 Cookie 方式。卡在滑动验证码把HEADLESS设为False让浏览器窗口弹出来手动拖一次滑块再继续基本就过了。数据抓不全检查CRAWLER_MAX_NOTES_COUNT是不是设得太小再确认网络是否稳定。跑得太慢适当提高并发数、开启代理IP池别在平台流量高峰时段跑。更多细节在项目的 docs/常见问题.md 里有持续更新遇到报错先翻它。九、写在最后免费的工具记得用在正道上回头看从拿到项目到产出第一份数据其实就三步装好环境、配好关键词、扫码开跑。剩下的规模化和稳定性都是在你跑起来之后按需往上加的东西——这就是一个好的开源工具该有的样子。最后多叮嘱一句工具虽然免费但请把它用在合法的学习和研究上尊重各平台规则与用户隐私。如果你在使用的过程中想找人交流也欢迎扫码加入技术交流群群里会分享平台更新的应对经验和各种实战技巧。【免费下载链接】MediaCrawler-new项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler-new创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价