资讯动态

小红书数据采集痛点自救指南:xhs 爬虫工具从零上手

发布时间:2026/8/14 18:42:06 来源:尧图企业网站定制
小红书数据采集痛点自救指南xhs 爬虫工具从零上手【免费下载链接】xhs基于小红书 Web 端进行的请求封装。https://reajason.github.io/xhs/项目地址: https://gitcode.com/gh_mirrors/xh/xhs做内容运营、电商选品或竞品调研的朋友大概都有过这样的经历想分析一批小红书热门笔记的点赞、收藏、评论数据却只能一页页手动复制粘贴效率低到让人抓狂。而自己动手写爬虫又绕不开登录校验、签名加密这些硬骨头。今天要分享的xhs 爬虫工具就是一款基于小红书 Web 端封装的开源 Python 库它把笔记采集、评论抓取、用户资料获取甚至笔记发布都封装成了几个简单方法帮我们把时间省下来专注在数据分析本身。为什么需要一款小红书数据采集工具 手动采集的三大困境重复劳动翻页、复制、粘贴一篇笔记就要几十秒。数据不全点赞数、收藏数、评论数散落在页面各处汇总要另开表格。容易被反爬拦下频繁请求触发验证码或 IP 封禁功亏一篑。 xhs 能帮你解决什么xhs 工具直接封装了小红书 Web 端与创作服务页的公开接口一次调用就能拿到结构化数据并且自带登录、签名、异常处理等逻辑新手也能快速跑通。环境准备与安装两条路线任选 路线一pip 一键安装推荐新手pip install xhs安装完成后还需要补充签名所需的环境pip install playwright playwright install签名环节会用到stealth.min.js来绕过浏览器环境检测按文档提示下载放置即可。⚙️ 路线二源码安装适合二次开发想体验最新功能或自己改代码可以克隆仓库后本地安装git clone https://gitcode.com/gh_mirrors/xh/xhs cd xhs python setup.py install三个最实用的上手步骤第一步搞定登录态cookie 是通行证在浏览器登录小红书后从开发者工具里复制 cookie。文档特别提醒a1、web_session、webId三个字段是必需项缺一个都可能请求失败。项目里提供了二维码登录example/login_qrcode.py和手机验证码登录example/login_phone.py两个示例能自动获取并打印登录后的 cookie比自己手动复制更省事。第二步初始化客户端并采集笔记拿到 cookie 后初始化XhsClient即可开始采集from xhs import XhsClient xhs_client XhsClient(cookie你的cookie, signsign) note xhs_client.get_note_by_id(笔记ID, xsec_token)一条笔记的标题、正文、图片链接、点赞数、收藏数、评论数、发布时间等字段就全部拿到了。详细写法参考example/basic_usage.py。第三步关键词搜索与评论深挖想分析某个话题直接搜索关键词获取笔记列表想了解用户真实反馈则抓取全部评论含楼中楼xhs_client.get_note_by_keyword(关键词, sortSearchSortType.MOST_POPULAR) xhs_client.get_note_all_comments(笔记ID)文档目录docs/crawl.rst里完整列出了搜索、用户笔记、收藏点赞、评论互动等二十多个常用方法按需取用即可。进阶技巧把采集效率再提一档 用签名服务替代本地浏览器每次请求都拉起 Playwright 计算签名速度慢且占用资源。项目提供了 Flask 签名服务方案example/basic_sign_server.py把签名逻辑放到独立服务里主程序用普通 requests 请求即可。官方还提供了 Docker 镜像一条命令即可启动docker run -it -d -p 5005:5005 reajason/xhs-api:latest之后按example/basic_sign_usage.py的方式对接多账号批量采集时记得保持 cookie 中的a1与服务端一致避免签名报错。 批量任务内置节流get_user_all_notes、get_note_all_comments这类全量接口内置了请求间隔参数默认每秒一次兼顾速度与稳定性。遇到笔记异常或签名失败异常处理与重试逻辑也已经写好不必自己造轮子。常见问题 FAQQ提示签名失败怎么办A多为浏览器环境检测或a1不一致导致。检查stealth.min.js路径是否正确、cookie 中的a1是否与签名服务一致必要时适当增加重试等待时间。Q请求返回验证码错误A说明触发平台风控。请降低请求频率、增加间隔配合代理使用并避免并发过高。Q笔记 ID 和 xsec_token 从哪来A搜索接口和用户笔记接口的返回结果中都会携带这两个字段直接透传即可。合规提醒与使用边界使用任何爬虫工具都要守住底线xhs 项目作者也特别声明本项目主要用于 Python 学习实践。请务必遵守以下原则仅采集公开可访问的数据不碰用户私密信息。合理控制请求频率不给平台服务器造成压力。数据仅用于个人学习与研究商用前请评估合规风险。延伸资源与行动号召想深入探索这些资料值得收藏快速入门文档docs/basic.rst讲清环境与签名配置。采集方法大全docs/crawl.rst涵盖笔记、用户、评论全链路。示例代码example/登录、签名、发布一应俱全。数据采集从来不是目的让数据服务于决策才是。现在就打开终端装好 xhs从抓取第一篇笔记开始一步步搭建属于你的小红书数据分析流水线吧。遇到问题欢迎翻阅文档、阅读源码动手调试就是最好的学习方式。【免费下载链接】xhs基于小红书 Web 端进行的请求封装。https://reajason.github.io/xhs/项目地址: https://gitcode.com/gh_mirrors/xh/xhs创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价