资讯动态

Instagram 数据爬取教程:一条命令拿全粉丝数、标签与增长统计

发布时间:2026/8/27 16:58:39 来源:尧图企业网站定制
Instagram 数据爬取教程一条命令拿全粉丝数、标签与增长统计【免费下载链接】instagram-profilecrawl quickly crawl the information (e.g. followers, tags etc...) of an instagram profile.项目地址: https://gitcode.com/gh_mirrors/inst/instagram-profilecrawl完成本文后你将拥有一条按天自动运行的 Instagram 数据采集流水线输入账号名机器抓取公开资料输出 JSON 快照与增长报表。工具是开源项目 instagram-profilecrawl无需登录即可开始。 数据是怎么流的先看清全链路再动手。整条链路只有三步。命令行里的用户名交给crawl_profile.py它用 Selenium 驱动真实浏览器逐页滚动再由util/extractor.py与util/extractor_posts.py解析字段最后把每个账号写成一份 JSON评论者名单另存为*_commenters.txt。 第一次运行三个动作产出第一个文件。第一步完成安装配置git clone https://gitcode.com/gh_mirrors/inst/instagram-profilecrawl cd instagram-profilecrawl pip install -r requirements.txt第二步放浏览器驱动。从 Chromedriver 官方渠道下载与本机浏览器版本匹配的二进制放入assets目录脚本会自动加载。第三步执行第一条爬取命令也支持一次传入多个账号python3 crawl_profile.py instagram结果落在profiles目录。打开instagram.json你能看到粉丝数、关注数、帖子总数以及每篇帖子的标题、地理位置、图片链接、点赞数、评论数和话题标签。 按档位进阶按场景从上到下选档位。调整爬取规模与节奏你的目标是大号抓得全弱网不超时。默认抓取 1000 篇帖子滚动间隔 14.5 秒改util/settings.py两个值即可Settings.limit_amount 2000 Settings.sleep_time_between_post_scroll 25网慢就加大间隔。请求过快容易撞上平台风控频率保持克制。开启登录抓取关注者你的目标是访问已关注的私密账号拿到关注者列表。先执行cp .env.example .env在.env里填IG_USERNAME与IG_PASSWORD再把Settings.scrape_follower置为 True。建议用专门注册的小账号登录并控制运行频率避免主力账号受到牵连。编排每日定时采集你的目标是机器每天按点工作你只负责看结果。在 crontab 中加入一行每天凌晨 3 点采集并把日志写入文件0 3 * * * cd /path/to/instagram-profilecrawl python3 crawl_profile.py target_user crawl_log.txt 21树莓派等无图形界面的设备改用quickstart_templates/crawl_profile_pi.py它基于 Firefox 加虚拟显示先安装 firefox-esr 与 pyvirtualdisplay 即可运行。导出增长统计与帖子图片你的目标是让快照变成曲线让图片备份到本地。增长统计与图片批量导出各有一条命令python3 log_stats.py -u target_user python3 extract_image.py profileslog_stats.py把粉丝数、关注数、帖子数以及点赞与评论总和追加进stats.csv并把已处理文件移入profiles/done防止重复计数不带-u时统计profiles下全部账号。extract_image.py则把帖子图片存到images/账号名/目录。❓ 出问题怎么办先对号再下药。页面长时间不动滚动间隔太短或弱网超时。把sleep_time_between_post_scroll从 14.5 加到 25 再试。启动就报驱动异常Chromedriver 缺失或与浏览器版本不匹配。重新下载匹配版本放入assets目录树莓派用户改用 pi 版脚本并检查 geckodriver。登录后仍抓不到关注者检查scrape_follower是否开启以及登录账号是否已关注该目标账号。不登录能抓哪些数据公开账号的资料、帖子、标签、点赞与评论都无需登录即可抓取。登录只为私密账号需已关注和关注者列表服务。启动你的采集流水线现在就能跑起来。打开终端按“第一次运行”三步执行第一条命令让profiles目录里出现第一份 JSON。之后每天新增一份快照stats.csv里的增长曲线就多出一个数据点。【免费下载链接】instagram-profilecrawl quickly crawl the information (e.g. followers, tags etc...) of an instagram profile.项目地址: https://gitcode.com/gh_mirrors/inst/instagram-profilecrawl创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价