5分钟学会个人数据提取用InfoSpider爬虫工具箱拿回你的完整数字资产【免费下载链接】InfoSpiderINFO-SPIDER 是一个集众多数据源于一身的爬虫工具箱旨在安全快捷的帮助用户拿回自己的数据工具代码开源流程透明。支持数据源包括GitHub、QQ邮箱、网易邮箱、阿里邮箱、新浪邮箱、Hotmail邮箱、Outlook邮箱、京东、淘宝、支付宝、中国移动、中国联通、中国电信、知乎、哔哩哔哩、网易云音乐、QQ好友、QQ群、生成朋友圈相册、浏览器浏览历史、12306、博客园、CSDN博客、开源中国博客、简书。项目地址: https://gitcode.com/GitHub_Trending/in/InfoSpider深夜十一点你关掉B站准备睡觉突然有点好奇这一年我到底看了多少视频又是什么时候看的你打开历史记录想翻一翻却发现页面只显示最近三个月再往前一片空白。不止B站——淘宝的订单、网易云音乐的听歌排行、GitHub的代码贡献它们统统散落在各个平台里你看得见却带不走。直到你遇见 InfoSpider——一个开源的爬虫工具箱它的使命简单得有点酷安全快捷地帮你拿回属于自己的个人数据。你只需要点几下鼠标B站观看历史、京东订单、知乎点赞、浏览器浏览记录……这些本该属于你的数字资产就能以统一的JSON格式完整下载到你的电脑里。一个工具箱收拢你散落各处的数据碎片想想看如果没有它你想备份个人数据是什么体验没有它打开每个平台翻设置找导出功能大多数平台压根不提供手动复制粘贴几百条记录能折腾一晚上更别提想统一分析自己的消费和观影习惯了。有它InfoSpider把超过24个主流数据源收进一个界面——GitHub、QQ/网易/阿里/新浪邮箱、京东、淘宝、支付宝、移动联通电信、知乎、哔哩哔哩、网易云音乐、QQ好友与群、朋友圈相册、浏览器历史、12306、博客园、CSDN、简书……点一下对应图标浏览器自动弹出帮你登录登录后数据就自动爬取回本地你唯一要做的是选一个保存文件夹。整个过程代码全开源、流程全透明数据只在你的电脑上流转不上传任何服务器。所有爬虫脚本都放在项目的 Spiders 目录下每个数据源相互独立想看哪个平台的提取逻辑打开对应文件夹就能研究。三步跑起来装环境、进目录、敲一行命令上手比想象中简单先克隆仓库git clone https://gitcode.com/GitHub_Trending/in/InfoSpider cd InfoSpider然后准备两样东西Python 3 环境以及一个与你 Chrome 浏览器版本完全匹配的 ChromeDriver。依赖安装一行搞定——pip install -r requirements.txtWindows 上Linux 用户直接跑 install_deps.sh 脚本。最后进入 tools 目录运行主程序cd tools python main.py一个印着拿回你的个人信息的窗口就会弹出来里面整整齐齐排列着二十多个数据源图标就像一盒多功能的数字瑞士军刀。第一次实操从启动到拿到B站完整数据我以B站为例带你完整走一遍其他平台的操作逻辑完全一样。窗口打开后点击哔哩哔哩按钮。程序会自动启动 Chrome 并跳转到B站登录页你像平时一样扫码或输密码登录即可登录成功的瞬间程序会自动捕获你的登录信息随后弹出一个文件夹选择框。这里有个小建议为每个数据源单独建一个文件夹比如bilibili_backup因为一次提取可能会生成多个文件点击确认后底部状态栏会显示爬取中……浏览器自动关闭后变成爬取完成。打开你选的文件夹惊喜出现了——两个 JSON 文件安静地躺在那里bilibili_history.json装着你完整的观看历史注意是全部不是三个月user_info.json是你的账号信息和等级数据。用文本编辑器打开就能看用程序解析也不费劲格式统一清爽。试试看京东登录后你会收获更多包括收货地址、浏览足迹、白条信息、金融收益、关注的店铺和商品等一整套 JSON 文件整齐排列堪称你的消费全景图可能你还不知道的三个隐藏玩法第一浏览器历史也能整体搬走。程序里的Chrome历史记录图标能把你的上网足迹完整导出。翻翻三个月前的网页浏览记录看看自己当初为什么搜索那个关键词意外地很有回忆感。第二技术创作数据可视化分析。博客园、CSDN、开源中国、简书这四类数据源在提取数据之外还额外提供数据分析功能——基于你的个人数据生成 HTML 图表文件。发文数量趋势、写作时间分布、热门博文排行一眼看穿自己这几年的创作轨迹。第三邮箱全家桶一次搞定。QQ、网易、阿里、新浪、Hotmail、Outlook六种主流邮箱全在支持列表里邮件备份不再是各平台来回切换的苦差事。你可能会问的几个问题Q会不会爬错别人的数据不会。所有爬虫都只调用平台官方 API且仅访问你自己账号下的数据全程用你本人登录的凭证不涉及任何他人隐私。Q数据安全吗会不会被工具偷走代码完全开源你可以逐行审查它做了什么。所有数据只在本地处理不上传任何服务器。官方文档在 docs/QuickStart.md 和 docs/README.md 里操作前不放心可以先翻一遍。Q运行时报 ChromeDriver 版本错误怎么办这是最常见的坑。下载与你 Chrome 浏览器完全同版本的驱动放到系统 PATH 包含的目录基本就能解决。Q只有 Windows 能跑吗目前主流程在 Windows 下运行最顺畅Linux 环境也提供了一键安装脚本可以先尝试若遇到问题去项目 Issue 区反馈即可。现在把数据主权拿回自己手里你的每一次搜索、每一笔订单、每一首单曲循环都在互联网上留下了你的影子。与其让这些数据沉睡在平台的黑箱里不如花五分钟把它们接回家。克隆仓库、安装依赖、运行python main.py然后点开你最常用的那个平台图标——你会发现我的数据我做主不是一句口号而是一个下午就能完成的小工程。拿回数据只是开始读懂自己才是真正的收获。【免费下载链接】InfoSpiderINFO-SPIDER 是一个集众多数据源于一身的爬虫工具箱旨在安全快捷的帮助用户拿回自己的数据工具代码开源流程透明。支持数据源包括GitHub、QQ邮箱、网易邮箱、阿里邮箱、新浪邮箱、Hotmail邮箱、Outlook邮箱、京东、淘宝、支付宝、中国移动、中国联通、中国电信、知乎、哔哩哔哩、网易云音乐、QQ好友、QQ群、生成朋友圈相册、浏览器浏览历史、12306、博客园、CSDN博客、开源中国博客、简书。项目地址: https://gitcode.com/GitHub_Trending/in/InfoSpider创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考