资讯动态

如何用BilibiliCommentScraper高效获取B站完整评论数据:新手完整指南

发布时间:2026/8/15 17:13:03 来源:尧图企业网站定制
如何用BilibiliCommentScraper高效获取B站完整评论数据新手完整指南【免费下载链接】BilibiliCommentScraperB站视频评论爬虫 Bilibili完整爬取评论数据包括一级评论、二级评论、昵称、用户ID、发布时间、点赞数项目地址: https://gitcode.com/gh_mirrors/bi/BilibiliCommentScraper凌晨一点你还在手动复制B站爆款视频的评论区几十条评论翻得眼花谁回复了谁、点赞多少完全对不上号更别提还有20个视频排着队等你处理。手动采集B站评论数据几乎是每个内容创作者和研究者都踩过的坑。而 BilibiliCommentScraper 就是为彻底解决这个痛点而生的免费开源工具批量抓取、层级完整、还能断点续爬把几小时的苦力活压缩成几分钟。30秒看懂这个工具一句话定义BilibiliCommentScraper 是一款基于 Python Selenium 的 B站评论数据采集工具它会像真人一样打开浏览器、滚动页面把一级评论、二级评论连同昵称、用户ID、发布时间、点赞数全部抓下来自动存成 CSV 表格。适合谁 内容创作者分析观众反馈寻找创作灵感 研究者与学生情感分析、用户行为研究 市场运营舆情监测、竞品对比能带来什么一次登录批量视频自动跑中途断电、程序崩溃都不怕随时接着上次的进度继续。上图就是工具输出的一张评论数据表编号、隶属关系、被评论者、评论内容、发布时间、点赞数一应俱全一级评论和二级评论的层级关系一目了然。5步闪电上手10分钟跑通别担心全程不需要你懂编程跟着做就行。第1步准备环境安装 Python 3官网下载安装包一路下一步即可再装好 Chrome 浏览器。第2步安装依赖打开命令行Windows 用 cmd 或 PowerShell执行pip install selenium beautifulsoup4 webdriver-manager第3步下载项目git clone https://gitcode.com/gh_mirrors/bi/BilibiliCommentScraper cd BilibiliCommentScraper第4步填写视频列表用记事本打开项目里的video_list.txt每行填一个B站视频链接https://www.bilibili.com/video/BV1xxxxxxxxx https://www.bilibili.com/video/BV1yyyyyyyyy第5步运行python Bilicomment.py运行后 Chrome 会自动弹出提示请登录登录成功跳转后按回车键继续...。扫码登录一次回车程序就开始自动爬了。✅预期结果控制台持续打印下滑滚动第X次完成后项目目录下会多出以视频ID命名的 CSV 文件比如BV1xxxxxxxxx.csv。就这么简单。内核透视它比传统方式强在哪一张对比表看懂差异对比项手动/普通工具BilibiliCommentScraper数据完整性只能拿到前几十条滚动加载全部可见评论层级关系只有一级评论一级二级评论完整保留批量处理手动一个个来读取 video_list.txt 自动批量中断恢复全部重来progress.txt 断点续爬出错处理全程人工盯守自动重试 错误日志杀手级特性一二级评论也不放过很多工具只抓表层对话关系全丢。这个工具会模拟点击每条一级评论下的查看全部按钮再一页页翻二级评论# Bilicomment.py 中控制二级评论页码上限 max_sub_pages 150 # 最多翻150页设为 None 则无限制 while current_sub_page max_sub_pages: # 找到下一页按钮点击后继续提取二级评论每条评论都带隶属关系字段谁回复了谁清清楚楚。杀手级特性二智能断点续爬程序会实时把进度写进progress.txt例如{video_count: 1, first_comment_index: 15, sub_page: 114, write_parent: 1}含义分别是已完成1个视频当前视频的第15条一级评论这条评论的二级评论已翻到114页这条一级评论已写入文件。想从头开始删掉progress.txt即可。想跳过某个视频把video_count加1就行。控制权完全在你手里。进阶调优让它跑得更快更稳三个可调参数MAX_SCROLL_COUNT 45 # 默认45次滚动约920条一级评论想抓更多可调大 max_sub_pages 150 # 二级评论页数上限减少可省内存 time.sleep(2) # 请求间隔遇到风控就调大用随机延时降低被限流概率import random time.sleep(random.uniform(1, 5)) # 每次随机等1~5秒批量处理建议先跑评论量少的视频熟悉流程热门视频分批放别一次塞太多内存不足导致网页崩溃时调小MAX_SCROLL_COUNT⚠️避坑提示CSV 文件用 Excel 打开乱码别慌用记事本或 VS Code 打开即可或 Excel 里选数据→从文本/CSV编码选 UTF-8。实战复盘三个拿来即用的场景场景一内容创作——找出最受欢迎的声音import pandas as pd df pd.read_csv(BV1xxxxxxxxx.csv, encodingutf-8) top df.nlargest(10, 点赞数)[[昵称, 评论内容, 点赞数]] print(top) # 点赞最高的10条评论就是观众最关心的内容场景二学术研究——分析评论活跃时段df[发布时间] pd.to_datetime(df[发布时间]) hourly df.groupby(df[发布时间].dt.hour).size() print(hourly) # 看哪个时段讨论最热烈场景三市场调研——批量对比竞品互动流程很简单把竞品视频链接全部填进video_list.txt跑一轮批量采集再用 pandas 分别读取多个 CSV对比评论总量、平均点赞和负面情绪关键词出现频率。高频问答❓ Q1CSV 用 Excel 打开是乱码✅ 文件是 UTF-8 编码用记事本或 VS Code 打开或用 Excel 的数据→从文本/CSV导入并选择 UTF-8 编码。❓ Q2报错 Permission denied✅ 通常是 CSV 或 progress.txt 被其他程序比如你开着的 Excel占用。关掉占用程序再重试或右键以管理员身份运行。❓ Q3爬到的评论数比B站显示少✅ 这是正常现象B站评论数存在虚标。验证方法手动滚动网页到底部对比最后几条评论是否与 CSV 末尾一致一致就说明抓全了。❓ Q4程序长时间没动静✅ 可能是访问太频繁被限流。直接重启程序它会断点续爬同时把延时调大或改成随机延时。❓ Q5想跳过某个视频怎么办✅ 编辑progress.txt把video_count加1程序启动后会自动跳过当前视频。现在就行动按这份清单走十分钟内就能跑通✅ 安装 Python 3 和 Chrome✅ 执行pip install selenium beautifulsoup4 webdriver-manager✅git clone https://gitcode.com/gh_mirrors/bi/BilibiliCommentScraper✅ 编辑video_list.txt放入要分析的视频链接✅ 运行python Bilicomment.py扫码登录一次✅ 查看生成的 CSV 文件开始你的分析最后提醒一句合规原则请仅采集公开可见的评论、合理控制请求频率、遵守平台规则数据仅用于合法合规的用途。别等了就从你收藏夹里那条爆款视频开始吧。打开命令行试一次你会回来感谢自己的。【免费下载链接】BilibiliCommentScraperB站视频评论爬虫 Bilibili完整爬取评论数据包括一级评论、二级评论、昵称、用户ID、发布时间、点赞数项目地址: https://gitcode.com/gh_mirrors/bi/BilibiliCommentScraper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价