资讯动态

3个坑搞定安居客二手数据抓取,一文搞懂

发布时间:2026/9/22 12:18:34 来源:尧图企业网站定制
3个坑搞定安居客二手数据抓取,一文搞懂 配置环境就卡半天?别急,这行代码救你。 很多兄弟一提到【安居客二手】房源数据抓取,第一反应就是头疼。不是被反爬拦截,就是解析出来的字段乱七八糟。我在掘金技术社区看到不少帖子吐槽,说用 Scrapy 跑半天,IP 封了,Cookie 失效了,最后连个完整的户型图都拿不全。 其实,问题往往不出在“抓”这个动作上,而出在你对“安居客二手”页面结构的理解上。这篇干货,带你从源码层面拆解它的核心逻辑,不整虚的,直接上代码,帮你把环境跑通,把数据拿稳。 入口定位:找到真正的数据源 很多人一上来就 requests.get(url),然后直接解析 HTML。这是最原始的做法,也是最容易挂的做法。 安居客的页面是前后端分离的架构,尤其是【安居客二手】板块。你打开浏览器 F12 看 Network 标签页,会发现页面初始加载的 HTML 里,很多动态数据其实是空壳,或者是通过 JS 渲染出来的。 真正的数据源,往往藏在 __NEXT_DATA__ 或者特定的 API 接口里。 关键点:不要依赖初始 HTML:初始 HTML 可能只包含第一页的静态内容,或者关键数据被 JS 加密。 寻找 JSON 接口:安居客很多页面背后都有一个 /api/ 开头的接口,返回的是结构化的 JSON 数据,比解析 HTML 稳定得多。 观察 JS 逻辑:如果找不到直接的 API,就得看 JS 文件里是怎么组装请求参数的。举个例子,你去抓【安居客二手】的列表页,URL 可能是 https://sh.anjuke.com/ershoufang/。如果你直接解析这个页面的 HTML,你可能会发现很多房源信息是缺失的,或者分页链接是动态生成的。 这时候,你需要打开浏览器开发者工具,切换到 Network,筛选 XHR 或 Fetch 请求。你会发现,当页面滚动或点击“下一页”时,会发起一个类似 /ershoufang/list/ 的异步请求,返回的 JSON 里包含了所有你需要的房源 ID、价格、面积等字段。 核心片段:解析 __NEXT_DATA__ 安居客很多页面采用了 Next.js 框架,这意味着数据会嵌入在 HTML 中的一个 script id=__NEXT_DATA__ type=application/json 标签里。这是最快、最稳定的数据来源。 下面是一段基于 Python 和 BeautifulSoup 的核心解析代码,专门针对【安居客二手】页面的这种结构: import requests import json from bs4 import BeautifulSoup import redef fetch_anjuke_data(url):获取安居客二手房源数据:param url: 目标URL:return: 解析后的数据列表headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/91.0.4472.124 Safari/537.36','Referer': url}# 1. 发送请求,注意设置超时和重试try:response = requests.get(url, headers=headers, timeout=10)response.raise_for_status()except requests.RequestException as e:print(f请求失败: {e})return []# 2. 解析 HTML,找到 __NEXT_DATA__ 标签soup = BeautifulSoup(response.text, 'html.parser')script_tag = soup.find('script', id='__NEXT_DATA__')if not script_tag:print(未找到 __NEXT_DATA__,页面结构可能已变化)return []# 3. 提取 JSON 字符串并解析try:data_json = json.loads(script_tag.string)except json.JSONDecodeError:print(JSON 解析错误)return []# 4. 深入字典结构,定位到房源列表# 注意:安居客的数据结构可能会变,这里以常见结构为例props = data_json.get('props', {}).get('pageProps', {})list_data = props.get('list', {}).get('list', [])return list_data# 使用示例 # url = https://sh.anjuke.com/ershoufang/ # data = fetch_anjuke_data(url) # print(len(data))逐行注释解析:headers 设置:必须模拟浏览器请求,否则很容易被拦截。Referer 很重要,它告诉服务器你是从哪个页面跳转过来的。 response.raise_for_status():如果状态码不是 200,直接抛出异常,避免后续解析报错。 soup.find('script', id='__NEXT_DATA__'):这是核心。安居客把关键数据塞在这个 script 标签里,而不是普通的 div 或 span 中。 json.loads(script_tag.string):script_tag.string 获取的是标签内的文本内容,即 JSON 字符串。 data_json.get('props', {}).get('pageProps', {}):这是典型的 Next.js 数据结构。数据层层嵌套,你需要根据实际抓到的 JSON 结构来调整 key。如果这里取不到数据,用 print(data_json.keys()) 看看顶层有哪些 key,一步步往里挖。 list_data:最终的目标是拿到这个列表,里面每个元素就是一个房源对象。设计思想:为什么选择 JSON 而非 HTML? 很多初学者喜欢用正则表达式或者 XPath 去匹配 HTML 里的标签,比如 div class=price。这种做法在【安居客二手】这种高变动频率的网站上,极其脆弱。 设计思想的核心是:数据与展示分离。 安居客的前端工程师在重构页面时,可能会把 class=price 改成 class=item-price,或者把价格拆分成整数和小数两部分显示。你的 XPath 脚本瞬间就会失效,报错 no match。 但是,API 接口的数据结构通常比前端展示层更稳定。因为后端要对接其他系统,接口的字段名一旦确定,不会轻易改动。即使前端页面大改版,只要后端 API 没变,你的数据抓取逻辑依然有效。 优势对比:特性 HTML 解析 (XPath/BS4) JSON 解析 (API/Next Data)稳定性 低,易受前端改版影响 高,依赖后端接口契约数据完整性 可能缺失动态加载数据 通常包含完整数据集解析速度 慢,需要解析整个 DOM 树 快,直接处理结构化数据反爬难度 低,容易被识别为爬虫 高,需要模拟签名或 Cookie所以,在写代码之前,先花 5 分钟研究一下页面的 Network 请求和 __NEXT_DATA__,这比写 100 行正则表达式要有价值得多。 手写简化版:构建一个健壮的抓取器 前面的代码只是基础,实际使用中,你需要处理分页、异常重试和数据清洗。下面是一个简化但实用的版本,包含了分页逻辑和简单的数据清洗: import time import randomdef extract_property_info(item):从单个房源字典中提取关键信息:param item: 房源字典:return: 清洗后的房源信息字典# 安居客的数据字段名可能略有不同,需根据实际情况调整title = item.get('title', '未知')price = item.get('price', 0)area = item.get('area', 0)rooms = item.get('rooms', '未知')orientation = item.get('orientation', '未知')floor = item.get('floor', '未知')link = item.get('detailUrl', '')# 简单清洗:去除标题中的多余空格和特殊符号title = re.sub(r'\s+', ' ', title).strip()return {'title': title,'price': price,'area': area,'rooms': rooms,'orientation': orientation,'floor': floor,'link': link}def crawl_anjuke_pages(base_url, max_pages=3):抓取多页数据:param base_url: 基础URL,不包含页码:param max_pages: 最大抓取页数:return: 所有房源数据的列表all_properties = []for page in range(1, max_pages + 1):# 构造带页码的 URL,安居客的页码通常在 URL 末尾current_url = f{base_url}page{page}/ if page 1 else base_urlprint(f正在抓取第 {page} 页: {current_url})# 调用之前的 fetch 函数获取原始数据raw_data = fetch_anjuke_data(current_url)if not raw_data:print(f第 {page} 页抓取失败或无数据,停止)break# 处理数据for item in raw_data:cleaned_item = extract_property_info(item)all_properties.append(cleaned_item)# 模拟人工操作,随机等待 1-3 秒,避免被封wait_time = random.uniform(1, 3)print(f等待 {wait_time:.2f} 秒...)time.sleep(wait_time)return all_properties# 使用示例 # base_url = https://sh.anjuke.com/ershoufang/ # results = crawl_anjuke_pages(base_url, max_pages=2) # print(f共抓取到 {len(results)} 条房源)关键改进点:数据清洗函数:extract_property_info 将复杂的原始字典转换为干净的业务字段。这样后续存库或分析时,不需要每次都处理复杂的嵌套结构。 分页逻辑:通过循环生成不同页码的 URL。注意安居客的 URL 结构,有些是 ?page=2,有些是 /page2/,务必在浏览器里确认清楚。 随机延迟:time.sleep(random.uniform(1, 3)) 是模拟人类浏览习惯。固定的 sleep(2) 很容易被反爬系统识别为机器人。 异常处理:如果某一页抓取失败,直接 break 退出循环,避免无效请求。应用场景与避坑指南 这套方案适用于大多数基于 Next.js 或 Vue SSR 的前端框架网站。但对于【安居客二手】这种大型商业网站,你还会遇到几个典型的坑。 坑一:IP 封锁 安居客对高频访问非常敏感。如果你发现请求突然返回 403 或 429 状态码,说明 IP 被暂时封锁了。 解决方案:使用代理 IP 池,每次请求换一个 IP。 降低请求频率,增加随机延迟。 不要并发请求,串行执行最安全。坑二:Cookie 失效 有些数据需要登录才能看到,或者需要特定的 Cookie 才能访问完整接口。 解决方案:手动登录浏览器,复制完整的 Cookie 字符串,放到 headers 里。 使用 requests.Session() 对象,自动管理 Cookie。 注意 Cookie 的有效期,定期更新。坑三:数据字段变化 安居客可能会调整 JSON 里的字段名,比如把 price 改成 totalPrice。 解决方案:在代码中加入字段存在性检查,如果关键字段缺失,记录日志并跳过该条数据,而不是直接报错崩溃。 定期运行脚本,监控数据完整性。如果发现某个字段大量为空,说明接口可能变了,需要重新分析。合规提醒: 抓取数据用于个人学习、研究或非商业用途是允许的。但如果用于商业盈利、大规模数据倒卖,或者对服务器造成严重负担,可能会触犯法律或违反网站服务条款。请遵守《网络安全法》和网站的用户协议,控制抓取频率,尊重开发者劳动成果。 你公司项目里是怎么处理这类动态页面的?是直接用 Selenium 模拟点击,还是像我这样深挖 JSON 接口?欢迎在评论区分享你的经验和踩过的坑,咱们一起交流。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价