资讯动态

AI 引用来源监测:看 AI 摘要都引用了哪些站

发布时间:2026/9/27 2:04:39 来源:尧图企业网站定制
做 GEO(生成式引擎优化)最常见的困惑是:内容发出去了,但 ChatGPT、Perplexity、AI Overview 到底引用了谁?没有数据就只能靠猜。这篇给一个数据化思路:用搜索接口拿带 AI 摘要模块的结果,把 AI 回答里出现的来源域名统计出来,和自然排名的域名分布做对比——AI 偏爱哪些站,一眼看得出来。和 09-10 的AI Overview 监测篇的分工:那篇回答哪些词会触发 AI 摘要(触发率),这篇回答AI 摘要引用了哪些来源(来源结构)。一个是开关监测,一个是引用资产盘点。前提先说清楚文档说明 search 端点在结果页出现 AI 摘要等模块时会一并返回(模块出现才有,不是每个词都有)。ai_overview属于这种可选模块,字段结构以实际返回为准——所以下面脚本的主逻辑是原样落盘 从返回里提取域名,不预设字段名,提取不到的记空值。口径见 SerpBase 官方文档对 ai_overview 模块的说明。脚本importcsv,json,pathlib,re,requestsfromdatetimeimportdate APIhttps://api.serpbase.dev/google/searchKEY你的 API KeyQUERIES[rust 还是 go,serp api 怎么选,免费 搜索 api]DOMAIN_REre.compile(rhttps?://([^/\\s\]))defserp(q:str)-dict:resprequests.post(API,headers{X-API-Key:KEY,Content-Type:application/json},json{q:q,hl:zh-CN,gl:cn},timeout30)returnresp.json()raw_dirpathlib.Path(ai_raw)raw_dir.mkdir(exist_okTrue)rows[]forqinQUERIES:dataserp(q)bodyjson.dumps(data,ensure_asciiFalse)# 1) 原样落盘:模块字段以实际返回为准,先攒数据再离线分析(raw_dir/f{date.today()}_{abs(hash(q))%99999}.json).write_text(body,encodingutf-8)# 2) 从整个返回体提取 http(s) 域名(含 AI 摘要模块里的引用)domains{d.lower().removeprefix(www.)fordinDOMAIN_RE.findall(body)}organicdata.get(organic,[])[:10]organic_domains{i.get(link,).split(/)[2]foriinorganicif://ini.get(link,)}rows.append({查询词:q,是否带AI摘要:ai_overviewinbody,全返回域名数:len(domains),自然结果域名数:len(organic_domains),})withopen(ai_citation.csv,w,newline,encodingutf-8-sig)asf:wcsv.DictWriter(f,fieldnames[查询词,是否带AI摘要,全返回域名数,自然结果域名数])w.writeheader()w.writerows(rows)print(已写入 ai_citation.csv,原始返回在 ai_raw/)跑两周后,把ai_raw/里的 JSON 按AI 摘要模块出现和未出现分两组,统计两组各自的域名频次——高频出现的域,就是 AI 在这个话题上偏爱的引用来源。三条判读经验先攒数据,后定口径。AI 摘要模块的字段结构文档没冻结,今天写死的解析路径下周可能失效。原样落盘 离线分析,比在线解析稳得多——这也是脚本把落盘放在第一步的原因。对比才有信息量。单看AI 引用了谁意义有限;和同 query 的自然排名域名分布对比,才能看出 AI 是否偏好不同类型来源(比如更偏官方文档、更偏知乎)。差异大的话题,就是 GEO 的发力点。触发率低就先扩样本。如果跑一轮只有两三个词带 AI 摘要,先扩查询词数量;样本低于 20 个带模块的结果时,域名统计没有意义。成本每查询词 1 credit,10 个词一轮 10 credits,一天两轮一个月 600 credits。按 $10/20k 的标准包算一个月三毛钱——比起拍脑袋决定 GEO 方向,这个数据便宜得可以忽略。FAQ能直接拿到 AI 摘要引用了哪些链接吗?模块出现时会一并返回,但字段结构以实际返回为准;脚本用从整个响应体提取 http(s) 链接的兜底方案,不依赖具体字段名,模块没出现时也能从自然结果里提取域名做对照。和 09-10 的 AI Overview 监测篇重复吗?不重复。那篇统计触发率(哪些词有 AI 摘要),这篇统计引用来源结构(AI 引用了谁);触发率是门槛指标,来源结构才是优化依据。样本要多大的?单话题至少 20 个带 AI 摘要的查询结果,域名频次排名才稳;低于这个数只适合看趋势,不适合下结论。把 QUERIES 换成你的目标话题,先跑两周攒数据,第三周开始你就有了一份AI 偏爱谁的真实名单——比任何 GEO 教程里的猜测都管用。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑