资讯动态

【NeurIPS 2025】PKD:偏好驱动的知识蒸馏,少样本节点分类|从少样本图学习视角

发布时间:2026/8/20 9:41:23 来源:尧图企业网站定制
摘要本文解读 NeurIPS 2025 论文《Preference-driven Knowledge Distillation for Few-shot Node Classification》。该论文提出偏好驱动的知识蒸馏框架 PKD通过融合GNN 偏好节点选择器 GNS、节点偏好 GNN 选择器 NGS与图拓扑感知GTA提示微调让大语言模型LLM与多种图神经网络GNN在少样本节点分类上互补协同其特别之处在于把蒸馏粒度细化到「节点-教师」配对级别。实验表明仅用每类 5 个标注节点即可在 Cora 上达到 91.14% 准确率在 9 个真实文本属性图上全面超越用 48% 标签训练的最强基线为少样本图学习提供了重要的范式参考。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQPKD 为什么用「预测蒸馏」而不是「特征对齐蒸馏」GNS 如何决定哪些节点值得 LLM 标注NGS 的强化学习奖励是什么PKD 换了 LLM 还能用吗PKD 的训练成本高吗参考链接论文基本信息项目内容标题英文Preference-driven Knowledge Distillation for Few-shot Node Classification标题中文偏好驱动的知识蒸馏少样本节点分类作者Xing Wei, Chunchun Chen, Rui Fan, Xiaofeng Cao, Sourav Medya, Wei Ye机构同济大学电子与信息工程学院 / 同济大学计算机系 / 伊利诺伊大学芝加哥分校会议NeurIPS 2025arXivhttps://arxiv.org/abs/2510.10116项目网站https://github.com/GEEX-Weixing/PKD背景与动机文本属性图TAG——如引文网络、网页图、商品共购图——上的节点分类图神经网络GNN凭借消息传递机制高效运行但训练严重依赖人工标注而真实场景往往只有每类 1–5 个标签。更深层的问题是真实图节点的局部拓扑复杂多样单一消息传递机制GCN 的同质性假设、GAT 的注意力加权、APPNP 的个性化传播无法同时覆盖所有节点。已有工作各有短板传统 GNNGCNII、EGNN在标签极度稀疏时能力受限GCNII 在 Ogbn-Arxiv 上仅 35.14%。LLM 增强 GNNLLMGNN、GAugLLMLLMGNN 缺乏精细微调与认知能力伪标签质量低GAugLLM 依赖 SoftMax 分数自训练选节点不可靠仅在 Pubmed 上最优85.98%。自训练方法Self-training、AGST、IceBergAGST 过度依赖原始拓扑做标签传播在大图 Ogbn-Arxiv 上直接 OOMIceBerg 在异质图上因噪声边传播失败Wisconsin 仅 41.53%。图知识蒸馏KDGA、MSKD、BGNN、MTAAM、FairGKDKDGA 与 BGNN 对教师选择过度敏感MSKD 固定消息传递机制在所有数据集上均不如 PKDMTAAM 与 FairGKD 表现较好但仍受限于「顺序/同时蒸馏」范式——不感知节点级局部拓扑。同时LLM 零/少样本能力强如 Llama-3.1-8B、Qwen2.5-7B但参数量大、推理难扩展且与 GNN 的嵌入空间差异巨大decoder-only vs encoder-only直接蒸馏不可行。PKD 的思路是让 LLM 只标注最有价值的分歧节点让每个节点只听最懂它的教师。研究主线从问题到结论图 6PKD 研究主线流程图——问题→动机→预测蒸馏→双向偏好设计→9 数据集评测→结论Mermaid 流程图。基准/方法设计PKD 框架的总设计原则是「双向偏好」GNSGNN-preference-driven Node Selector选出GNN 偏好的节点交给 LLM 标注NGSNode-preference-driven GNN Selector为每个节点选出节点偏好的教师做定制化蒸馏。前置条件是先用 GTA 提示微调 LLM使其具备图拓扑理解能力——GTA 设计了 4 类结构化任务连通性判断、节点度、环检测、随机游走文本生成。图 1GTA 提示微调后 LLM 的零样本节点分类性能提升——微调让 LLM 在多数图上超越部分半监督 GNN为高质量标注奠定基础。分类全景图 7LLM×GNN 协同蒸馏分类全景——GTA 微调、GNS 节点选择、DNS 邻居选择与 NGS 教师选择四大模块Mermaid 分类图。方法细节核心设计四要素框架图见图 2K-不确定性 $\delta_K$定义为 $B$ 个教师 SoftMax 输出两两之间的对称 KL 散度之和。论文给出命题与证明高 $\delta_K$ 节点对教师 GNN 增强更有益证明见附录。按 $\delta_K$ 排序得到偏好排名 $\mathcal{V}_{PR}$只取前 $W$ 个节点交给 LLM 标注同时降低 LLM 推理成本。DNS 距离邻居选择在预训练教师 GNN 的嵌入空间对每个选中节点做 KNN 搜索并去重将邻居文本与节点语义拼成类别归纳提示——摆脱 1-hop 同质性偏差K 默认取 4。三部分蒸馏损失$\mathcal{L}{KD}\alpha\mathcal{L}{DL}\beta\mathcal{L}_{CE}\gamma H(f_S)$其中软标签由节点偏好掩码 $\mathbf{m}_i$ 加权$\widetilde{\mathbf{z}}_i^T\mathbf{m}_i\otimes\mathbf{z}_i^T$。NGS 强化学习把教师选择建模为 RL——State 是节点语义/结构/预测属性提示Action 是离散教师采样Reward 为 $R\eta(\mathcal{L}{DL}-\mathcal{L}{CE})(1-\eta)A_{cc}$$A_{cc}$ 为学生 GNN 分类精度。LLM 解码不可微故在 logit 层后加两个 MLP 投影器输出动作概率与价值估计优化用简化版 PPO无显式 Reward/Reference 模型CLIP 限幅学生 GNN 参数全程固定。图 2PKD 框架总览——两大模块 DNS 提示构造构成完整的双向偏好闭环。实验设计与结果评测协议9 个真实 TAG 数据集同质性 0.150–0.825每类随机 1/3/5 个标签作为初始训练集由 GNS 扩展到 48% 训练比例其余 32% 验证 / 20% 测试重复 5 次。同质图教师池为 GCN/GAT/APPNP/H₂GCN学生 GCN异质图教师池为 DirGNN/GPRGNN/HoloNets/H₂GCN学生 H₂GCN。基线含 GCNII、EGNN、LLMGNN、GAugLLM、Self-training、AGST、IceBerg、KDGA、MSKD、BGNN、MTAAM、FairGKD 及 Random/Voting。主表PKD 每类 5 标签 vs 用 48% 标签训练的基线准确率 %方法TexasAmazon RatingsOgbn-ArxivCora最佳教师 T48% 标签82.8348.9359.1988.38GAugLLM48% 标签73.8142.4253.4779.48AGST48% 标签68.4543.11OOM77.25MTAAM48% 标签80.8139.5432.3279.16Voting48% 标签61.3158.6458.5374.32PKD #LN 180.3664.1153.6785.64PKD #LN 586.3166.7961.0391.14图 3K-不确定性节点分布Cora——从箭头处逆时针 KL 散度和递增、颜色加深PKD 优先选择高不确定性节点。消融与机制验证GTADNS$\mathcal{V}_{PR}$ 三组件全开Cora 41.14pp、Amazon Ratings 23.97pp三组件互补各去掉一个均有显著回落。教师选择机制对比CoraRL 90.27vs Entropy 75.70 / Random 62.80 / End-to-end 60.29——为每节点学分配策略是核心价值。奖励函数消融精度 $R_1$ → CE $R_2$ → DL $R_3$三部分缺一不可图 5。图 4邻居数 K 的敏感性——K4 在多数图上取得峰值是默认参数依据。图 5奖励函数消融——分类精度、交叉熵与蒸馏损失三部分共同作用时训练表现最优。扩展性与运行时间标注扩展比例 10%→48% 时 Cora 从 73.37 涨到 91.1417.77pp代价是每轮训练约 7.3 秒Cora约为纯 GNN 方法FairGKD 4.1s的 1.8 倍。附录 A 数据集统计同质性/节点/边/类、附录 B 三种 LLMLlama/Qwen2.5/Mixtral一致性验证、附录 E 超参敏感性$\alpha0.5,\beta1,\gamma0.1,\eta0.3$ 最优$\beta$ 与 $\eta$ 最敏感等细节见视频附录。结果对比总结图 8PKD 结果对比总结——5 标签/类下 Cora 91.14%、Texas 86.31%、Amazon 66.79%全面超越 48% 标签基线Mermaid 对比图。关键发现标签效率提升近 10 倍PKD 每类 5 标签在 Cora 达 91.14%优于 GCNII 用 48% 真实标签的 81.54%LLM 标注质量逼近真实标签。9 数据集一致领先无论同质Cora 91.14%还是异质Texas 86.31%图PKD 全部超越用 48% 标签训练的最强基线最好成绩 6/9 数据集。LLM 无关性换 Qwen2.5-7BCora 90.07与 Mixtral-8x7BCornell 81.58、Wisconsin 77.36依然领先框架收益不依赖特定 LLM。选对节点比多标注更重要K-不确定性选节点 Cornell 达 80.95%随机选择仅 54.31%#LN5差距 26.64pp。消融三件套互补GTA、DNS、$\mathcal{V}_{PR}$ 全开在 Cora 提升 41.14pp、Amazon Ratings 提升 23.97pp每个组件独立贡献。RL 教师选择碾压启发式RL 90.27 比熵排序 75.70 高 14.57ppCora比端到端学习 60.29 高 29.98pp。局限性仅针对文本属性图依赖节点文本属性非文本图或缺属性场景不适用。训练效率开销Cora 上 7.314 s/epoch含预训练高于 FairGKD 的 4.100LLM 推理是主要瓶颈大图上更明显。LLM 调用成本GNS 标注与 NGS 逐节点推理均需调用 LLM扩展比例增大时开销近似线性上升。超参敏感性$\beta$标注监督权重与 $\eta$奖励平衡对性能影响较大需按数据集调参。常见问题FAQPKD 为什么用「预测蒸馏」而不是「特征对齐蒸馏」LLM 是 decoder-only 架构、GNN 是 encoder-only 架构两者嵌入空间特性与维度差异巨大直接对齐需要复杂映射且训练成本高预测蒸馏只传递类别概率分布天然规避了维度与语义对齐问题是标签稀缺场景下的高效选择。GNS 如何决定哪些节点值得 LLM 标注GNS 计算多教师预测的两两对称 KL 散度之和K-不确定性 $\delta_K$按 $\delta_K$ 排序取前 $W$ 个节点命题证明高 $\delta_K$ 节点对教师 GNN 增强更有益。只标注分歧最大的节点既保证信息量又控制 LLM 推理成本。NGS 的强化学习奖励是什么奖励绑定学生 GNN 在扩展训练集上的表现$R\eta(\mathcal{L}{DL}-\mathcal{L}{CE})(1-\eta)A_{cc}$融合蒸馏损失差、交叉熵损失差与分类精度三部分消融显示三部分缺一不可$\eta0.3$ 最优。PKD 换了 LLM 还能用吗能。论文用 Llama-3.1-8B、Qwen2.5-7B、Mixtral-8x7B 三种 LLM 验证均全面超越 48% 标签训练的最佳基线GTA 微调与框架设计本身与具体 LLM 解耦代码开源可复现。PKD 的训练成本高吗Cora 上每轮约 7.3 秒是纯 GNN 基线FairGKD 4.1s的 1.8 倍主要来自 LLM 推理但只标注 Top-W 节点而非全图成本远低于「全图 LLM 标注 蒸馏」的朴素方案且换取约 10 倍的标签效率。参考链接论文 arXivhttps://arxiv.org/abs/2510.10116官方代码https://github.com/GEEX-Weixing/PKDNeurIPS 2025 论文集https://proceedings.neurips.cc/paper_files/paper/2025/hash/954b0037b87b0a1e965b49452eecab76-Abstract-Conference.htmlHinton 知识蒸馏奠基工作https://arxiv.org/abs/1503.02531LLMGNNLLM-GNN 蒸馏基线https://github.com/currytang0618/LLMGNN给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价