【NeurIPS 2025】PKD:偏好驱动的知识蒸馏,少样本节点分类|从少样本图学习视角
2026/8/20 9:41:17 网站建设 项目流程

摘要

本文解读 NeurIPS 2025 论文《Preference-driven Knowledge Distillation for Few-shot Node Classification》。该论文提出偏好驱动的知识蒸馏框架 PKD,通过融合GNN 偏好节点选择器 GNS节点偏好 GNN 选择器 NGS图拓扑感知(GTA)提示微调,让大语言模型(LLM)与多种图神经网络(GNN)在少样本节点分类上互补协同,其特别之处在于把蒸馏粒度细化到「节点-教师」配对级别。实验表明仅用每类 5 个标注节点即可在 Cora 上达到 91.14% 准确率,在 9 个真实文本属性图上全面超越用 48% 标签训练的最强基线,为少样本图学习提供了重要的范式参考。

视频讲解:点击观看 B 站视频

  • 摘要
  • 论文基本信息
  • 背景与动机
  • 研究主线:从问题到结论
  • 基准/方法设计
  • 分类全景
  • 方法细节
  • 实验设计与结果
  • 结果对比总结
  • 关键发现
  • 局限性
  • 常见问题(FAQ)
    • PKD 为什么用「预测蒸馏」而不是「特征对齐蒸馏」?
    • GNS 如何决定哪些节点值得 LLM 标注?
    • NGS 的强化学习奖励是什么?
    • PKD 换了 LLM 还能用吗?
    • PKD 的训练成本高吗?
  • 参考链接

论文基本信息

项目内容
标题(英文)Preference-driven Knowledge Distillation for Few-shot Node Classification
标题(中文)偏好驱动的知识蒸馏:少样本节点分类
作者Xing Wei, Chunchun Chen, Rui Fan, Xiaofeng Cao, Sourav Medya, Wei Ye
机构同济大学电子与信息工程学院 / 同济大学计算机系 / 伊利诺伊大学芝加哥分校
会议NeurIPS 2025
arXivhttps://arxiv.org/abs/2510.10116
项目网站https://github.com/GEEX-Weixing/PKD

背景与动机

文本属性图(TAG)——如引文网络、网页图、商品共购图——上的节点分类,图神经网络(GNN)凭借消息传递机制高效运行,但训练严重依赖人工标注,而真实场景往往只有每类 1–5 个标签。更深层的问题是:真实图节点的局部拓扑复杂多样,单一消息传递机制(GCN 的同质性假设、GAT 的注意力加权、APPNP 的个性化传播)无法同时覆盖所有节点。

已有工作各有短板:

  • 传统 GNN(GCNII、EGNN):在标签极度稀疏时能力受限,GCNII 在 Ogbn-Arxiv 上仅 35.14%。
  • LLM 增强 GNN(LLMGNN、GAugLLM):LLMGNN 缺乏精细微调与认知能力,伪标签质量低;GAugLLM 依赖 SoftMax 分数自训练,选节点不可靠,仅在 Pubmed 上最优(85.98%)。
  • 自训练方法(Self-training、AGST、IceBerg):AGST 过度依赖原始拓扑做标签传播,在大图 Ogbn-Arxiv 上直接 OOM;IceBerg 在异质图上因噪声边传播失败,Wisconsin 仅 41.53%。
  • 图知识蒸馏(KDGA、MSKD、BGNN、MTAAM、FairGKD):KDGA 与 BGNN 对教师选择过度敏感,MSKD 固定消息传递机制,在所有数据集上均不如 PKD;MTAAM 与 FairGKD 表现较好但仍受限于「顺序/同时蒸馏」范式——不感知节点级局部拓扑

同时,LLM 零/少样本能力强(如 Llama-3.1-8B、Qwen2.5-7B),但参数量大、推理难扩展,且与 GNN 的嵌入空间差异巨大(decoder-only vs encoder-only),直接蒸馏不可行。PKD 的思路是:让 LLM 只标注最有价值的分歧节点,让每个节点只听最懂它的教师

研究主线:从问题到结论

图 6:PKD 研究主线流程图——问题→动机→预测蒸馏→双向偏好设计→9 数据集评测→结论(Mermaid 流程图)。

基准/方法设计

PKD 框架的总设计原则是「双向偏好」:GNS(GNN-preference-driven Node Selector)选出GNN 偏好的节点交给 LLM 标注,NGS(Node-preference-driven GNN Selector)为每个节点选出节点偏好的教师做定制化蒸馏。前置条件是先用 GTA 提示微调 LLM,使其具备图拓扑理解能力——GTA 设计了 4 类结构化任务:连通性判断、节点度、环检测、随机游走文本生成。

图 1:GTA 提示微调后 LLM 的零样本节点分类性能提升——微调让 LLM 在多数图上超越部分半监督 GNN,为高质量标注奠定基础。

分类全景

图 7:LLM×GNN 协同蒸馏分类全景——GTA 微调、GNS 节点选择、DNS 邻居选择与 NGS 教师选择四大模块(Mermaid 分类图)。

方法细节

核心设计四要素(框架图见图 2):

  1. K-不确定性 $\delta_K$:定义为 $B$ 个教师 SoftMax 输出两两之间的对称 KL 散度之和。论文给出命题与证明:高 $\delta_K$ 节点对教师 GNN 增强更有益(证明见附录)。按 $\delta_K$ 排序得到偏好排名 $\mathcal{V}_{PR}$,只取前 $W$ 个节点交给 LLM 标注,同时降低 LLM 推理成本。
  2. DNS 距离邻居选择:在预训练教师 GNN 的嵌入空间对每个选中节点做 KNN 搜索并去重,将邻居文本与节点语义拼成类别归纳提示——摆脱 1-hop 同质性偏差,K 默认取 4。
  3. 三部分蒸馏损失:$\mathcal{L}{KD}=\alpha\mathcal{L}{DL}+\beta\mathcal{L}_{CE}+\gamma H(f_S)$,其中软标签由节点偏好掩码 $\mathbf{m}_i$ 加权($\widetilde{\mathbf{z}}_i^T=\mathbf{m}_i\otimes\mathbf{z}_i^T$)。
  4. NGS 强化学习:把教师选择建模为 RL——State 是节点语义/结构/预测属性提示,Action 是离散教师采样,Reward 为 $R=\eta(\mathcal{L}{DL}'-\mathcal{L}{CE})+(1-\eta)A_{cc}$($A_{cc}$ 为学生 GNN 分类精度)。LLM 解码不可微,故在 logit 层后加两个 MLP 投影器输出动作概率与价值估计;优化用简化版 PPO(无显式 Reward/Reference 模型,CLIP 限幅),学生 GNN 参数全程固定。

图 2:PKD 框架总览——两大模块 + DNS 提示构造,构成完整的双向偏好闭环。

实验设计与结果

评测协议:9 个真实 TAG 数据集(同质性 0.150–0.825),每类随机 1/3/5 个标签作为初始训练集,由 GNS 扩展到 48% 训练比例,其余 32% 验证 / 20% 测试,重复 5 次。同质图教师池为 GCN/GAT/APPNP/H₂GCN(学生 GCN),异质图教师池为 DirGNN/GPRGNN/HoloNets/H₂GCN(学生 H₂GCN)。基线含 GCNII、EGNN、LLMGNN、GAugLLM、Self-training、AGST、IceBerg、KDGA、MSKD、BGNN、MTAAM、FairGKD 及 Random/Voting。

主表(PKD 每类 5 标签 vs 用 48% 标签训练的基线,准确率 %):

方法TexasAmazon RatingsOgbn-ArxivCora
最佳教师 T(48% 标签)82.8348.9359.1988.38
GAugLLM(48% 标签)73.8142.4253.4779.48
AGST(48% 标签)68.4543.11OOM77.25
MTAAM(48% 标签)80.8139.5432.3279.16
Voting(48% 标签)61.3158.6458.5374.32
PKD #LN 180.3664.1153.6785.64
PKD #LN 586.3166.7961.0391.14

图 3:K-不确定性节点分布(Cora)——从箭头处逆时针 KL 散度和递增、颜色加深,PKD 优先选择高不确定性节点。

消融与机制验证

  • GTA+DNS+$\mathcal{V}_{PR}$ 三组件全开:Cora +41.14pp、Amazon Ratings +23.97pp,三组件互补(各去掉一个均有显著回落)。
  • 教师选择机制对比(Cora):RL 90.27vs Entropy 75.70 / Random 62.80 / End-to-end 60.29——为每节点学分配策略是核心价值。
  • 奖励函数消融:精度 $R_1$ → +CE $R_2$ → +DL $R_3$,三部分缺一不可(图 5)。

图 4:邻居数 K 的敏感性——K=4 在多数图上取得峰值,是默认参数依据。

图 5:奖励函数消融——分类精度、交叉熵与蒸馏损失三部分共同作用时训练表现最优。

扩展性与运行时间:标注扩展比例 10%→48% 时 Cora 从 73.37 涨到 91.14(+17.77pp);代价是每轮训练约 7.3 秒(Cora),约为纯 GNN 方法(FairGKD 4.1s)的 1.8 倍。附录 A 数据集统计(同质性/节点/边/类)、附录 B 三种 LLM(Llama/Qwen2.5/Mixtral)一致性验证、附录 E 超参敏感性($\alpha=0.5,\beta=1,\gamma=0.1,\eta=0.3$ 最优,$\beta$ 与 $\eta$ 最敏感)等细节见视频附录。

结果对比总结

图 8:PKD 结果对比总结——5 标签/类下 Cora 91.14%、Texas 86.31%、Amazon 66.79%,全面超越 48% 标签基线(Mermaid 对比图)。

关键发现

  1. 标签效率提升近 10 倍:PKD 每类 5 标签在 Cora 达 91.14%,优于 GCNII 用 48% 真实标签的 81.54%,LLM 标注质量逼近真实标签。
  2. 9 数据集一致领先:无论同质(Cora 91.14%)还是异质(Texas 86.31%)图,PKD 全部超越用 48% 标签训练的最强基线,最好成绩 6/9 数据集。
  3. LLM 无关性:换 Qwen2.5-7B(Cora 90.07)与 Mixtral-8x7B(Cornell 81.58、Wisconsin 77.36)依然领先,框架收益不依赖特定 LLM。
  4. 选对节点比多标注更重要:K-不确定性选节点 Cornell 达 80.95%,随机选择仅 54.31%(#LN5),差距 26.64pp。
  5. 消融三件套互补:GTA、DNS、$\mathcal{V}_{PR}$ 全开在 Cora 提升 41.14pp、Amazon Ratings 提升 23.97pp,每个组件独立贡献。
  6. RL 教师选择碾压启发式:RL 90.27 比熵排序 75.70 高 14.57pp(Cora),比端到端学习 60.29 高 29.98pp。

局限性

  • 仅针对文本属性图:依赖节点文本属性,非文本图或缺属性场景不适用。
  • 训练效率开销:Cora 上 7.314 s/epoch(含预训练),高于 FairGKD 的 4.100,LLM 推理是主要瓶颈,大图上更明显。
  • LLM 调用成本:GNS 标注与 NGS 逐节点推理均需调用 LLM,扩展比例增大时开销近似线性上升。
  • 超参敏感性:$\beta$(标注监督权重)与 $\eta$(奖励平衡)对性能影响较大,需按数据集调参。

常见问题(FAQ)

PKD 为什么用「预测蒸馏」而不是「特征对齐蒸馏」?

LLM 是 decoder-only 架构、GNN 是 encoder-only 架构,两者嵌入空间特性与维度差异巨大,直接对齐需要复杂映射且训练成本高;预测蒸馏只传递类别概率分布,天然规避了维度与语义对齐问题,是标签稀缺场景下的高效选择。

GNS 如何决定哪些节点值得 LLM 标注?

GNS 计算多教师预测的两两对称 KL 散度之和(K-不确定性 $\delta_K$),按 $\delta_K$ 排序取前 $W$ 个节点;命题证明高 $\delta_K$ 节点对教师 GNN 增强更有益。只标注分歧最大的节点,既保证信息量又控制 LLM 推理成本。

NGS 的强化学习奖励是什么?

奖励绑定学生 GNN 在扩展训练集上的表现:$R=\eta(\mathcal{L}{DL}'-\mathcal{L}{CE})+(1-\eta)A_{cc}$,融合蒸馏损失差、交叉熵损失差与分类精度三部分;消融显示三部分缺一不可,$\eta=0.3$ 最优。

PKD 换了 LLM 还能用吗?

能。论文用 Llama-3.1-8B、Qwen2.5-7B、Mixtral-8x7B 三种 LLM 验证,均全面超越 48% 标签训练的最佳基线;GTA 微调与框架设计本身与具体 LLM 解耦,代码开源可复现。

PKD 的训练成本高吗?

Cora 上每轮约 7.3 秒,是纯 GNN 基线(FairGKD 4.1s)的 1.8 倍,主要来自 LLM 推理;但只标注 Top-W 节点而非全图,成本远低于「全图 LLM 标注 + 蒸馏」的朴素方案,且换取约 10 倍的标签效率。

参考链接

  • 论文 arXiv:https://arxiv.org/abs/2510.10116
  • 官方代码:https://github.com/GEEX-Weixing/PKD
  • NeurIPS 2025 论文集:https://proceedings.neurips.cc/paper_files/paper/2025/hash/954b0037b87b0a1e965b49452eecab76-Abstract-Conference.html
  • Hinton 知识蒸馏奠基工作:https://arxiv.org/abs/1503.02531
  • LLMGNN(LLM-GNN 蒸馏基线):https://github.com/currytang0618/LLMGNN

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群:白拾的小屋 (750365700)

⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页:YhbCode000(工程文件)

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询