摘要
本文解读 NeurIPS 2025 论文《Preference-driven Knowledge Distillation for Few-shot Node Classification》。该论文提出偏好驱动的知识蒸馏框架 PKD,通过融合GNN 偏好节点选择器 GNS、节点偏好 GNN 选择器 NGS与图拓扑感知(GTA)提示微调,让大语言模型(LLM)与多种图神经网络(GNN)在少样本节点分类上互补协同,其特别之处在于把蒸馏粒度细化到「节点-教师」配对级别。实验表明仅用每类 5 个标注节点即可在 Cora 上达到 91.14% 准确率,在 9 个真实文本属性图上全面超越用 48% 标签训练的最强基线,为少样本图学习提供了重要的范式参考。
视频讲解:点击观看 B 站视频
- 摘要
- 论文基本信息
- 背景与动机
- 研究主线:从问题到结论
- 基准/方法设计
- 分类全景
- 方法细节
- 实验设计与结果
- 结果对比总结
- 关键发现
- 局限性
- 常见问题(FAQ)
- PKD 为什么用「预测蒸馏」而不是「特征对齐蒸馏」?
- GNS 如何决定哪些节点值得 LLM 标注?
- NGS 的强化学习奖励是什么?
- PKD 换了 LLM 还能用吗?
- PKD 的训练成本高吗?
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | Preference-driven Knowledge Distillation for Few-shot Node Classification |
| 标题(中文) | 偏好驱动的知识蒸馏:少样本节点分类 |
| 作者 | Xing Wei, Chunchun Chen, Rui Fan, Xiaofeng Cao, Sourav Medya, Wei Ye |
| 机构 | 同济大学电子与信息工程学院 / 同济大学计算机系 / 伊利诺伊大学芝加哥分校 |
| 会议 | NeurIPS 2025 |
| arXiv | https://arxiv.org/abs/2510.10116 |
| 项目网站 | https://github.com/GEEX-Weixing/PKD |
背景与动机
文本属性图(TAG)——如引文网络、网页图、商品共购图——上的节点分类,图神经网络(GNN)凭借消息传递机制高效运行,但训练严重依赖人工标注,而真实场景往往只有每类 1–5 个标签。更深层的问题是:真实图节点的局部拓扑复杂多样,单一消息传递机制(GCN 的同质性假设、GAT 的注意力加权、APPNP 的个性化传播)无法同时覆盖所有节点。
已有工作各有短板:
- 传统 GNN(GCNII、EGNN):在标签极度稀疏时能力受限,GCNII 在 Ogbn-Arxiv 上仅 35.14%。
- LLM 增强 GNN(LLMGNN、GAugLLM):LLMGNN 缺乏精细微调与认知能力,伪标签质量低;GAugLLM 依赖 SoftMax 分数自训练,选节点不可靠,仅在 Pubmed 上最优(85.98%)。
- 自训练方法(Self-training、AGST、IceBerg):AGST 过度依赖原始拓扑做标签传播,在大图 Ogbn-Arxiv 上直接 OOM;IceBerg 在异质图上因噪声边传播失败,Wisconsin 仅 41.53%。
- 图知识蒸馏(KDGA、MSKD、BGNN、MTAAM、FairGKD):KDGA 与 BGNN 对教师选择过度敏感,MSKD 固定消息传递机制,在所有数据集上均不如 PKD;MTAAM 与 FairGKD 表现较好但仍受限于「顺序/同时蒸馏」范式——不感知节点级局部拓扑。
同时,LLM 零/少样本能力强(如 Llama-3.1-8B、Qwen2.5-7B),但参数量大、推理难扩展,且与 GNN 的嵌入空间差异巨大(decoder-only vs encoder-only),直接蒸馏不可行。PKD 的思路是:让 LLM 只标注最有价值的分歧节点,让每个节点只听最懂它的教师。
研究主线:从问题到结论
图 6:PKD 研究主线流程图——问题→动机→预测蒸馏→双向偏好设计→9 数据集评测→结论(Mermaid 流程图)。
基准/方法设计
PKD 框架的总设计原则是「双向偏好」:GNS(GNN-preference-driven Node Selector)选出GNN 偏好的节点交给 LLM 标注,NGS(Node-preference-driven GNN Selector)为每个节点选出节点偏好的教师做定制化蒸馏。前置条件是先用 GTA 提示微调 LLM,使其具备图拓扑理解能力——GTA 设计了 4 类结构化任务:连通性判断、节点度、环检测、随机游走文本生成。
图 1:GTA 提示微调后 LLM 的零样本节点分类性能提升——微调让 LLM 在多数图上超越部分半监督 GNN,为高质量标注奠定基础。
分类全景
图 7:LLM×GNN 协同蒸馏分类全景——GTA 微调、GNS 节点选择、DNS 邻居选择与 NGS 教师选择四大模块(Mermaid 分类图)。
方法细节
核心设计四要素(框架图见图 2):
- K-不确定性 $\delta_K$:定义为 $B$ 个教师 SoftMax 输出两两之间的对称 KL 散度之和。论文给出命题与证明:高 $\delta_K$ 节点对教师 GNN 增强更有益(证明见附录)。按 $\delta_K$ 排序得到偏好排名 $\mathcal{V}_{PR}$,只取前 $W$ 个节点交给 LLM 标注,同时降低 LLM 推理成本。
- DNS 距离邻居选择:在预训练教师 GNN 的嵌入空间对每个选中节点做 KNN 搜索并去重,将邻居文本与节点语义拼成类别归纳提示——摆脱 1-hop 同质性偏差,K 默认取 4。
- 三部分蒸馏损失:$\mathcal{L}{KD}=\alpha\mathcal{L}{DL}+\beta\mathcal{L}_{CE}+\gamma H(f_S)$,其中软标签由节点偏好掩码 $\mathbf{m}_i$ 加权($\widetilde{\mathbf{z}}_i^T=\mathbf{m}_i\otimes\mathbf{z}_i^T$)。
- NGS 强化学习:把教师选择建模为 RL——State 是节点语义/结构/预测属性提示,Action 是离散教师采样,Reward 为 $R=\eta(\mathcal{L}{DL}'-\mathcal{L}{CE})+(1-\eta)A_{cc}$($A_{cc}$ 为学生 GNN 分类精度)。LLM 解码不可微,故在 logit 层后加两个 MLP 投影器输出动作概率与价值估计;优化用简化版 PPO(无显式 Reward/Reference 模型,CLIP 限幅),学生 GNN 参数全程固定。
图 2:PKD 框架总览——两大模块 + DNS 提示构造,构成完整的双向偏好闭环。
实验设计与结果
评测协议:9 个真实 TAG 数据集(同质性 0.150–0.825),每类随机 1/3/5 个标签作为初始训练集,由 GNS 扩展到 48% 训练比例,其余 32% 验证 / 20% 测试,重复 5 次。同质图教师池为 GCN/GAT/APPNP/H₂GCN(学生 GCN),异质图教师池为 DirGNN/GPRGNN/HoloNets/H₂GCN(学生 H₂GCN)。基线含 GCNII、EGNN、LLMGNN、GAugLLM、Self-training、AGST、IceBerg、KDGA、MSKD、BGNN、MTAAM、FairGKD 及 Random/Voting。
主表(PKD 每类 5 标签 vs 用 48% 标签训练的基线,准确率 %):
| 方法 | Texas | Amazon Ratings | Ogbn-Arxiv | Cora |
|---|---|---|---|---|
| 最佳教师 T(48% 标签) | 82.83 | 48.93 | 59.19 | 88.38 |
| GAugLLM(48% 标签) | 73.81 | 42.42 | 53.47 | 79.48 |
| AGST(48% 标签) | 68.45 | 43.11 | OOM | 77.25 |
| MTAAM(48% 标签) | 80.81 | 39.54 | 32.32 | 79.16 |
| Voting(48% 标签) | 61.31 | 58.64 | 58.53 | 74.32 |
| PKD #LN 1 | 80.36 | 64.11 | 53.67 | 85.64 |
| PKD #LN 5 | 86.31 | 66.79 | 61.03 | 91.14 |
图 3:K-不确定性节点分布(Cora)——从箭头处逆时针 KL 散度和递增、颜色加深,PKD 优先选择高不确定性节点。
消融与机制验证:
- GTA+DNS+$\mathcal{V}_{PR}$ 三组件全开:Cora +41.14pp、Amazon Ratings +23.97pp,三组件互补(各去掉一个均有显著回落)。
- 教师选择机制对比(Cora):RL 90.27vs Entropy 75.70 / Random 62.80 / End-to-end 60.29——为每节点学分配策略是核心价值。
- 奖励函数消融:精度 $R_1$ → +CE $R_2$ → +DL $R_3$,三部分缺一不可(图 5)。
图 4:邻居数 K 的敏感性——K=4 在多数图上取得峰值,是默认参数依据。
图 5:奖励函数消融——分类精度、交叉熵与蒸馏损失三部分共同作用时训练表现最优。
扩展性与运行时间:标注扩展比例 10%→48% 时 Cora 从 73.37 涨到 91.14(+17.77pp);代价是每轮训练约 7.3 秒(Cora),约为纯 GNN 方法(FairGKD 4.1s)的 1.8 倍。附录 A 数据集统计(同质性/节点/边/类)、附录 B 三种 LLM(Llama/Qwen2.5/Mixtral)一致性验证、附录 E 超参敏感性($\alpha=0.5,\beta=1,\gamma=0.1,\eta=0.3$ 最优,$\beta$ 与 $\eta$ 最敏感)等细节见视频附录。
结果对比总结
图 8:PKD 结果对比总结——5 标签/类下 Cora 91.14%、Texas 86.31%、Amazon 66.79%,全面超越 48% 标签基线(Mermaid 对比图)。
关键发现
- 标签效率提升近 10 倍:PKD 每类 5 标签在 Cora 达 91.14%,优于 GCNII 用 48% 真实标签的 81.54%,LLM 标注质量逼近真实标签。
- 9 数据集一致领先:无论同质(Cora 91.14%)还是异质(Texas 86.31%)图,PKD 全部超越用 48% 标签训练的最强基线,最好成绩 6/9 数据集。
- LLM 无关性:换 Qwen2.5-7B(Cora 90.07)与 Mixtral-8x7B(Cornell 81.58、Wisconsin 77.36)依然领先,框架收益不依赖特定 LLM。
- 选对节点比多标注更重要:K-不确定性选节点 Cornell 达 80.95%,随机选择仅 54.31%(#LN5),差距 26.64pp。
- 消融三件套互补:GTA、DNS、$\mathcal{V}_{PR}$ 全开在 Cora 提升 41.14pp、Amazon Ratings 提升 23.97pp,每个组件独立贡献。
- RL 教师选择碾压启发式:RL 90.27 比熵排序 75.70 高 14.57pp(Cora),比端到端学习 60.29 高 29.98pp。
局限性
- 仅针对文本属性图:依赖节点文本属性,非文本图或缺属性场景不适用。
- 训练效率开销:Cora 上 7.314 s/epoch(含预训练),高于 FairGKD 的 4.100,LLM 推理是主要瓶颈,大图上更明显。
- LLM 调用成本:GNS 标注与 NGS 逐节点推理均需调用 LLM,扩展比例增大时开销近似线性上升。
- 超参敏感性:$\beta$(标注监督权重)与 $\eta$(奖励平衡)对性能影响较大,需按数据集调参。
常见问题(FAQ)
PKD 为什么用「预测蒸馏」而不是「特征对齐蒸馏」?
LLM 是 decoder-only 架构、GNN 是 encoder-only 架构,两者嵌入空间特性与维度差异巨大,直接对齐需要复杂映射且训练成本高;预测蒸馏只传递类别概率分布,天然规避了维度与语义对齐问题,是标签稀缺场景下的高效选择。
GNS 如何决定哪些节点值得 LLM 标注?
GNS 计算多教师预测的两两对称 KL 散度之和(K-不确定性 $\delta_K$),按 $\delta_K$ 排序取前 $W$ 个节点;命题证明高 $\delta_K$ 节点对教师 GNN 增强更有益。只标注分歧最大的节点,既保证信息量又控制 LLM 推理成本。
NGS 的强化学习奖励是什么?
奖励绑定学生 GNN 在扩展训练集上的表现:$R=\eta(\mathcal{L}{DL}'-\mathcal{L}{CE})+(1-\eta)A_{cc}$,融合蒸馏损失差、交叉熵损失差与分类精度三部分;消融显示三部分缺一不可,$\eta=0.3$ 最优。
PKD 换了 LLM 还能用吗?
能。论文用 Llama-3.1-8B、Qwen2.5-7B、Mixtral-8x7B 三种 LLM 验证,均全面超越 48% 标签训练的最佳基线;GTA 微调与框架设计本身与具体 LLM 解耦,代码开源可复现。
PKD 的训练成本高吗?
Cora 上每轮约 7.3 秒,是纯 GNN 基线(FairGKD 4.1s)的 1.8 倍,主要来自 LLM 推理;但只标注 Top-W 节点而非全图,成本远低于「全图 LLM 标注 + 蒸馏」的朴素方案,且换取约 10 倍的标签效率。
参考链接
- 论文 arXiv:https://arxiv.org/abs/2510.10116
- 官方代码:https://github.com/GEEX-Weixing/PKD
- NeurIPS 2025 论文集:https://proceedings.neurips.cc/paper_files/paper/2025/hash/954b0037b87b0a1e965b49452eecab76-Abstract-Conference.html
- Hinton 知识蒸馏奠基工作:https://arxiv.org/abs/1503.02531
- LLMGNN(LLM-GNN 蒸馏基线):https://github.com/currytang0618/LLMGNN
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟复旦大学 FudanNLP 团队自研 切问学术
官网:qiewenpaper.com
覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)