目录一、评估1.1 数据集直推式学习归纳式学习1.2 最先进的方法直推式学习归纳式学习1.3 实验设置直推式学习归纳式学习训练细节1.4 实验结果直推式任务归纳任务性能分析特征可视化二、总结图形注意力网络GATs的介绍与特点实验成果与应用场景未来研究方向图神经网络概览图神经网络分享系列-概览上一篇文章图神经网络分享系列-GAT(GRAPH ATTENTION NETWORKS) (二)一、评估针对GAT模型图注意力网络在四项成熟的基于图的基准任务包括直推式和归纳式中与多种强基线及先前方法进行了对比评估所有任务均达到或匹配当前最优性能。本节总结了实验设置、结果并对GAT模型提取的特征表示进行了简要定性分析。关键术语说明GAT模型图注意力网络Graph Attention Network一种基于注意力机制的图神经网络架构。直推式transductive模型在训练时能观察到全部图结构但仅部分节点带有标签。归纳式inductive模型需在训练未见的图结构上泛化适用于动态图场景。强基线strong baselines指对比实验中采用的具有竞争力的基准模型或方法。1.1 数据集直推式学习采用三个标准引文网络基准数据集——Cora、Citeseer和PubmedSen等2008并严格遵循Yang等2016的直推式实验设置。这些数据集中节点代表文档边代表无向的引用关系。节点特征对应文档的词袋表示元素每个节点带有类别标签。每类仅允许20个节点用于训练但根据直推式设置训练算法可访问所有节点的特征向量。训练模型的预测能力在1000个测试节点上评估并额外使用500个节点进行验证与Kipf Welling2017的设置相同。Cora数据集包含2708个节点、5429条边、7个类别每个节点1433维特征。Citeseer数据集包含3327个节点、4732条边、6个类别每个节点3703维特征。Pubmed数据集包含19717个节点、44338条边、3个类别每个节点500维特征。归纳式学习使用蛋白质相互作用PPI数据集该数据集由不同人体组织的图构成Zitnik Leskovec2017。训练集含20张图验证集和测试集各2张图关键点在于测试图在训练期间完全不可见。图的构建基于Hamilton等2017提供的预处理数据。图结构平均每图2372个节点每个节点50维特征包括位置基因集、基序基因集和免疫学特征。标签121个多标签类别源自基因本体论和分子特征数据库Subramanian等2005节点可同时拥有多个标签。表1总结了数据集的特性。1.2 最先进的方法直推式学习在直推式学习任务中比较对象与Kipf Welling (2017)中指定的强大基线及前沿方法相同。包括标签传播LPZhu等2003、半监督嵌入SemiEmbWeston等2012、流形正则化ManiRegBelkin等2006、基于Skip-gram的图嵌入DeepWalkPerozzi等2014、迭代分类算法ICALu Getoor2003以及PlanetoidYang等2016。模型还直接与GCNKipf Welling2017、使用高阶切比雪夫滤波器的图卷积模型Defferrard等2016以及Monti等2016提出的MoNet模型进行对比。归纳式学习在归纳式学习任务中比较对象为Hamilton等2017提出的四种监督式GraphSAGE归纳方法。这些方法提供了多种特征聚合策略GraphSAGE-GCN将图卷积操作扩展至归纳场景、GraphSAGE-mean对特征向量逐元素取均值、GraphSAGE-LSTM通过LSTM聚合邻域特征、GraphSAGE-pool对经共享非线性多层感知机变换的特征向量逐元素取最大值。其他直推式方法要么完全不适合归纳场景要么假设节点逐步添加到单一图中导致其无法适用于训练期间完全未见测试图如PPI数据集的场景。补充对照两项任务中均提供了节点共享多层感知机MLP分类器的性能该分类器完全不利用图结构。1.3 实验设置直推式学习在直推式学习任务中采用双层图注意力网络GAT模型。其架构超参数在Cora数据集上优化后直接复用于CiteSeer数据集。第一层包含K8个注意力头每个头计算F′8个特征共64维特征随后接入指数线性单元ELU非线性激活函数。第二层用于分类单注意力头计算C个特征C为类别数接Softmax激活函数。针对小规模训练集模型内广泛采用正则化策略训练时应用L2正则化λ0.0005并对两层输入及归一化注意力系数均实施丢弃率为p0.6的Dropout关键之处在于每次训练迭代中每个节点的邻域均为随机采样。与Monti等人的发现类似Pubmed数据集因训练集仅60个样本需调整架构改用K8个输出注意力头原为1个并增强L2正则化至λ0.001其余架构参数与Cora和CiteSeer一致。归纳式学习在归纳式学习任务中采用三层GAT模型。前两层均含K4个注意力头每头计算F′256维特征共1024维后接ELU激活。最终层用于多标签分类K6个注意力头各计算121维特征经平均后接逻辑Sigmoid激活。此任务训练集规模充足未使用L2正则化或Dropout但成功在中间注意力层引入跳跃连接。训练时批处理大小为2张图。为严格评估注意力机制的作用与近似GCN模型对比在相同架构下测试了恒定注意力机制a(x,y)1即所有邻居权重相同的效果。训练细节两模型均采用Glorot初始化使用Adam优化器最小化训练节点的交叉熵损失Pubmed初始学习率为0.01其他数据集为0.005。均基于验证节点交叉熵损失及准确率直推式或微观F1分数归纳式进行早停策略耐心值设为100轮。1.4 实验结果我们的对比评估实验结果总结于表2和表3。直推式任务测试节点的分类准确率100次运行均值±标准差与Kipf Welling (2017)、Monti et al. (2016)报告的现有技术指标对比。对于基于切比雪夫滤波的方法Defferrard等2016给出滤波阶数K2和K3时的最高性能。为公平评估注意力机制的优势额外测试了含64维隐藏特征的GCN模型尝试ReLU和ELU激活函数并报告100次运行中的更优结果标记为GCN-64*三组实验均为ReLU更优。归纳任务两个未见测试图的节点微平均F1分数10次运行均值与Hamilton等2017报告的指标对比。由于实验为监督设置仅对比监督式GraphSAGE方法。为评估全邻域聚合的优势额外提供通过调整GraphSAGE架构获得的最佳结果标记为GraphSAGE*即三层LSTM架构每层计算[512, 512, 726]维特征邻域聚合使用128维特征。最后报告恒定注意力GAT模型Const-GAT的10次运行结果以对比类似GCN的聚合方案。性能分析所有四个数据集上均达到或匹配了最优性能验证了2.2节的讨论预期Cora和Citeseer数据集上分别比GCN提升1.5%和1.6%表明对同邻域节点分配不同权重具有优势。PPI数据集提升显著GAT模型比最佳GraphSAGE结果提高20.5%证明模型在归纳场景的应用潜力相比Const-GAT提升3.9%直接验证了差异化注意力权重的重要性。特征可视化通过t-SNE降维可视化Cora数据集预训练GAT模型第一层提取的特征图2。投影后的二维空间呈现清晰聚类对应数据集的七类主题标签证实模型判别能力。同时展示了八头注意力系数的归一化强度分布其具体解释需结合领域知识如Bahdanau等2015年的方法留待未来研究。二、总结图形注意力网络GATs的介绍与特点我们提出了一种新型卷积式神经网络——图形注意力网络其通过掩码自注意力层处理图形结构数据。该网络中的图形注意力层具有计算高效性无需复杂矩阵运算可跨图形节点并行计算能够隐式地为邻域内不同节点分配差异化的注意力权重同时适应不同规模的邻域范围且不依赖预知完整图形结构。这些特性有效解决了以往基于谱方法理论的大部分问题。实验成果与应用场景基于注意力机制的模型在四个成熟的节点分类基准测试中包括转导式和归纳式场景特别是测试阶段使用完全未见过的图形均达到或匹配了最先进性能水平。未来研究方向未来工作可从以下方面改进和扩展图形注意力网络解决第2.2小节所述的实际问题以支持更大批量规模利用注意力机制开展模型可解释性深度分析具有重要研究价值从应用角度出发将方法扩展至图形分类任务而非仅限节点分类引入边缘特征可能表征节点间关系的模型扩展将增强问题解决广度。本篇内容就先到这里实战相关会在下一篇文章给出敬请期待传送门