一种基于自注意力机制与多标签监督对比学习的自注意力融合分类网络,旨在通过挖掘双眼底图像的互补信息与全局语义关联,提升多标签分类的准确性与鲁棒性。
首先,设计眼间自注意力模块,通过建模双眼图像的空间与通道相关性,动态调整特征权重,增强模型对病灶区域的定位能力。在此基础上,构建自注意力融合网络,结合深度理解卷积核与空洞空间金字塔模块,实现多尺度特征的高效融合,并引入三分支输入策略,融合浅层局部特征与深层语义信息。进一步提出标签水平嵌入策略,利用多标签监督对比学习优化类别间的特征可分性,缓解相似疾病特征混淆问题。此外,设计基于判别受限玻尔兹曼机与多层感知机的标签嵌入分类器,引入软门控机制,强化正常类别与其他病理类别的区分性,突出正常类别作为互斥类别的独特性,提升多标签预测的稳定性。
实验基于ODIR-5K数据集验证方法有效性,所提模型在精准度、召回率、F1分数与AUC指标上分别达到90.39%、91.61%、90.99%与90.76%,较次优模型提升1.75%、2.26%、2%与3.18%。消融实验表明,眼间自注意力模块与多标签对比学习分别贡献了20.76%和11.91%的F1分数提升。实验结果显示,模型在各类别数据上均表现良好。
本文所提出的创新点主要包含:
-
设计将来自同一个人的左右双眼底图像同时输入的双输入多标签分类网络,在浅层与深层分别进行不同程度与方式的融合,形成不同深度的语义信息互补;
-
提出原创的眼间自注意力模块,通过联合建模双眼图像的全局空间与通道相关性,在传统自注意力机制上额外增加了通道方向上的自注意力机制,增强了模型对病灶区域的关注能力;
-
构建自注意力编码模块,基于本文提出的眼间自注意力模块,计算了不同输入顺序下左眼特征与右眼特征之间的注意力,实现强相关双图像之间的自注意力机制,根据双眼之间的相似程度对全局特征进行调节;
-
构建自注意力融合模块,基于本文提出的眼间自注意力模块,结合深度理解卷积核模块与空洞空间池化金字塔模块、以及网络设计中的三分支输入,实现了多尺度特征、多深度语义信息的高效融合;
-
设计多标签监督对比学习策略,通过标签水平嵌入向量优化分类任务,同时构建适用于标签水平嵌入向量的特殊标签嵌入分类器,提升了模型对相似疾病的区分度。




