• 综合
  • 标题
  • 关键词
  • 摘要
  • 学者
  • 期刊-刊名
  • 期刊-ISSN
  • 会议名称
搜索

作者:

王鸣展 (王鸣展.) | 冀俊忠 (冀俊忠.) | 贾奥哲 (贾奥哲.) | 张晓丹 (张晓丹.)

摘要:

近年来,基于自注意力机制的编码器-解码器框架已经成为主流的图像描述模型.然而,编码器中的自注意力只建模低尺度特征的视觉关系,忽略了高尺度视觉特征中的一些有效信息,从而影响了生成描述的质量.针对该问题,文中提出了一种基于跨尺度特征融合自注意力的图像描述方法.该方法在进行自注意力运算时,将低尺度和高尺度的视觉特征进行跨尺度融合,从视觉角度上提高自注意力关注的范围,增加有效视觉信息,减少噪声,从而学习到更准确的视觉语义关系.在M S CO-CO数据集上的实验结果表明,所提方法能够更精确地捕获跨尺度视觉特征间的关系,生成更准确的描述.特别地,该方法是一种通用的方法,通过与其他基于自注意力的图像描述方法相结合,能进一步提高模型性能.

关键词:

自注意力 图像描述 跨尺度特征融合

作者机构:

  • [ 1 ] [王鸣展]北京工业大学
  • [ 2 ] [冀俊忠]北京工业大学

通讯作者信息:

电子邮件地址:

查看成果更多字段

相关关键词:

来源 :

计算机科学

ISSN: 1002-137X

年份: 2022

期: 10

卷: 49

页码: 191-197

被引次数:

WoS核心集被引频次:

SCOPUS被引频次:

ESI高被引论文在榜: 0 展开所有

万方被引频次: -1

中文被引频次:

近30日浏览量: 1

归属院系:

在线人数/总访问数:608/5043569
地址:北京工业大学图书馆(北京市朝阳区平乐园100号 邮编:100124) 联系我们:010-67392185
版权所有:北京工业大学图书馆 站点建设与维护:北京爱琴海乐之技术有限公司