期刊界 All Journals 搜尽天下杂志传播学术成果专业期刊搜索期刊信息化学术搜索

全文获取类型

收费全文	2篇
免费	0篇

专业分类

综合类

2篇

出版年

2023年

2篇

排序方式： 共有2条查询结果，搜索用时 15 毫秒

互编码器辅助视频的多模态场景分类

黄天阳侯元波李圣辰邵曦《南京邮电大学学报(自然科学版)》2023,(1):104-110

为了解决多模态场景分类准确率不高的问题,文中提出一种由互编码器辅助视频的多模态场景分类方法。音频部分首先对输入音频数据进行特征提取并且使用自注意力机制取得关注信息,图像部分首先对视频进行分帧图片提取,然后通过ResNet50网络进行特征提取,随后提取到的双模态信息进入互编码器,互编码器通过提取各个模态隐层特征进行特征融合,融合后的新特征结合attention机制辅助视频特征。在该模型中,互编码器为融合特征的辅助系统。实验基于DCASE2021 Challenge Task 1B数据集进行验证,结果表明互编码器能够提升分类准确率。相似文献

基于自注意力机制的多模态场景分类

常月侯元波谭奕舟李圣辰邵曦《复旦学报(自然科学版)》2023,(1):46-52

针对真实环境场景会同时出现多种事件导致场景分类准确率受到干扰信息影响的问题，本文提出了一种基于自注意力机制的多模态场景分类方法。首先，对音频进行特征提取并使用自注意力机制获得关注信息；然后，对视频进行分帧图片抽取，通过ResNet 50对图片特征进行提取；最后，将两个模态的特征进行拼接并再次使用自注意力机制对特征信息进行抓取分类。基于DCASE2021 Challenge Task 1B数据集的实验结果表明，与其基线系统、双模态信息简单拼接、视频辅助音频和音频辅助视频的分类系统相比，基于自注意力机制的多模态场景分类系统的准确率优于单模态互相辅助决策的场景分类系统。相似文献