|
|
基于坐标注意力的ECAPA-TDNN模型性能研究
2026 (2):
241-247.
doi: 10.1007/s12204-024-2726-z
摘要
(
792 )
PDF(473KB)
(
241
)
尽管深度学习在说话人验证方面取得了巨大进步,仍然存在许多挑战。一个关键的挑战是提取具有高度辨别力的说话人表示。为了解决这个问题,研究人员设计了更复杂的网络结构,例如SE-ResNet 和 ECAPA-TDNN。这些模型通过在卷积块中加入压缩激励注意力(SE),以增强说话人嵌入提取器的能力,进而提取更具辨别力的说话人表示。然而,SE注意力仅对通道信息建模,忽视了空间位置信息和时频信息的重要性,这些信息可能有助于提高模型性能和泛化能力,尤其是时频信息在语音任务中的关键作用。本文中,首先通过实验比较了计算机视觉领域几种主流注意力机制对于ECAPA-TDNN模型的有效性。着重分析了通道信息、时频信息以及空间位置信息对ECAPA-TDNN模型性能的影响程度。随后,重点关注坐标注意力(CA)为 ECAPA-TDNN 模型带来的实质性改进。 CA机制的引入有助于将时频信息嵌入到通道表示中,从而帮助模型提取更丰富的时频表示。与基线相比,提出的模型在 Voxceleb-O、Voxceleb-E和 Voxceleb-H 数据集上均实现了性能提升。并且CN-Celeb1测试集上的结果也有力证明了CA模块能有效提高ECAPA-TDNN模型的泛化能力。
参考文献 |
相关文章 |
计量指标
|