基于深度学习的方言语音识别模型优化

2026.08.08点击:

摘要:<正>方言语音识别面临音系复杂、语速差异与语法偏移等问题,传统声学模型在多方言条件下识别率显著下降。本文在深度学习框架下构建了一种基于Conformer编码器与非自回归解码器的端到端识别系统,通过多目标联合损失实现声学对齐与误差约束的动态平衡。模型在编码器中引入轻量方言自适应模块,以瓶颈映射与低秩分解方式提升对区域特征的敏感度,同时采用字音联合子词机制(PABPE),将字形与音节嵌入统一建模以缓解同字异读问题。此外,结合多源语料与分层标签体系,辅以速率扰动、频谱遮挡、混响模拟等多维数据增强,显著提高了模型在跨方言与多通道条件下的鲁棒性。

基金资助: 2025湛江市非资助科技攻关计划项目——“多模态AI驱动的雷州民谣数字化传承”(2025B01021);

专辑: 信息科技

专题: 电信技术;自动化技术

分类号: TN912.34;TP18