传音TEX AI语音算法团队斩获MLC-SLM 2026国际挑战赛Task 1亚军

2026/07/31 14:55AI云资讯17679

近日,在国际语音领域顶级会议INTERSPEECH 2026卫星活动——第二届多语种对话语音语言模型挑战赛 (Multilingual Conversational Speech Language Model Challenge,MLC-SLM)Task 1赛道中,传音TEX AI中心语音算法团队以自主研发的说话人归属多语种自动语音识别系统取得tcpMER 15.41%的成绩,在全球110支参赛队伍中位列第二。此次突破展现了传音在多语种语音识别、说话人日志、时间对齐与长音频工程化系统等关键方向的系统性技术实力。

本届赛事聚焦多语言对话语音模型面临的关键技术挑战,共吸引来自全球工业界与学术界的110支队伍报名参赛。官方训练数据约2100小时,覆盖14种语言及21个语言变体。 MLC-SLM 2026 Task 1面向真实多人对话场景,要求系统直接处理未预切分、未标注说话人的长音频,同时输出“谁在何时说了什么”的带说话人转写结果。挑战赛评价指标tcpMER同时考察文本准确率、时间位置与说话人归属,任何单一环节的偏差都会传导到最终结果,是对语音算法全链路协同能力的高强度检验。

面对多语种、快速轮次切换、短暂停顿、说话人交叠以及长音频处理等挑战,传音TEX AI中心语音算法团队没有局限于单一模型优化,而是构建了由Speaker Diarization(说话人分离)、Long-form Multilingual ASR(长音频多语种自动语音识别)和Speaker-Transcription Fusion(说话人与转写融合)组成的级联系统:一条链路恢复跨片段一致的说话人结构,对不同说话人进行准确区分;另一条链路负责对多语种长音频进行高精度转写,并为识别结果标注精确的时间戳,最终融合生成可评测、可追溯的说话人归属转写结果。系统形成了从数据清洗、模型训练、推理解码、时间对齐到结果融合的闭环优化能力。

持续、可复现的实验验证是团队取得突破的重要基础。团队从基线出发,通过Local EEND任务适配、融合策略优化、说话人表征与聚类后端升级、SD条件化切分等增量式实验,将赛事评价指标tcpMER从22.78%逐步降低至15.41%,绝对下降7.37个百分点,相对下降约32.4%。此外,团队还完成了端到端方案VibeVoice-ASR的适配验证,形成了级联系统与端到端系统并行探索的技术路线,为后续算法演进储备了更多可能。

此次赛事成绩突破,验证了传音TEXAI中心语音算法团队在多语种语音理解领域的深厚积累。目前,团队已具备将说话人日志、多语种自动语音识别和精细化时间对齐能力灵活组合的工程能力,可根据不同业务场景灵活替换和升级识别模型,并保留可检查、可定位、可持续迭代的中间结果链路,为相关技术在实际业务中的快速落地和持续迭代奠定了基础。

多年来,传音持续加大在多语种语音识别、语音合成及降噪等领域的研发投入,技术能力已覆盖多种语言及本地口音、方言变体,并广泛应用于智能终端的通话、录音、翻译等多个场景,为传音在新兴市场复杂语言环境下的语音体验优势提供了坚实支撑。

未来,传音将持续深化多语种语音交互与语音理解技术研究,推动相关能力在全场景录音、智能终端及更多真实语音交互场景中落地,为全球用户提供更自然、更精准、更具理解力的智能语音体验。

相关文章

AI企业

更多>>

AI硬件

更多>>

AI产业

更多>>

AI技术

更多>>
AI云资讯(爱云资讯)立足人工智能科技,打造有深度、有前瞻、有影响力的泛科技信息平台。
合作QQ:1211461360微信号:icloudnews