腾讯云小微&腾讯云智能钛联合团队获Interspeech 2020口音
2020-10-27 10:55:55AI云资讯1153
近日,语音研究领域顶级会议Interspeech2020召开,在本次大会的口音英语语音识别挑战赛上,腾讯云小微&腾讯云智能钛联合团队在口音英语语音识别赛道中以大幅领先的成绩获得冠军。
Interspeech是由国际语音通信协会ISCA组织的语音研究领域的顶级会议之一。本次大会上提出,在全球范围内,标准英文ASR系统已经具备较高的识别正确率,但口音英语识别仍然是具有挑战性的课题,也是技术应用中亟待克服的最大挑战。为此,大会特别设置了口音英语语音识别挑战赛,正是为了促进行业技术交流,展示最新技术突破。
在本次口音英语语音识别挑战赛中,向参赛者开放了来自不同国家的共八种口音英文数据,覆盖了各种发音特点、口音轻重等典型难点。腾讯云小微&腾讯云智能钛联合团队的技术方案,以识别错误率最低且优于第二名10%的好成绩获得赛道第一。

采用探索性语音识别方案,腾讯联合团队展示技术研究实力
口音语音识别难点主要源于口音本身的不一致性、语速与音素发音的多变性难以建模等问题。另外,带有口音标注的语音数据的短缺也严重限制了相关研究的开展。作为在业内颇具代表性的AI语音技术团队,腾讯云小微&腾讯云智能钛联合团队在此次比赛中,突破性的选择了基于Wav2Vector无监督预训练+CTC Fine-tuning的Wav2Vec方案。该方案的原型是Facebook公司在今年首次提出的。在本次比赛前,几乎没有其他关于Wav2Vector的成功应用。因此,此次比赛是腾讯云小微团队在语音识别方案上的全新探索。
在这个方案中,腾讯团队首先使用Librispeech无监督预训练的Wav2Vector模型进行模型初始化,之后在预训练模型上添加一层输出层,采用英文字母作为建模单元,并使用CTC损失函数进行训练。由于模型采用的是字母建模,识别结果随机性较大,容易引入过多错误。因此,团队引入了语言模型进行约束,大幅提高了识别性能。经实验发现,解码时引入N元文法(N-Gram)语言模型,可以下降30%的识别错误率。同时,进一步采用基于Transformer的语言模型对解码的候选结果进行重打分,错误率可以下降7%。
大规模分布式训练加速,腾讯云智能钛为AI研究与应用提供极致的平台支撑
此次比赛由云小微团队与智能钛团队合力完成,是智能钛平台继2020.8.21与腾讯机智团队一道打破128卡训练ImageNet的业界新记录后,在大规模分布式训练加速场景上的又一个成功案例。智能钛平台整合了腾讯内部各业务团队的丰富经验,针对大规模分布式训练加速场景,在单机性能、多机扩展、AutoML等三个方面进行了深度优化,可以有效地支撑各AI团队的研究与应用。具体如下:
极致的单机性能: 智能钛团队协同内部的开源团队,推出了深度定制版TensorFlow(TI-TensorFlow),在高维动态稀疏特征支持、编译优化、自动混合精度训练等特性上对社区版TensorFlow进行了深度优化,大大提升了模型单机性能。
线性多机扩展: 智能钛TI-Horovod在开源框架的基础上,结合腾讯云的软硬件环境进行了深度优化。通过自研的自适应梯度融合、2D AllReduce和多流通信等技术,实现了近千卡的线性扩展加速。通过首创的层级Topk技术,突破了弱网环境下的带宽瓶颈。
高效AutoML: 针对深度学习训练规模大、超参数范围广和人工调参效率低的问题,智能钛TI-AutoML内置了腾讯自研的高效自动化搜索技术,充分利用腾讯云的海量算力,让算法工程师从繁琐的手工调参中解放出来。
语音技术持续突破,加速各行业落地应用
在AI语音助手的实际应用中,如何提高口音识别成功率,是业内一直在关注和探索的问题。在中英文翻译方面,腾讯云小微输出的技术方案,旨在提高英语语音识别的准确率,进而提升翻译效率和准确性。已经在腾讯翻译君、腾讯同传等各行业方案中广泛应用。
除了中英文翻译领域,腾讯云小微AI助手,已经在智能网联汽车、智慧文旅、智慧教育、智能家居等多行业领域落地,服务广泛的用户群体。口音语音识别的突破,对于中文语音助手的技术提升也有很大的价值。比如在车载语音助手的应用上,一款汽车产品需要满足全国范围不同区域、不同口音用户的交互需求。比如车载语音助手上,由于用户来自全国不同区域,用户的口音将直接影响识别的准确性,特别是对于口音较重的用户。本次挑战赛中,腾讯云小微参赛团队探索端到的AI训练方法,为日后的方案应用落地和迭代提供了更有价值的技术助力,将推动AI语音助手方案为用户带来更好的服务体验。
相关文章
- 生态共赢 赞同科技携手腾讯云斩获三项大奖
- 腾讯云 WeData 升级三大 Data+AI 能力,位居一体化数据智能平台市场第一!
- 腾讯云智能体开发平台升级:做深平台、做厚内容、做强应用,构筑Agent产业合作新生态
- 腾讯云发布 AI 数据湖解决方案,支持 CPU和GPU 混合调度
- 智效跃迁,架构无界,第三届腾讯云架构师峰会圆满落幕!
- 腾讯云ADP国内首发AI原生Widget:一句话秒级生成交互组件,重塑Agent使用体验
- 四川具身科技新品发布,腾讯云全栈AI能力助力提升机器人情感交互能力
- 腾讯云Valkey社区贡献位居全球第一,率先在国内支持8.0版本
- 中国唯一入选!IDC报告:腾讯云斩获亚太前台对话式AI“领导者”评级
- 探讨AI赋能企业转型出海新路径!“腾讯云 TVP 思享会 大湾区数字化转型高管沙龙·香港站”成功举办
- 中国太原煤炭交易中心与腾讯云深化合作 共建煤炭价格指数大模型
- 与AI共生,腾讯云携手行业专家共话数智驱动新质生长
- Gartner®首次发布中国DLP市场指南,腾讯云零信任iOA入选代表厂商
- 腾讯云姚一兆:用全栈AI助力具身智能赛道加速发展
- 腾讯云领跑亚太反欺诈领域,获评Forrester Wave™“领导者”
- 腾讯云无锡峰会:腾讯云服务80%江苏头部民企 混元大模型等AI全栈产品加速进化
人工智能企业
更多>>人工智能硬件
更多>>人工智能产业
更多>>人工智能技术
更多>>- 云知声Unisound U1-OCR大模型发布!首个工业级文档智能基础大模型,开启OCR 3.0时代
- 基石智算上线 MiniMax M2.5,超强编程与智能体工具调用能力
- 昇腾原生支持,科学多模态大模型Intern-S1-Pro正式发布并开源
- 百度千帆深度研究Agent登顶权威评测榜单DeepResearch Bench
- 在MoltBot/ClawdBot,火山方舟模型服务助力开发者畅享模型自由
- 教程 | OpenCode调用基石智算大模型,AI 编程效率翻倍
- 全国首个!上海上线规划资源AI大模型,商汤大装置让城市治理“更聪明”
- 昇思人工智能框架峰会 | 昇思MindSpore MoE模型性能优化方案,提升训练性能15%+









