谷歌Live Transcribe应用帮助听障人士“对话”
2019/04/23 15:31AI云资讯10863
4月23日消息,Google人工智能研究团队的高级产品经理Sagar Savla向包括环球科技在内的媒体介绍了一款基于Android系统的应用程序—— Live Transcribe,即通过将自动字幕技术融入日常会话,从而减少现实世界中的对话障碍。

据Sagar Salva介绍称,Live Transcribe是其团队的最新工作成果,它是一款运用自动语音识别技术将现实世界中的实时对话转录为手机屏幕上可阅读的文本的安卓应用程序。Live Transcribe能实现实时的连续转录,支持70多种语言,还可以进行快速切换的双语模式。
据世界卫生组织统计,目前全球有4.66亿人患耳聋或听力障碍,到2050年,这个数字预计将增加到9亿人。
值得一提的是,以往耳聋和听障人士多依赖于人工转录服务,这些服务的费用十分昂贵,并且需要提前很久预约,因此难以在日常对话中频繁使用。Live Transcribe能够让人们只需使用手机的麦克风便可随时随地进行语音转录。
Sagar对记者表示:“该应用的自动语音识别系统分为三个部分。第一个部分是声学模型,主要辨别单词中的不同音节;第二个部分是发音模型,将辨别出来的不同音节组成实际的单词;第三部分是语言模型,会根据识别出来的单词增加适当的标点符号停顿。”
据了解,为了使Live Transcribe尽可能直观,在模式上有几种可考虑的模式:计算机、平板电脑、智能手机乃至小型投影仪,最后决定专注于智能手机模式。
对此,Sagar解释道,“我们也曾考虑可穿戴设备,但这种设备造价相对较高,普及率也远不及手机。因此,我们最终还是选择了手机为主要平台,旨在帮助更多听觉有障碍的人群。”
相关文章
- 谷歌投资A24,共同开发人工智能电影制作工具
- 数据中心耗电远超电网负荷,迫使英伟达与谷歌在2026年第三季度前启动800V直流电架构改造
- 苹果和谷歌新增对Thread 1.4的支持
- 宜选科技出席2026谷歌合作伙伴峰会
- 苹果在新版Siri上作出妥协:依靠英伟达B200 GPU加密技术,防止谷歌窃取用户数据
- 谷歌Beam抢滩多人会议全息赛道,微美全息以AI+5G解锁虚实融合视觉新想象
- Google I/O 2026亮点回顾:晶晨股份携手谷歌共拓端侧AI新生态
- 谷歌搜索的人工智能进化包含更多广告
- 谷歌的未来是一个无所不能的搜索框
- Google I/O 2026:Gemini 将成为谷歌年度开发者大会的主角
- 2026智能眼镜“百镜争鸣”,谷歌/阿里/微美全息引领AR/XR产业全面升级
- 谷歌发布 Chromebook 后继产品——Googlebook
- 谷歌称其首次发现并阻止了一个利用AI开发的零日漏洞
- 谷歌首款AI眼镜即将呼之欲出,微美全息(WIMI.US)扎实推进AI+AR生态落地
- 谷歌母公司发布2026年一季度财报,搜索查询量创下历史新高
- 英伟达Rubin芯片落地谷歌A5X实例,多站点集群规模扩展至近百万颗GPU
AI企业
更多>>AI硬件
更多>>AI产业
更多>>AI技术
更多>>- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI,告别传统 UI 开发模式
- 发布即适配| 天数智芯全力支持腾讯混元Hy3 preview 开源落地,共推国内大模型产业普惠









