多模态深度语义理解:让AI从“看清听清”到“看懂听懂”
2018/07/09 16:16AI云资讯11335
“多模态深度语义理解能让机器听清、看清,更能深入理解它背后的含义,深度地理解真实世界,进而更好地支撑各种应用。”百度高级副总裁、AI技术平台体系(AIG)总负责人王海峰表示。

日前,在百度AI开发者大会(Baidu Create 2018)上,王海峰发布百度大脑3.0。百度大脑3.0的核心是“多模态深度语义理解”,包括数据的语义,知识的语义,以及图像、视频、声音、语音等各方面的理解。
如何实现从“看清听清”到“看懂听懂”?
视觉语义化可以让机器从看清到看懂视频,并提炼出结构化语义知识。百度视觉技术部、人脸技术部、增强现实技术部总监吴中勤介绍,视觉语义化技术首先识别人、物体和场景,同时捕捉它们之间的行为和关系,通过时序化、数字化、结构化的方式形成语义知识,最终结合领域和场景进行智慧推理,落地行业应用。
未来,视觉语义化技术还可进一步延展,它结合新型的传感器和AI芯片,可以在感知层面和计算层面得到大幅提升;结合手机可以带给用户更佳地使用体验。
语音技术的升级则让机器更好地听懂世界。百度语音技术部总监高亮表示,百度基于远场的语音语义一体化技术已取得突破,可为业界提供更顶尖的远场语音技术。
语音语义一体化将远场交互中高频Query识别准确率提升10个点,并保持普通Query识别率不降;多语种混合声学建模基于Deep Peak2大幅提升中英文混合Query识别准确率,相对错误率比业界最好竞品降低20%;新升级的TTS技术业界首创传统拼接技术与Wavenet技术融合方案,保证合成质量的同时大大降低成本,让大规模应用落地成为现实。
在对话理解方面,百度理解与交互技术平台UNIT升级至2.0,进一步增强冷启动能力,支持像人类一样在对话当中学习,同时开放了第一个工业级对话系统开源框架,降低搭建门槛,让开发者无缝对接云端。
将自主研发的芯片纳入技术体系
数据、算法、算力是影响人工智能技术发展的重要因素。王海峰表示百度大脑3.0首次将芯片纳入技术体系,带动百度大脑算力爆发式增长。百度自主研发的中国第一款云端全功能AI芯片“昆仑”也在会上首次亮相。未来,AI芯片将与百度自主研发的PaddlePaddle深度学习框架相结合,推动百度AI产业生态快速发展。
百度在2016年正式开源的PaddlePaddle,如今也迎来了PaddlePaddle3.0版本。百度AI技术生态部总经理喻友平对此进行了详细解读。PaddlePaddle3.0包括完整的核心框架,以及AI Studio、AutoDL、EasyDL等可以让开发者获取AI能力的平台。
PaddlePaddle3.0核心框架对服务器版本以及移动端版本进行了全面优化,PaddlePaddle Fluid提供丰富的满足常见主流模型搭建需求的API,支持广泛的模型搭建,训练Runtime可以满足各类型的模型训练需求;PaddlePaddle Serving可灵活适配多种预测引擎;PaddlePaddle Mobile集成百度移动端预测的实践经验,提供多平台支持。
百度大脑升级至3.0是百度AI技术的一次跨越式升级,王海峰强调,“百度AI能力的核心是百度大脑,百度大脑3.0是百度AI能力的集大成者。”未来,百度将逐步把基于百度大脑的技术突破开放给相关的开发者和企业。
相关文章
- 中山大学、南洋理工大学、混沌摆实验室提出 ProSA 多模态文档解析评测框架|EMNLP 2026
- Clipto MCP斩获 Product Hunt 月榜第一:为全球智能体补上个人多模态记忆
- 紫东太初开源 ZDTaichu5.0-9B:10B 参数内空间具身能力最强通用多模态大模型
- 中科融合NANO微小型多模态高速扫描模组赋能具身智能迈向精细化作业
- 2026时序数据技术创新大会:多模态时序数智化软件栈发布,生态计划启动
- 联合影像 × 华力创科学,共筑具身智能的多模态感知底座
- 填补行业空白!宇视科技联合多家权威机构发布中小学心理健康多模态智能动态评估团体标准
- 原生统一多模态进阶!SenseNova U1.5-Lite-Preview开源,生成编辑能力再进化
- 商汤发布日日新SenseNova U1 Pro,面向长程任务的交付级原生多模态智能体基座
- 当虹科技AI多模态能力体系,首次亮相WAIC2026
- 看懂一条素材,不能只靠字幕和肉眼:钛动科技把多模态理解拉进营销现场
- 合合信息一季度财报营收同比增27.53%,联手亚马逊云科技落地多模态文档智能体
- 多模态、无代码、全流程 东软多模态医学人工智能平台 让医生轻松用AI
- 旷视多模态上下文学习工作被全球顶会ICML 2026录用,亮相韩国首尔
- 灵科超声波多模态控制与全链互联重构全球焊接柔性生产线
- Om AI联汇发布VLX:全球首个面向物理世界的端侧流式多模态模型
AI企业
更多>>AI硬件
更多>>AI产业
更多>>AI技术
更多>>- 阶跃这次够狠:AA 全球开源前二,价格打到 Claude 的 1/8
- 科大讯飞发布Spark-Audio-1.0-Preview,全国产语音基座大模型实现从“听清”到“听懂”
- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练









