“多模态AI”会对人察言观色 更接近人类五感
2020-07-14 17:13:33AI云资讯1506
据《日本经济新闻》7月12日报道,一项可能预示着人工智能(AI)未来走向的技术亮相。这种技术被称为“多模态AI”,像人类通过五感理解周围那样,可以通过图像、声音和文件等多种数据作出高水平判断。AI更接近人类,对社会各个场景带来影响,这样的未来即将到来。

“您吃饭了吗?”“您吃药了吗?”可爱的机器人跟老人聊天的时候顺便提醒道。虽然老人有些时候回答模糊不清,有些时候只是默默点头,新AI可以通过观察情况,机智地判断出“没有问题”。
这是日本内阁府推进的项目一环。有关研究机构正推进由AI看护独居老人等的研究。目标是,通过每天对话发现细微异常变化。
重要的是,新AI不仅可以理解对话内容,还可以通过视频读出感情和动作变化。日本情报通信研究机构的鸟泽健太郎说,如果新AI可以感知体温,则“可以在新冠肺炎疫情时期为老年人提供防护”。
如果是人与人之间的交往,即使对方嘴上逞强说“我很好”,若是她脸色不好,我们也可以推测出对方“可能心里有烦恼”等。传统AI可以对图像、声音和文件进行分析,但不具备察言观色的能力。打破这一壁垒的是多模态AI。
多模态AI展现能力的未来已近在咫尺。韩国大成建设和EXAWIZARDS制造的AI机器人正具备接近人体五感的感觉。
AI从人的动作学习处理不同黏性液体的方法。AI可以比人更灵巧地将正确体积的液体从瓶子倒入烧杯中。
如果是粘稠液体,即使快速倒入,也很难洒出来。如果是像自来水那样的液体,若倒入速度较快,则很容易倒得过多而溢出来。人凭感觉会明白这一点,但对于传统AI而言这是难以理解的。于是,大成建设等采用了多模态AI技术,不管是倒有泡沫的肥皂水还是粘稠的煎饼面糊都不费劲。这种技术可以在药品和食品工厂等发挥作用。
多模态AI应用范围今后将进一步扩大。日本电信电话公司(NTT)正打算有效利用多模态AI进行商标等调查。AI根据图片和解说文字两种信息检查过去是否有类似商标。将来可以期待的是,AI以视频和文字的形式自动记录医院手术室治疗方法。
相关文章
- 阳台储能开创者疆海科技完成数亿元 B 轮融资,押注 AI 时代的家庭能源中心
- 开源!鲸智百应升级,浩鲸科技重新定义企业AI原生
- 万兆AI惠商 联通美好未来 ——中国联通东莞市分公司5・17 电信日暨联通客户日活动圆满举行
- 中国联通在北京地区携手华为发布3000M宽带新产品,全光臻宽带矩阵为“双万兆AI提质行动”添砖加瓦
- 超显商城整合核心GLED显示技术,开启显示设备AI定制新模式
- 博大数据荣膺“全球AI生态基石大奖”,夯实融合算力基础设施服务商领先地位
- 全国人工智能发展大会 AI HANGZHOU 2026中国(杭州)国际人工智能展览会
- 酷开发布企业AI操作系统 开启硅基管理新时代
- 酷开AIOS:定义“企业AI操作系统”的野心与挑战
- 华为超千兆新品亮相山西!三频Wi-Fi 7+AI 焕新智慧家庭新生活
- 辽宁与华为联合发布超千兆三频Wi-Fi 7+AI 新品,共筑辽沈智慧家庭新生活
- 亿达科创亮相国际人工智能展再获AI大奖
- 花旗银行报告称,台积电在AI领域的主导地位不会受到英特尔威胁
- 华为云创想者大会主题论坛议程公布:释放Agentic AI新布局
- 与AI同行 3000M助力 共创智家新生活——中国联通品牌与产品辽宁宣传推广会 全面启动联通社区惠民行系列行动
- 以创新设计重塑 AI 路由未来,MOVA LINCO X1 Pro 荣膺红点奖
人工智能企业
更多>>人工智能硬件
更多>>人工智能产业
更多>>人工智能技术
更多>>- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI,告别传统 UI 开发模式
- 发布即适配| 天数智芯全力支持腾讯混元Hy3 preview 开源落地,共推国内大模型产业普惠
- Seedance 2.0面向企业公测,豆包大模型日均Token使用量突破120万亿
- 端到端OCR模型第一!百度千帆Qianfan-OCR正式发布
- 云知声Unisound U1-OCR大模型发布!首个工业级文档智能基础大模型,开启OCR 3.0时代
- 基石智算上线 MiniMax M2.5,超强编程与智能体工具调用能力
- 昇腾原生支持,科学多模态大模型Intern-S1-Pro正式发布并开源









