AI让远程交流“更清晰”:GAN消除视频通话中的抖动
2020/10/22 16:19AI云资讯10872
NVIDIA Maxine是一款云AI视频流平台,将使用GAN来提高带宽性能。

Ming-Yu Liu 和Arun Mallya 正在进行视频通话,其中一个人的画面开始出现卡顿,直至画面定格。
这是一种常见且令人反感的情况。但与大多数人不同的是,Liu和Mallya可以做出一些改变。
他们是NVIDIA的AI研究人员,专攻计算机视觉。在与Ting-Chun Wang共事中,他们意识到可以使用神经网络来替代被称为视频编解码器的软件,这种软件通常用于视频在网络传输过程中的压缩和解压缩。
迄今为止,他们的工作成果将用户在视频通话时所需的网络带宽压缩至原来的十分之一,还有望将带宽消耗降低数个数量级。
Mallya表示:“我们希望通过AI提供更好的视频沟通体验,即使在带宽极低的情况下,也可以从语音升级到视频通话。”
GAN让连接质量更佳
即使用户的面部有遮挡(比如戴着帽子、眼镜、耳机或口罩),这项技术同样适用。为了增加趣味性,他们在演示中使用了一些装饰物,这样用户可以在线上更改其发型或衣服或者创建头像。
更重要的是,如上图所示,借助神经网络定位,无需再盯着显示器上方摄像头才能与对方对视,这增强了面对面对话的感觉。
Wang表示:“借助计算机视觉技术,我们可以从多个角度来定位头部。我们认为这将帮助人们更自然地进行对话。”
迎接最前沿的AI技术,让虚拟生活更真实。
AI赋能视频通话的原理
AI辅助视频通话的工作机制十分简单。
与目前使用压缩的视频流的系统类似,参考图像发送后,仅用户眼睛、鼻子和嘴巴周围几个关键点的位置数据被发送,而非发送大量压缩过像素的图像。
接收端的生成式对抗网络通过初始图像和面部关键点,在本地GPU上重构后续图像。因此,通过网络传输的数据要比之前少得多。
Liu在GAN领域的工作成果GauGAN曾引发关注。GauGAN是一种可以将涂鸦转化为写实艺术作品的AI工具,目前已经创建了超过一百万张图像。该工具可在AI Playground中获取。
Liu表示:“疫情期间频繁的视频会议启发了我们,因此我们开始探索突破带宽瓶颈的方式,让供应商可以同时为更多人提供服务。”
GPU突破带宽瓶颈
这一方法顺应当前行业趋势,将网络瓶颈转化为计算任务,从而借助本地或云端资源更轻松地解决此类问题。
NVIDIA媒体集团高级产品总监Andrew Page表示:“如今,许多公司希望将带宽问题转化为计算问题,这是因为带宽一般很难增加,而增强算力则相对容易。”

NVIDIA Maxine搭配了一套视频会议和流媒体服务工具
AI 工具优化视频服务
GAN视频压缩是NVIDIA Maxine即将推出的几个功能之一,这是一个云AI视频流平台,用于增强视频会议和电话质量。它将音频、视频和对话式AI功能整合在一个工具包中,并支持多种设备。
在上周的GTC大会上,NVIDIA宣布推出了Maxine平台。基于该平台,服务提供商能够在提供超高分辨率的视频的同时,实现实时翻译、噪声消除和情景感知的闭路字幕。用户可以享受到人脸校正、虚拟助手和化身逼真的动画角色等功能。
Page表示:“视频会议正在经历一场复兴。疫情期间,它的缺点给所有人带来了不愉快的使用体验,但回归视觉动物的属性,视频终将成为人们今后生活中的一部分。”
通过利用基于Tensor Core核心的NVIDIA GPU,Maxine可运行如NVIDIA Jarvis的软件。NVIDIA Jarvis是用于对话式AI的SDK,提供了一套语音和文本功能。 它们共同提供了当今有用的AI功能,并成为未来视频产品和服务的基石。

相关文章
- 长飞空芯光纤护航香港电讯3.2T AI超级互联通道
- 弘成AI智课:重构课程生产能力,让好课无需久候
- 阿里达摩院开放15项芯片与AI研究课题,启动“阿里星”顶尖人才招募
- 华为提出四大融合价值主张,场景+AI驱动中小微企业提质升级
- 视比特发布“翔睿”智能体平台:让AI踏踏实实帮一线员工干活
- 不止于显示!Micro LED光互联/AI+AR智能眼镜/玻璃基板TGV等全新赛道集中亮相,创新动能尽在2026深圳国际全触与显示展
- 积木易搭主办的《AI+全栈式三维技术应用与教学创新能力提升班》开班
- 容联云新一代Voice Agent:让AI开始按「结果」收费
- 三星突破存储与内存瓶颈:推出 400 层以上混合键合 V10 BV-NAND,同时实现 zHBM 直叠 AI 芯片
- 谷歌 AI 核心管理层迎来重大调整,负责人戴密斯·哈萨比斯卸任
- 前蔚来 AI 平台负责人创业,瞄准具身智能的数据闭环
- CATIA V5,要不要为 AI 硬上 3DEXPERIENCE?
- 搭贝ai低代码平台融合rag技术企业ai应用新路径
- 慧荣科技亮相 FMS 2026,展示面向 Agentic AI 应用的新一代存储方案
- AI时代已至,你的每一次消费都该“值钱“——华夏数据集团旗下《好店生活AI商城》引领消费数据资产化新浪潮
- AI赋能模具技术 | 大捷智能携手行业同仁共探模具智能设计转型
AI企业
更多>>AI硬件
更多>>- 韶音投了一家端侧Infra公司,00后清华博士生打造AI native终端|智能涌现融资首发
- 海柔创新闪攀机器人商业化进程全面提速,交出首份运营成绩单
- 技嘉 GO27Q32 正式发布:五重 QD-OLED 面板加持,320Hz 极速与影院级画面兼得
- vivo 2026“童画未来夏令营”圆满落幕,以科技为笔,绘就美育未来
- 重塑折叠屏新格局 三星Galaxy Z Fold8 Ultra|Z Fold8|Z Flip8正式开售
- 专业设计,不止于创意:AOC双屏方案赋能全流程专业视觉设计
- HUAWEI MatePad Edge上架WorkBuddy鸿蒙PC版,说话就能干活的AI办公搭子
- 翻译只是起点:讯飞AI眼镜的AI助理能力全面拆解
AI产业
更多>>AI技术
更多>>- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI,告别传统 UI 开发模式
- 发布即适配| 天数智芯全力支持腾讯混元Hy3 preview 开源落地,共推国内大模型产业普惠









