首页 > 科技 > 用GAN消除视频会议模糊,神奇的Vid2Vid Cameo模型

用GAN消除视频会议模糊,神奇的Vid2Vid Cameo模型

无需会议室和出差,打开手机,登录APP,就可以和千里之外的人“面对面”开会。疫情下,这种场景已经成为很多打工人工作的常态。

作为一种实时的网络应用,视频会议对网络的要求比较高。当下视频会议过程中,因网络信号问题,常会导致与会者频频掉线、屏幕共享画面不清晰,影响开会的效率。此外,成像角度不佳、客观原因造成个人形象不佳等问题,也将影响与会者的开会体验。如何在低网络带宽下,进行流畅、清晰的视频会议,成为困扰众多视频会议开发者的难题。

此前,开发者大多通过调整图像分辨率、码流、帧数等方式实现视频数据压缩,解决低网络带宽下视频会议问题。虽然这类方法可以缓解视频会议卡顿问题,但会导致视频图像模糊、不连贯。

而以深度学习为代表的卷积神经网络具有更深的学习层次,能够有效的去除掉冗余数据特征,获得更高的压缩比,开发者们倾向于使用神经网络来替代以前的方法。同时,由于带宽一般很难增加,而增强算力相对容易,所以开发者们也更希望将带宽问题转化为计算问题。

基于此,NVIDIA 研究团队从AI维度出发,开发了一个用于视频会议软件 NVIDIA Maxine SDK的深度学习模型Vid2Vid Cameo,只需一张照片或卡通头像,就能合成逼真的3D人脸说话视频。

一、视频会议Maxine SDK背后的AI生成模型

受疫情影响,远程协作和办公已逐渐成为不可逆转的趋势,这使得各种视频会议APP下载量激增,成为打工人的标配。

为了增强用户的视频会议使用体验,NVIDIA推出了一套基于云的、GPU加速的 AI 视频会议软件Maxine。NVIDIA Maxine 包括三个 AI SDK:视频特效 SDK 、音频特效 SDK 和 AR SDK ,每个SDK里面都配有预训练好的深度学习模型,使开发者可以快速构建或增强其实时应用程序。

Vid2Vid Cameo 是基于 NVIDIA Maxine SDK 专为视频会议打造的深度学习模型之一。它使用生成式对抗网络(Generative Adversarial Networks,GAN),在一个人的真实照片或卡通头像上合成动态的3D说话视频。

二、仅需一张照片合成逼真的3D人脸说话视频

NVIDIA Vid2Vid Cameo只需两个元素:一张参考照片和一个指导图像应该如何动的视频流。其中,把上传的清晰照片作为源图像,从中获取外貌特征;然后把视频中一帧帧画面作为重构视频的依据,从中提取出面部表情和头部姿势等信息。通过这些信息,模型可以将参会者的面部动作映射到静止的照片上,进而合成视频会议上的逼真人脸说话视频。

同时,该模型基于NVIDIA DGX系统开发,并使用包含18万个高质量人脸说话视频的数据集进行训练。这让该网络学会了识别20个人脸关键点,而这些关键点可以在没有人工标注的情况下用来模拟面部运动,借此修正使用者在会议中低头、看两旁,而未专注于镜头方向的情况,让使用者在会议中看起来更有参与感。

在 NVIDIA Vid2Vid Cameo 提供的交互式体验Demo中,可以在Pitch俯仰角(向下/向上)、Yaw偏航角(左/右)、Roll翻滚角(顺时针/逆时针)三个方向上任意旋转,每个方向上最多旋转30度。甚至眼球也可以上下左右的旋转,每个方向上最多旋转20度。

现在点击【https://www.nvidia.cn/research/ai-demos/?ncid=pa-so-wech-929496-vt16#cid=_pa-so-wech_zh-cn】试用NVIDIA Vid2Vid Cameo交互式Demo。

此外,NVIDIA Vid2Vid Cameo还可利用 AI 从专业摄像头或智能手机拍摄的标准 2D 视频中捕捉面部动作和表情,协助动画师、照片编辑师和游戏开发者轻松制作脸部动画。

三、视频会议的网络带宽成本最高可降低90%

NVIDIA Vid2Vid Cameo能够辨识脸部的20个关键点,而这些关键点可以针对包括眼睛、嘴巴和鼻子在内的位置进行编码。接着模型会从通话者的参考图片中撷取这些关键点,并将这些关键点可以提前发送给其他的视频会议参与者。

如此一来,视频会议平台只需发送参会者脸部关键点的移动情况数据,而不用在每一个与会者之间发送庞大的直播视频流。而对接收者来说,GAN 模型在接收端使用这些信息合成一个模仿参考图片外观的视频内容。

由于关键点的分布十分稀疏,比全像素图像的数据量小得多,因此发送的数据要少得多。而Vid2Vid Cameo通过来回压缩及发送头部位置和关键点,而不是完整的视频流,可以让视频会议的网络带宽成本最高可降低90%,从而提供更流畅的用户体验。同时,该模型可以进行调整,传输不同数量的关键点,以实现在不影响视觉质量的条件下,适应不同的带宽环境。

四、视频会议和直播软件开发团队的新Pick

作为 NVIDIA 研究团队的重要成果之一, Vid2Vid Cameo 将网络瓶颈问题转化为计算任务,从而借助本地或云端资源更轻松地解决此类问题。Vid2Vid Cameo 也可用于直播软件,制作表演者说话、唱歌或移动头部的视频片段。此外,它还可减少了对高网络带宽的依赖,这不仅为提供商削减了成本,也为最终用户提供了更流畅的视频会议体验,成为视频会议和直播开发团队解决因网络所造成画面卡顿及模糊问题的新选择。

Vid2Vid Cameo 很快将在NVIDIA Video Codec SDK中作为AI Face Codec推出。SDK 支持免费下载,还可与 NVIDIA Jarvis 平台搭配用于对话式 AI 应用,包括转录和翻译;也可与3D 人体姿态估计工具协作,像Notch 和 Pixotope 等公司,创作者们使用 NVIDIA Vid2Vid Cameo 和 3D 人体姿态估计工具,将自己的动作传输到虚拟角色,从而快速制作数字角色上的特定动作。

之后,我们还将陆续介绍 NVIDIA 研究团队推出的计算机视觉、深度学习模型以及有意思的交互式Demo,如NVIDIA GauGAN360,可将粗略的草图变成可用于3D场景的360度环境。

体验更多人工智能和深度学习互动Demo,点击【https://www.nvidia.cn/research/ai-demos/?ncid=pa-so-wech-929496-vt16#cid=_pa-so-wech_zh-cn】立即体验“NVIDIA AI 互动 Demo”。

本文来自网络,不代表趣头条立场,转载请注明出处:https://www.ngnnn.com/article/4_138543.html
上一篇RTX 40马上发布!黄仁勋:RTX 30全力清库存
下一篇1080P卧室私人影院!当贝NEW D3X开箱图赏

为您推荐

盖茨盛赞ChatGPT:人工智能历史意义不亚于“PC或互联网诞生”

盖茨盛赞ChatGPT:人工智能历史意义不亚于“PC或互联网诞生”

腾讯科技讯 2月3日消息,微软联合创始人比尔·盖茨表示,像ChatGPT这样的AI聊天机器人将变得与个人电脑或互联网同样重要。盖茨今日接受采访时表示:“AI将成为2023年最热门的话题。这是不可避免的。”他随后补充道:“ChatGPT将变得与个人电脑、互联网同样重要。”盖茨在20世纪80年代帮助开创了个人电脑时代。在微软和苹果等
英伟达:采用 RTX 技术的游戏和应用超 280 款

英伟达:采用 RTX 技术的游戏和应用超 280 款

IT之家 8 月 26 日消息,英伟达最新数据显示,二季度新增 30 款 RTX ON 游戏和应用,包括《瘟疫传说:安魂曲》、《鬼玩人:游戏版》以及《F1 22》,采用 RTX 技术的游戏和应用超过 280 款。英伟达表示,GeForce RTX 和 NVIDIA Studio 笔记本电脑的数量增加到创纪录的 180 多款,包括推出配备 GeForce RTX 3080 Ti 的笔记本
专访墨奇科技CEO邰骋:人工智能需要新的AI数据基础设施

专访墨奇科技CEO邰骋:人工智能需要新的AI数据基础设施

“人工智能要发展到下一代,必然需要基础理论和基础设施的革新,特别是需要新的 AI 数据基础设施。”9月2日,新京报贝壳财经记者获悉,在近日举办的HICOOL2022全球创业者峰会上,AI(人工智能)基础技术和平台墨奇科技的项目团队获得“HICOOL 2022 全球创业大赛一等奖”。墨奇科技联合创始人、CEO 邰骋接受了新京报贝壳财
人工智能大会将举办智慧体育高峰论坛,发布AI+体育蓝皮书

人工智能大会将举办智慧体育高峰论坛,发布AI+体育蓝皮书

2022年世界人工智能大会智慧体育高峰论坛将于9月2日开幕。  主办方供图AI+体育,将成为世界人工智能大会的全新命题和新亮点。2022年世界人工智能大会智慧体育高峰论坛将于9月2日开幕。论坛上将发布由上海人工智能研究院牵头,联合上海交通大学、上海体育学院、首都体育学院、同济大学等单位编制的国内首本《“AI+体育”蓝
大脑还有多少秘密?世界人工智能大会首开脑机接口主题论坛

大脑还有多少秘密?世界人工智能大会首开脑机接口主题论坛

在2022世界人工智能大会上,天桥脑科学研究院(简称TCCI)转化中心联合中国科学院上海微系统与信息技术研究所、脑虎科技、中国神经科学学会、上海市神经科学学会共同举办“脑·机智能融合-让大脑连接未来”论坛,这也是脑机接口首次以主题论坛的形式登陆世界人工智能大会。英国皇家工程院院士、上海交大医疗机器人研究院院
我国人工智能学科主要奠基人涂序彦逝世,享年 88 岁

我国人工智能学科主要奠基人涂序彦逝世,享年 88 岁

IT之家 3 月 28 日消息,据北京科技大学消息,我国人工智能领域著名科学家、人工智能学科的主要奠基人、中国人工智能学会的主要创始人之一、第二和第三届中国人工智能学会理事长、北京科技大学计算机与通信工程学院教授涂序彦先生,因病医治无效,于 2023 年 1 月 1 日 0 时 10 分在北京逝世,享年 88 岁。IT之家附讣告原文
梁建章:人工智能如何影响经济和各行各业

梁建章:人工智能如何影响经济和各行各业

近日人工智能再次成为了热门话题。很多人好奇的是,人工智能未来到底会如何影响经济、人口和创新?今天,我跟大家分享个人的一些看法——谈谈人工智能对于经济以及各行各业的影响。自从深度神经网络出现以来,人工智能的发展速度超乎想象。ChatGPT的出现是个奇迹,超出了几乎所有计算机科学家的预料。一个简单的神经网络模
AI炒股新纪元?头部量化私募幻方宣布全力探索人工智能应用

AI炒股新纪元?头部量化私募幻方宣布全力探索人工智能应用

头部量化私募幻方宣布成立新的独立的研究组织,探索AGI(即通用人工智能,Artificial General Intelligence)的本质。4月14日,幻方发布公告显示,幻方将集中资源和力量,全力投身到服务于全人类共同利益的人工智能之中,成立新的独立的研究组织,探索AGI的本质,“我们将充分而持续地投入,不做中庸的事,用最长期的眼光去
挑战英伟达?微软拟推AI芯片雅典娜:训练大语言模型,成本省三分之一

挑战英伟达?微软拟推AI芯片雅典娜:训练大语言模型,成本省三分之一

为突围芯片短缺困境,微软拟推出自研人工智能芯片。当地时间4月18日,据美国科技媒体The Information报道,微软(Microsoft)准备推出人工智能芯片,为负责理解和生成类人语言的大型语言模型(LLM)提供动力。两位直接了解相关项目的人士透露,微软自2019年开始开发内部代号为“雅典娜”(Athena)的芯片。据悉,微软已向一
卷完模型卷芯片!为提升效率,微软准备推出专属人工智能芯片

卷完模型卷芯片!为提升效率,微软准备推出专属人工智能芯片

在早期成功押注ChatGPT的研发公司OpenAI之后,市场发现,微软在其武器库中还拥有另一个秘密武器:自研人工智能芯片,这一芯片将为生成式AI背后的大型语言模型提供强大动力。4月18日周二,据媒体援引两位知情人士的话说,微软早在2019年就开始开发内部代号为Athena的AI芯片。其中一位知情人士称,一些微软和OpenAI的员工已经
英伟达芯片一周涨了7万元!GPT带动涨价潮,主力芯片缺口达30万

英伟达芯片一周涨了7万元!GPT带动涨价潮,主力芯片缺口达30万

本文来源:时代财经  作者:谢斯临    图片来源:Pixabay ChatGPT爆火带动AI芯片需求飙升。截至上周五,英伟达最新发布的旗舰AI芯片H100在ebay上的售价超过4万美元一枚。相比此前零售商3.6万美元的报价,已提价明显。这一价格仍在持续上涨。4月19日,时代财经搜索eBay时发现,目前共有5家店铺挂牌销售H100芯片,售价普遍达
真正的应用级量子人工智能距离我们还有多远?

真正的应用级量子人工智能距离我们还有多远?

·“量子科技是强国竞争的战略制高点,但不能一哄而上,低水平重复内卷,或片面追求发论文、抢专利,各自为战,闭门造车,而缺少真正的技术投入和系统配合。”·“当下量子系统的规模非常重要,而这很大程度上取决于芯片。”当前,发展量子计算和人工智能已成为世界各国的重要战略,两者交汇而生的量子人工智能更是发展迅速
《刺客信条:起源》出现画面错误,英伟达和育碧互相甩锅

《刺客信条:起源》出现画面错误,英伟达和育碧互相甩锅

IT之家 9 月 13 日消息,育碧《刺客信条:起源》似乎遇到了一些画面问题,在部分英伟达硬件的设备上会有纹理闪烁、伪影等情况。此外,该问题似乎是由英伟达 WHQL 驱动 465.89 引起的,影响 RTX 显卡用户。然而,英伟达表示这个锅要育碧来背,而育碧反向指责英伟达没有做好适配。育碧在 Steam 社区论坛上首先做出了回应,主
英伟达正在“垄断”AI产业,国内厂商准备好了吗?

英伟达正在“垄断”AI产业,国内厂商准备好了吗?

“为了计算和人类的未来,我捐出世界上第一台 DGX-1 。 ”2016 年 8 月,英伟达创始人黄仁勋,带着一台装载了 8 块 P100 芯片的超级计算机 DGX-1 ,来到了 OpenAI 的办公大楼。在现场人员到齐后,老黄拿出记号笔,在 DGX-1 的机箱上写下这句话。与其一同前往的还有特斯拉和 OpenAI 的创始人,埃隆马斯克。这次 OpenAI 之行
返回顶部