虚拟人是用什么技术实现的(虚拟人应用技术及分类)
概述:虚拟数字人作为新一代人机交互平台,其发展与制作技术息息相关,通过计算机图形学、图形渲染、动作捕捉、深度学习、语音合成等技术打造而成,而虚拟人又通过人物形象、语音生成、动画生成、音视频显示、交互五个模块构成,大概可以分为两大类:2D虚拟人和3D虚拟人。
2D虚拟人:2D虚拟人是根据真人形象塑造的,与真人十分相似。主要应用于传统房地产企业的金融、医疗、保险、客服等。它可以进行多轮对话和互动,但不能旋转。虚拟人的姿态是有限的,服装的外观,发型等。不能自由修改,所以形象相对固定。虚拟人不能用于3D场景,3D演示,VR,AR,游戏。
3D虚拟人:3D虚拟人风格多样,可以自由打造风格化的外观,应用场景广泛。主要应用场景包括内容创作、IP创作、创意内容创作。它具有多交互、多形式、自由修改的特点,并能与真实场景相匹配,进一步增强逼真效果。
制作模型
2D虚拟人:的2D虚拟人一般采用静态扫描技术制作,即40-60个摄像头全方位拍摄真人,根据画面的光线和角度进行矩阵扫描,从而在软件中呈现一个2D立体图像。静态扫描技术只需拍摄少量所需数据,就能以较低的成本生成2D虚拟人图像。

2D虚拟主播
3D虚拟人:的三维虚拟人建模对软件和技术有很高的要求。采用动态扫描技术,通过人脸特征识别、空间变换组件、模型重建组件、骨骼变形组件、纹理融合组件等,将采集到的光影效果或照片数据组合成多模态3D模型。除了真人形象,还包括卡通、二次元等类型。

三维虚拟人
驱动器
1.面部表情
2D和3D虚拟数字人嘴部动作智能合成的底层逻辑是相似的,都是基于输入文本、输出音频和输出视觉信息之间的相关性映射。
2D虚拟人:主要通过视频算法呈现。从文本到语音和嘴部视频收集的数据经过训练,得到一个可以通过输入任何文本来驱动嘴部形状的模型。然后通过自动语音识别,对语音进行标记,数据和动作进行绑定,从而形成一个虚拟人,可以对特定的单词或特定的语境做出相应的动作,但动作是有限的、重复的,一般只能呈现正面的形象。
3D虚拟人:以各种方式驱动,包括视频算法训练、自动语音识别和移动捕捉设备的获取。通过三维模型及其对应的BlendShape向量,可以呈现出一个具有三维图像、运动灵活、可随意驱动的三维虚拟人形象。
象。

嘴型动作合成逻辑
2.全身动作
目前动作捕捉技术是最成熟且呈现效果最好的动作生产方式,可分为光学式、惯性式、电磁式及基于计算机视觉的动作捕捉。其中光学捕捉精度最高、对环境要求最高且硬件成本最高,惯性捕捉抗遮挡能力最强,视觉捕捉算法开发难度最大。
动捕服:需要真人穿戴一整套动捕设备,动捕设备与真人肢体动作相绑定,可实时传递到虚拟人身上。
光学动作捕捉:通过对目标上特定光点的监视和跟踪来完成运动捕捉的任务,即在真人身上粘贴能够反射红外光的马克点,通过摄像头对反光马克点的追踪,从而对真人动作进行捕捉。
惯性动作捕捉:基于惯性测量单元IMU来完成对人体动作的捕捉,即把集成了加速度计、陀螺仪、磁力计的IMU绑定在人体特定骨骼节点上,通过算法对测量数据进行计算,从而完成动作捕捉

光学捕捉、惯性捕捉、视觉捕捉对比图
▷ 渲染
渲染技术分为实时渲染技术和离线渲染技术,随着硬件能力提升和算法突破,虚拟数字人的真实性和实时性将大幅提升。二者在渲染时长、计算资源、计算量等方面存在差异,所对应应用场景亦有所不同。
实时渲染:将图形数据实时计算输出,每一帧都是针对当时实际的环境光源、相机位置和材质参数计算出来的图像。渲染花费时间较短,但受限于时限要求计算资源一般不能及时调整。实时渲染多用于3D虚拟人。
离线渲染:图像数据并非实时计算与输出。渲染时间相对较长,计算资源丰富,受时限限制有限,可临时调整更多计算资源。离线渲染多用于2D虚拟人。
▷ 虚拟数字人发展趋势
虚拟数字人产业生产及运营成本高,优劣差异化显著,受众群体不断拓展,因而虚拟数字人价值凸显,应用领域不断拓展,未来有望加速商业化进程。
标签:虚拟数字人、建模、驱动、渲染
