手机上用AI实时、流畅解码视频:高通研发出首个神经视频解码器( 三 )


第三步 , 优化后模型的权重和激活量化至8比特 , 然后通过量化感知训练来恢复速率失真带来的损失 。 这里用到了高通创新中心开源的AI模型效率工具包(AIModelEfficiencyToolkit,AIMET) , 该工具于2020年5月推出并开源 , 是一个支持神经网络模型训练的高级量化和压缩技术的库 。
通过这三个步骤 , 高通AI研究院构建了一个具有高效解码性能的8比特模型(8-bitmodel) 。
AI解码的效果
在Demo设置中 , 高通AI研究院选取了分辨率为1280×704(接近720pHD)的视频 , 通过离线运行解码器网络和熵解码生成压缩的比特流 。 接着 , 压缩的比特流通过骁龙888移动设备(商用智能手机)上运行的并行熵解码和解码器网络来处理 , 其中并行熵解码在CPU上运行 , 解码器网络在第六代高通AI引擎进行加速 。
手机上用AI实时、流畅解码视频:高通研发出首个神经视频解码器
文章图片
最终 , 高通AI研究院得到了一个神经解码算法 , 在1280×704分辨率的视频中实现了每秒30帧以上的解码速度 。 如下为商用智能手机上神经视频解码的动态演示 , 右上角为视频解码速度(Speed)和同一视频帧内的迭代次数(Loop) , 右边为运行时平均比特率(BitRate)和视频每帧图像中每单位像素的平均码流(BitsperPixelperFrame,BPF) 。
在Demo演示中 , 视频和解码参数被设置为高质量 , 并选取了一系列具有挑战性和精细纹理的自然场景 。 在实现30帧以上解码速度的同时 , 丰富的视觉结构和纹理都借助神经解码网络准确地保留了下来 , 实现了非常好的场景重现 。 比特率符合全帧内(all-intra)配置和选取的质量 , 表明这一神经视频解码器能够支持高质量视频流所需的数据吞吐量 。
手机上用AI实时、流畅解码视频:高通研发出首个神经视频解码器
文章图片
由于基于AI的编解码器可以生成比特流中没有的视觉细节 , 因此与传统编解码器相比 , 相同或更高质量视频的比特率应该会低一些 。 这也意味着视频编解码器将变成软硬件结合驱动的 , 任何新的编解码器都可以由SoC中的CPU和内置AI加速器处理 , 只要它们足够强大 。
目前 , 这一神经视频解码器只支持帧内解码 , 这意味着每帧视频都是独立解码 , 不需要像其他视频编解码器那样考虑帧之间的微小变化 。 据悉 , 高通还将继续致力于研究移动设备上实时运行的帧间视频解码 。
就此项研究的意义而言 , 虽然在骁龙888SoC上实现30fps+高清视频实时解码依然有提升的空间 , 但手机端侧AI算力和影像能力的释放 , 能够为手机用户带来更丰富的视频应用以及更清晰流畅的观看体验 。 比如近期最新发布的骁龙888Plus移动平台 , 虽然仅仅是在骁龙888基础上做出了部分升级 , 但其AI算力已经达到了惊人的32TOPS , 进一步大幅度升级;再加上高通接下来的持续深入研究 , 可以预见的是 , AI的高清视频实时解码能力将很快进一步提升 。
除了手机平台之外 , 高通也已将AI处理视频的各项能力引入了PC、XR和汽车等其他应用平台 。 比如全球首款5G扩展现实平台骁龙XR2的AI性能相较初代XR提升了11倍 , 大幅提升了视频处理能力;PC端的第二代骁龙8cx5G计算平台中 , AI能力加持的SpectraISP支持了4KHDR品质的视频拍摄和背景虚化;第4代骁龙汽车数字座驾平台 , 增强了图形图像、计算机视觉和AI等功能 , 可以为驾乘者提供更智能和舒适的视频服务等体验 。
因此 , 从更大的视角来看 , 利用AI算力进行视频处理代表了未来的一个发展方向 , 也势必会赋能更多应用场景 。
参考链接:
https://segmentfault.com/a/1190000038930366