“在AI时代,不光多了很多给人看的视频,比如AI短剧,还多了很多给机器看的视频。如何让这些硅基生命更好地理解人类社会?”对于这一问题,安谋科技VPU研发总监黄鑫博士在WAIC 2026安谋科技展台以《AI VPU:开启视频压缩新篇章》为题,试图从“面向机器的视频压缩”这一维度给出安谋科技的答案。
视频角色的嬗变:从为人眼服务,到为AI服务
黄鑫首先厘清了一个产业背景的根本性转变。传统视频压缩技术,主要解决的是手机存储、朋友圈传输这类问题,衡量的标准是“人眼主观视觉上有没有瑕疵”,一切为人的观看体验服务。但随着AI应用与视频的结合日趋紧密,视频的角色正在发生根本性变化。
一方面,AI成为视频的“生产者和加工者”——AIGC生成视频内容已是常态。另一方面,在更广泛的应用场景中,AI正在变成视频的“消费者”。黄鑫列举了一连串常见的案例:人形机器人、机器狗、自动驾驶以及各类视觉单元的感知模块——这些系统需要用海量视频数据进行推理和训练。视频,由此成为连接物理世界与虚拟世界的核心桥梁。
这一角色转变带来了一项硬约束:视频质量对AI推理和训练精度的影响是决定性的。“如果视频本身有损,对整个AI推理精度、训练精度会产生非常大的影响。”黄鑫强调,数据本身的受损,将波及整个产业布局和降本增效的进程。因此,VPU的设计理念必须随之改变——从为人眼主观视觉服务,转向为机器视觉服务。“AI打开了面向机器的视频压缩新维度。”他总结道。
从“峨眉”到“武当”,嵌入内容感知编码
面对这一产业变局,玲珑VPU的技术演进路线清晰而坚定。黄鑫在回顾了今年初发布的“峨眉”VPU的同时,还首次透露了明年年初即将发布的下一代产品——“武当”VPU。这两款产品最大的共同特点是:集成了轻量化AI算子,具备了“内容感知编码”(Content-Aware Encoding, CAE)能力。
所谓内容感知编码,其核心逻辑是将视频内容解析为两个层次:第一层做浅层的图像纹理处理,第二层做深度的语义解析。这两层信息被同时注入编码器,为编码决策提供智能化的依据。
黄鑫展示的框架显示,CAE模块处于视频编码单元的第一级,在搬运数据的同时完成上述两层处理,再将数据传输给下一级的编码决策模块。在航拍、游戏、监控等不同场景下,该技术均能实现可观的码率节省。
作为“峨眉”之后的又一力作,“武当”在继承智能感知编码技术的基础上,实现了三个维度的显著提升:
PPA层面,“武当”可支持8K 30fps的编码能力,足以满足各类AI应用对性能的需求,同时面积上相较前代有40%的节省。
规格层面,“武当”新增了对YUV 422编码格式的支持,这对专业摄像拍摄场景是一大利好;同时支持Raw Data压缩,可省去轻度转换环节,更好地服务于AI训练流程;此外还支持高达1Gbps的码率,能够满足人形机器人等Physical AI应用场景的大带宽需求。
编码质量层面,全面继承“峨眉”的基础上,“武当”实现了额外提升。黄鑫特别指出,其灵活可配置的特性让用户可选择不同档次,目前版本已可与软件最高档水准持平;而在服务AI应用场景中,面对不规则运动等复杂画面,“武当”还有额外5%到10%的编码质量提升。
下一代愿景:从局部最优走向端到端全局最优
“峨眉”和“武当”是服务当下,但技术演进并未止步。黄鑫透露,团队在研项目中已经开始布局下一代的端到端视频编码技术,总体方向有两条:一是从智能CAE的局部优化拓展到端到端的全局最优;二是从以人眼主观视觉为主的编码优化,拓展到面向不同AI应用的定向优化。
黄鑫展示了正在落地的技术框架。训练阶段,系统引入前置网络,结合虚拟编码器和特定AI应用,通过联合训练实现针对特定任务的最优优化结果。部署阶段,前置网络经优化后与玲珑VPU编码器直接耦合,形成真正意义上“任务感知”的编码器,最终实现压缩效率与任务精度的最佳平衡。
黄鑫展示的对比效果显示,目前该框架在目标追踪和动作识别两项任务上,均已取得10%以上的编码质量提升。传统方法处理后的画面与经过AI VPU算法处理后的画面,在人眼看来或许差异不大,但对机器而言,后者的可辨识度和友好度明显更优——精度提升的同时,码率也得到节省。
安谋科技的VPU团队的野心不止于此。据黄鑫介绍,下一步计划是将AI VPU训练框架进行泛化,引入前置网络和后置网络,通过多模态参数配置,最终实现人眼主观视觉与AI特定任务的双向提升——既让人看得舒服,也让机器看得明白。
“如何让硅基生命拥有和人一样的清晰视野?”回到最初的提问,黄鑫给出了自己的答案:“玲珑VPU作为AI视觉的引擎,可以让人类看清世界,让AI看懂世界。”
编辑:芯智讯-浪客剑