
在全球数字化浪潮的持续推动下,视频流媒体流量已经呈现出指数级的爆发增长。据相关行业报告以及机构的预测,到了2050年左右,视频数据将占据8成左右的全球互联网总流量。在超高清显示设备普及、高帧率游戏、虚拟与VR/AR的沉浸式应用,以及低延迟实时通信等高规格应用场景的驱动下,现有的视频编码标准正面临着前所未有的带宽与存储压力。为了应对这一严峻的底层基础设施挑战,开放媒体联盟(AOMedia)在成功推出上一代免版税视频编码标准AV1之后,正式启动了下一代视频编码标准AOMedia Video 2 (AV2) 的研发工作。自2015年AOMedia联盟成立以来,其成员涵盖了谷歌、Netflix、亚马逊、苹果等全球领先的科技与流媒体巨头。2018年发布的AV1标准,相较于其前身VP9,在同等主观质量下实现了约30%的码率节省,并已在现今的网络平台与智能设备中得到广泛部署。AV2的研发始于2020年,其核心目标是在AV1的基础上,再次实现约30%的码率降低,同时严格控制编码与解码的计算复杂度,以确保软件和硬件部署的实际可行性。下面将以十个核心技术问题的形式,全面且深入地剖析AV2标准的标准化进程、压缩性能基准、底层预测与变换量化算法创新、人工智能技术的融合,以及其面临的软硬件解码生态与复杂的专利版税挑战。
下一代开放式视频编码技术AV2正式登场
早在今年年初,AV2的底层核心编码工具已基本定型。AOMedia官方已于2026年1月5日公开发布了《AV2比特流与解码处理规范》的第13版(v13.0)候选发布草案,以及对应的参考软件AVM (AOMedia Video Model) 的研究分支标签。尽管由于对高级语法(High-Level Syntax, HLS)和解码器模型的反复打磨,标准的最终发布时间相比最初预期的2025年底有所推迟,但根据AOMedia的最新动态,AV2标准已于2026年5月28日正式定稿发布。

《AV2比特流与解码处理规范》的第13版(v13.0)候选发布草案

AV2标准已于2026年5月28日正式定稿发布
目前AV2商业化进程的倒计时已经启动。根据一份行业技术评估报告,AOMedia联盟内部的意向调查显示,有高达53%的成员计划在标准正式发布后的12个月内采用AV2,而88%的成员预计在两年内将其纳入产品的实施计划中。这表明,由硅谷流媒体巨头主导的生态系统,已经为AV2的商业化落地做好了初步准备。

AV2的压缩效率究竟比AV1强多少?
在保证客观测试严谨性的通用测试条件下,AV2展现出了符合预期的压缩高性能。根据官方参考软件(AVM)的测试数据,在画质相同的情况下,AV2相比AV1基线能实现约30%或更高的带宽节省。具体而言,在最能代表日常流媒体视频点播的随机访问(Random Access, RA)配置下(即支持双向时域预测及帧重排),AV2在PSNR-YUV客观指标上节省了约28%的码率,而在高度契合人类视觉感知模型(HVS)的VMAF指标上,码率节省高达33%。在更为严苛、且贴近真实CDN内容分发场景的自适应流媒体(Adaptive Streaming, AS)配置测试中,AV2通过凸包曲线插值计算,依然实现了31.34%的PSNR-YUV码率节省和35.77%的VMAF码率节省。

针对特定类型的高要求视频,AV2的性能增益更为显著。对于BT.2100色域及PQ传递函数的高动态范围(HDR)视频(Class G),AV2在随机访问模式下的VMAF码率节省达到了37.08%至39.18%。而对于包含大量文本、UI元素和锐利边缘的屏幕生成内容,由于AV2引入了专用的屏幕内容编码工具(如前向跳过编码),其在RA模式下的VMAF码率降低幅度突破了43.04%,在低延迟配置下更是达到了44.97%。
这意味着,一旦AV2投入实际部署,流媒体平台未来只需消耗原本用于传输1080p视频的带宽,便能够为终端用户提供极高规格、流畅的4K HDR画质体验,这对于降低CDN传输成本和提升用户体验质量(QoE)具有决定性的经济价值。
AV2在处理动态视频帧时,
底层预测算法究竟有哪些不同?
视频压缩的核心本质是预测,即利用已有的像素信息去“猜测”未知区域,从而消除时域和空域的冗余数据。AV2并未脱离过去数十年的混合块状编码(Hybrid Block-based Coding)框架,但在帧间预测(Inter Prediction)环节引入了极具数学精密度的算法创新:首先是时域插值预测(TIP, Temporal Interpolated Prediction)。这项技术让编码器重用现有的时域运动向量(TMVP),在两个真实的参考帧之间通过数学插值,直接“无中生有”地生成一个虚拟的参考帧。在帧级别应用时,编码器甚至可以直接输出这个虚拟图像而无需传输任何额外的运动向量信令开销,这在极低码率配置下能够带来巨大的压缩收益。

其次是光流运动向量微调(OPFL, Optical Flow MV Refinement)技术。传统的双向预测完全依赖于编码端传递的运动向量,而AV2的OPFL允许解码端进行自主的运动推导。它将预测块进一步切分为极微小的8x8或4x4像素子块,并基于光流方程,利用前后参考块的时间距离独立推导和微调子块的运动向量。这意味着无需增加额外的信令开销,即可对水波纹、烟雾扩散等复杂的非线性运动进行极高精度的像素级预测。

在仿射变换预测方面,上一代AV1仅能处理轻微的形变剪切,而AV2支持包含最多6个参数的复杂仿射运动模型。AV2的Warp滤波器会将宏块分割为4x4的微小单元,并对每个单元进行独立的平移计算。这种技术使得遇到复杂的镜头剧烈抖动、物体三维旋转以及爆炸扩散等强形变场景时,AV2也能通过精密的数学模型进行精准匹配。最后,AV2重构了参考帧的信令传递,引入了排序参考机制。该机制综合考虑时间距离、量化层级、分辨率和层级ID等维度,对所有7个候选参考帧进行重要性排序,并进行隐式信令传输,彻底消除了显式参考帧映射的信令成本。

影音发烧友最关心的静态画质、色彩和电影质感,
AV2有什么技术优势?
在静态画质与色彩保真度方面,AV2从底层架构上确立了极高的基准,为专业后期制作和影音发烧友给出了充足的诚意。首先,在处理精度上,AV2虽然向后兼容8bit视频输入,但其在内部处理管线和量化架构上,强制将10bit高色深编码作为基础处理路径。通过扩展的9bit量化索引语法,AV2支持10bit和12bit的无缝映射,从而能够更好地覆盖高动态范围(HDR)所需的广阔亮度与色彩空间,避免色彩断层。

其次,AV2对扩展颜色格式(ECF, Extended Color Format)提供了完善的支持。在专业的广电传输和后期制作中,通常需要比传统4:2:0保留更多色度信息的4:2:2和4:4:4色度采样格式。在AOM官方针对这些无损或极高保真度格式的CTC测试中,AV2同样表现优异,实现了约24%到34%的码率节省,证明其不仅仅是一个为网络低端视频设计的有损编解码器,同样能够胜任广播级的工作流。

最让电影爱好者振奋的是,AV2强制保留并深度优化了胶片颗粒合成(FGS, Film Grain Synthesis)技术。高分辨率(如4K/8K)下的随机胶片噪点极其消耗编码码率,FGS让编码器在前端利用降噪器滤除真实噪点,提取其结构与强度特征并作为参数随比特流传输。在解码端,AV2利用自回归噪声合成模型,重新生成极度逼真的数字噪点和胶片质感。AV2在AV1支持32x32模板的基础上,新增了更细粒度的16x16像素块级别的颗粒合成支持,使得老电影或数字摄影机产生的噪点得以实现近乎无损的视觉还原,而无需占用真实的海量带宽。



针对色彩通道之间的冗余,AV2还引入了跨色度分量变换(CCTX, Cross-Chroma Component Transforms)。在变换域,针对Cb和Cr两个色度通道的系数,AV2支持直接应用2D几何旋转(如30度、45度、60度等7种预设角度)。这一极其巧妙的数学操作能够彻底剥离色度平面之间的相关性,在保留色彩细节的同时进一步压缩了冗余数据。
除了刚才提到的预测技术,
AV2还有哪些复杂的数学底层技术?
AV2依然是基于传统的混合块状编码模型,但它对变换、量化和熵编码管线进行了堪称极限压榨的数学重构。
半解耦划分:AV2废弃了AV1中繁冗的递归四叉树,引入了半解耦划分。它最高支持高达256x256的超级块,并新增了多种非对称划分模式(如HORZ4、VERT5)。SDP允许在大尺寸块下共享亮度和色度的划分策略,但在64x64及以下的微小尺寸下,亮度和色度块可以完全独立划分。这大幅降低了冗余的解码算力并优化了内存带宽。

主变换的精简与重构: AV2重新设计了离散余弦变换(DCT-2)和离散正弦变换(DST-4、DST-7),取消了原生的64点大尺寸主变换,改用32点逆变换结合空间残差上采样(Residual Upsampling)来处理64xN或Nx64尺寸的模块,这用极小的编码损失换取了巨大的硬件复杂性降低。同时,引入了帧内/帧间二次变换(IST),在主变换后对低频系数进行二次降维线性变换(如将48个输入系数降维至32个),隐式剔除高频无效信息,进一步聚集能量。
网格编码量化:这是AV2在量化领域的重大突破。AV2弃用了AV1中复杂的多张量化查找表,改用统一的指数数学公式进行步长映射。在此基础上引入的TCQ定义了两个子量化器(Q0和Q1),其非零重建电平错开半个步长。编码器利用Viterbi动态规划算法在包含8个编码状态的网格(Trellis)中寻找率失真代价(RD Cost)最低的路径,实现了在系数级的联合全局优化。

概率自适应率调整:AV2沿用了多符号算术编码器(MS-AC),但引入了PARA技术。该技术通过一个偏移参数,利用右移位运算,动态调整累积分布函数(CDF)的概率收敛和更新速度,使其能够更敏锐、快速地捕捉局部统计特性的变化,从而提升熵编码的压缩率。
前向跳过编码:针对包含大量UI文字和锐利硬边缘的屏幕内容,由于其在频域的能量分散,传统变换往往会适得其反。AV2通过配合恒等变换(IDTX)启用FSC,直接跳过复杂的频域变换,按照正向扫描顺序(Forward Scan Order)并使用简化的熵上下文对空间残差进行自适应旁路编码。这是AV2能在屏幕生成内容上节省超40%码率的核心技术。
奇偶校验隐藏:这项技术堪称“像素级魔术”。当一个变换块内包含至少4个非零的交流(AC)系数时,编码器通过微调这些AC系数的奇偶性,使其总和的奇偶状态与直流(DC)系数的符号位或奇偶性严格保持一致。在解码端,解码器通过计算AC系数即可隐式推导出DC系数的属性,直接省去了该比特数据的显式信令传输,在海量数据中实现了对每一个比特的极致压榨。

现在动不动就提AI,
AV2是纯粹的“端到端AI编码器”吗?

客观且严谨地说,AV2依然是基于传统架构的混合视频编码器,而不是完全的端到端AI神经网络编码器。最新的低延迟基准测试相关研究指出,虽然神经视频编码模型(如DCVC-FM)在特定条件下展现出了潜力,但当它们面临包含大幅度背景运动或复杂运镜的测试序列(如AOM CTC中的Skater227等)时,其泛化能力和编码性能表现出了明显的不一致性和劣化。此外,由于高度依赖GPU计算,纯神经网络编码器在当前消费级设备上的解码复杂度依然过高 。然而,AV2的架构极其深入地融合了“数据驱动”的机器学习思想。例如,数据驱动帧内预测(DIP, Data-Driven Intra Prediction), 使用离线机器学习训练出的投影矩阵集,取代了纯粹的几何角度插值。数据驱动变换(DDT, Data-Driven Transforms), 对于帧间块,AV2不再单纯依赖三角函数,而是引入了通过海量真实视频残差数据,利用Karhunen-Loève变换(KLT)预先训练并固化在标准中的DDT变换核。这些核能够更精准地契合真实世界残差信号的能量分布。

此外,AV2非常适合与外部的AI视频预处理引擎协同工作。以Sima Labs开发的SimaBit AI预处理技术为例,该引擎作为一个独立的AI滤波层,部署在编码器之前。SimaBit通过自适应降噪(去除传感器噪点)、色彩条带抑制(Banding Mitigation)和显著性映射(Saliency Mapping,识别并保留人眼敏感的锐利边缘,简化背景纹理)为AV2提供高度净化的输入源 。在Netflix开源的4K片源测试中,AI预处理与AV2的结合产生了乘数效应:在AV2原生18%到25%的压缩优势基础上,SimaBit额外挤出了约22%的码率,使得整体相比AV1基线的带宽节省最高达到了惊人的43% 。这表明,传统架构与AI预处理的“强强联手”,是目前最务实且高效的产业路径。

AV2的编码复杂度可能有数倍增加,但AOM联盟严格限制了它的解码复杂度(目标是不超过AV1的两倍)。好消息是,著名的VLC播放器开发团队VideoLAN已经开源了名为 dav2d 的AV2软件解码器预览版。在CES2026展会上,他们已经演示了在苹果笔记本上流畅软解1080p/24帧的AV2视频。后续还会通过大量底层的汇编级代码优化,让老旧设备也能流畅播放。硬件方面,国际知名IP供应商Chips&Media已经宣布完成了下一代AV2硬件解码器(WAVE系列)的IP研发,甚至计划在今年5月提供硬件RTL交付。因此,硬件支持已经在路上了。

AV2还能继续保持“完全免费”吗?
虽然AOM联盟的初衷是开发免版税的编码器,但在如今复杂的专利环境下,AV2的底层依然基于发展了30多年的混合块状架构,很难完全规避非联盟成员的底层专利。未来能否做到对终端用户和小型开发者“完全免费”,还需要等待其规模化落地后,看各方专利池与科技巨头之间的博弈结果。

作为普通用户和内容创作者,
我们究竟什么时候才能真正用上AV2?
技术的底层更迭与消费级终端的普及需要遵循半导体行业的漫长周期。如前文所述,2026年5月底,业界见证AV2标准的最终定稿。在随后的2026年至2027年间,我们首先会看到AV2在软件生态中的渗透。YouTube和Meta等平台往往充当技术先锋,它们会最先在网页端、自家的App中,针对短视频或用户生成内容(UGC)进行小规模的AV2视频流推送,并利用 dav2d 这样的软件解码器在终端设备上进行渲染播放测试。然而,对于受DRM严格数字版权保护的高规格院线长视频,比如Netflix上的4K/8K内容,必须依赖硬件解码器的物理支持。业界普遍预计,搭载AV2硬件解码器的移动端SoC(如高通骁龙、联发科天玑系列)以及电脑端CPU/GPU,包括Intel、AMD、Nvidia的下一代产品,至少要等到2028年甚至2029年之后才会开始大规模推向消费市场。
对于视频平台而言,“分层多编码架构”将是未来十年的常态:向拥有硬解能力的高端新设备推送极致的AV2视频流,同时向中低端设备或老旧设备回退推送AV1、HEVC甚至H.264视频流,以平衡画质带宽与设备的电量功耗。因此,对于普通玩家而言,大家手中现有的支持AV1和HEVC硬件解码的手机和显卡,在未来的三到五年内依然具有极强的生命力并能流畅服役。

总结
AOMedia AV2视频编码标准的问世,并非一次颠覆现有物理常识的空中楼阁,而是一次脚踏实地、极具诚意的底层技术重构。通过引入光流运动微调(OPFL)、网格编码量化(TCQ)、跨色度分量变换(CCTX)以及奇偶校验隐藏(PH)等一系列极致精妙的数学模型与数据驱动算法,AV2已经成为了新一代视频编码技术的主流方向。测试数据清晰地表明,这些在变换域与熵编码阶段的创新,贡献了AV2整体高达30%以上压缩收益中的绝大部分,尤其是在超高清与屏幕生成内容领域展现了统治级的优势。尽管它目前不可避免地面临着编码算力开销激增、高级语法定义尚需完善以及外部愈发严峻的专利池版税挑战,但其结合AI预处理最高可达43%的带宽节省,使其注定将成为支撑未来十年互联网超清点播、云游戏与空间计算等海量视频分发的核心基石。