DVD-Quant 论文解读:无需校准数据的视频 DiT 低比特量化
视频扩散 Transformer 从噪声出发,经过多轮去噪生成视频。每一步都需要处理大量空间与时间特征,模型参数和中间激活也需要显存。把数值压缩成低比特格式,有机会减少存储和计算成本,但过于粗糙的近似可能破坏最终画面。
DVD-Quant 将这个问题拆成三部分:用 BGR 改善权重的量化刻度,用 ARQ 根据当前激活调整数值分布,用 δ-GBS 决定哪些去噪步骤使用更高精度。本文沿着图 1 的问题、图 2 的框架、三个模块和实验消融展开。文中的教学算例用于解释机制,实验数字均来自原论文报告,未经独立复现。
论文信息与关键术语
| 项目 | 信息 |
|---|---|
| 题目 | DVD-Quant: Data-free Video Diffusion Transformers Quantization |
| 作者 | Zhiteng Li、Hanxuan Li、Junyi Wu、Kai Liu、Haotong Qin、Linghe Kong、Guihai Chen、Yulun Zhang、Xiaokang Yang |
| 单位 | 上海交通大学、浙江大学、苏黎世联邦理工学院 |
| 本文依据 | arXiv:2505.18663v4,2026 年 3 月 6 日版本,PDF 共 13 页 |
| 论文状态 | 该版本 PDF 标注 Published as a conference paper at ICLR 2026 |
| 主要实验模型 | HunyuanVideo;正文还提到 Wan2.1,详细结果指向补充材料 |
| 原文 | 固定版本 PDF |
| 术语 | 含义 |
|---|---|
| Video DiT | 视频扩散 Transformer,在多个去噪步骤中处理视频特征 |
| PTQ | Post-Training Quantization,训练后量化 |
| W4A4 | 权重与激活均使用 4 bit 量化格式;具体保留精度的算子仍需以实现为准 |
| W4A6 | 本文的混合精度配置:不同步骤使用 A4 或 A8,平均激活位宽约为 6 bit |
| Data-free | 不需要预先准备离线校准数据集;推理时仍使用当前输入和激活统计 |
| BGR | Bounded-init Grid Refinement,边界搜索初始化与量化网格细化 |
| ARQ | Auto-scaling Rotated Quantization,自动缩放的旋转量化 |
| δ-GBS | δ-Guided Bit Switching,根据累计特征变化切换激活位宽 |
1. 目标与动机:低比特为何容易破坏视频
视频生成的成本来自两个因素叠加。首先,视频包含多个帧,空间分辨率与帧数增加会扩大特征序列。其次,扩散生成反复运行模型,即使一次前向只节省部分计算,多个去噪步骤也可能累积成可观收益。
PTQ 可以在已有模型上进行压缩,但既有视频量化方法存在两个问题。离线校准需要先运行样例、收集激活统计,准备成本较高;激活分布又随去噪步骤变化,固定缩放参数不一定适合当前步骤。另一方面,把激活进一步压到 4 bit 后,生成质量可能明显下降。
4 bit 只有 16 种编码。量化要用这些有限的档位近似连续数值,因此数值范围、档位间距、异常大值及时间变化都很重要。

原论文图 1,PDF 第 1 页。上方是 BF16 参考,下方三列分别为 MinMax、ViDiT-Q 和 DVD-Quant。量化结果第一行为 W4A8 对照与 DVD-Quant 的平均 W4A6,第二行统一为 W4A4。
第一行的对照还能保留山体,但纹理有所损失;到了 W4A4,MinMax 出现杂乱色块,ViDiT-Q 也有明显结构扭曲。DVD-Quant 保留了较清楚的山体与纹理。图中的成像质量分数如下:
| 方法 | 较高激活精度配置 | 成像质量 | W4A4 成像质量 |
|---|---|---|---|
| MinMax | W4A8 | 60.62 | 24.78 |
| ViDiT-Q | W4A8 | 59.72 | 40.10 |
| DVD-Quant | 平均 W4A6 | 64.22 | 61.82 |
图 1 展示整体方法的视觉优势,但没有独立分离三个模块的贡献,也没有展示速度。模块作用需要结合后面的消融,效率则看表 5。
2. 图 2:权重、激活和步骤精度分别处理

原论文图 2,PDF 第 3 页。左栏处理权重分布,中栏处理随时间变化的激活,右栏分配各去噪步骤的位宽。
| 模块 | 观察到的问题 | 操作 | 主要作用时间 |
|---|---|---|---|
| BGR | 大量权重集中在中间,少量极端值拉宽量化范围 | 搜索较好的范围,交替细化刻度与编码 | 权重量化准备阶段 |
| ARQ | 激活有大值和通道尺度差异,而且随去噪步骤变化 | 旋转、在线缩放、量化与尺度补偿 | 当前层与当前去噪步骤的推理 |
| δ-GBS | 不同步骤的特征变化幅度不同 | 根据累计变化选择 A4 或 A8 | 推理过程中的步骤调度 |
可以把量化想成使用一把刻度很少的尺子。BGR 为已有权重调整尺子;ARQ 让当前激活更适合这把尺子;δ-GBS 决定某个步骤值得使用多少精度。
3. BGR:先选范围,再交替调整刻度和编码
3.1 量化网格是什么
对于一个权重 ,整数编码为 ,还原值为:
是刻度间距, 是零点编码,决定哪个整数档位对应真实数值 0。4 bit 的 取 0 到 15。编码通过缩放、四舍五入和截断得到:
例如, 时,。如果编码和零点保持不变,把间距改成 0.094,还原值就变成 0.188。调整网格改变的是整数编码所代表的真实数值。
论文使用按通道的量化参数,同一通道内的一组权重共享 。原始权重始终作为优化的参照。
3.2 为什么需要边界搜索初始化
MinMax 直接根据最大、最小值设置间距:
对于近似高斯分布的权重,多数数值集中在中间,少量极端值位于两端。端点拉得越开,有限档位之间的间距越大,中间的大量权重就更难精细表示。
图 2 左上方的 表示向内收缩上下边界。收紧范围让刻度更密,但范围外的权重会产生更大的裁剪误差。因此,作者尝试多个候选范围,并根据原始权重的重建误差选择结果。
裁剪后的 用于构造初始参数;后续误差仍相对于原始 计算。这样才能同时考虑范围内的舍入误差与范围外的裁剪损失。
3.3 图 2 左下:为什么误差曲线会下降

图 2 左栏局部。左下的横轴是量化参数优化步骤,右栏的时间轴才是视频去噪步骤。红、绿虚线是 MinMax 与 Bounded-init 的误差参考,蓝线表示迭代网格细化的趋势。
论文目标写为 Frobenius 范数,求最优解时可以等价使用误差平方和:
相互影响。BGR 采用交替调整:
- 固定 ,更新刻度间距 。
- 固定 ,更新零点 。
- 使用新的 ,重新计算整数编码 。
- 重复这一过程,在改善足够小时停止;对不同候选初始化比较最终误差。
固定 后,令 ,目标就是让 尽量接近 。最小二乘直接给出:
固定 后,零点的连续最优位置为:
再按正文说明处理整数与范围约束。网格改变后,重新取整会让一些权重换到更近的档位。
图上的 Grid Refinement 对应刻度参数调整,Weight Rounding 对应重新分配整数编码。蓝线从红线附近开始绘制,图中没有逐点注明实验条件,因此应把它作为优化机制概览。橙色虚线标注误差参考水平,不能直接把线的高度当作算法的停止参数;停止判断关注相邻迭代的改善。
3.4 一组完整的教学算例
手工设置初始网格 ,原始权重为:
最初得到 ,还原为 ,总平方误差为 0.0042。
固定编码时,,因此:
还原值变成 ,总误差下降到 0.00312。此时 0.24 的误差反而从 0.04 增加到 0.052,但另外三个权重改善更多,整组总误差仍然下降。
零点连续解约为 7.926,取整后仍为 8。接着重新选择档位:对于 0.24,编码 10 对应 0.188,距离为 0.052;编码 11 对应 0.282,距离为 0.042,因此改选编码 11。
| 状态 | 间距 | 整数编码 | 总平方误差 |
|---|---|---|---|
| 初始网格 | 0.10000 | [7,10,11,12] | 0.004200 |
| 更新间距 | 0.09400 | [7,10,11,12] | 0.003120 |
| 更新零点,本例仍为 8 | 0.09400 | [7,10,11,12] | 0.003120 |
| 重新取整 | 0.09400 | [7,11,11,12] | 0.002180 |
| 下一轮更新间距 | 0.08743 | [7,11,11,12] | 0.000669 |
编码变化后,上一轮最合适的间距可能不再合适,因此继续求解。参数也可能保持不变,曲线逐渐进入平台。该算例说明交替优化的机制,不是论文实验数据,也不表示算法保证找到所有可能网格中的全局最优解。

原论文图 3,PDF 第 5 页。各小图横轴为层索引,纵轴为量化误差;红线为 BGR,青色线为 MinMax。它与图 2 的优化步骤曲线具有不同横轴。
图 3 展示的层组中,权重量化误差降低约 86%~92%。这些比例支持 BGR 的重建误差收益,不能直接解释为视频质量提高了同样比例。BGR 的优化发生在权重量化准备阶段,不需要生成样例作为校准数据。原文 §3.1、算法 1
4. ARQ:旋转后在线缩放,再补偿原来的尺度
4.1 激活为什么需要动态处理
激活是当前层运行时产生的特征。它既可能有个别极端值,也可能有整列通道偏大的情况,而且会随去噪步骤变化。图 2 中间的 、 对照,以及不同的 ,强调了这种时间变化。
ARQ 先采用 Hadamard 旋转,重新混合通道,分散过于集中的大值。教学例子中:
这是一个归一化四维 Hadamard 变换的结果,变换前后的平方和均为 64.06。数值被重新分配,变换可逆,原来的大值没有被直接裁掉。
采用统一的矩阵维度约定,设激活 、权重 ,线性层为 。匹配地旋转激活与权重:
其中 。在尚未量化时,这种变换保持计算等价。旋转后的权重 由 BGR 量化并保存;激活在实际运行时进行快速 Hadamard 变换。
4.2 为什么旋转后还要缩放

原论文图 4,PDF 第 6 页。两组示例分别来自不同层;每组从左向右表示旋转前后。
旋转可以降低部分尖峰,但也可能把高值分布到更广的区域,或留下新的通道尺度差异。图 4 因此支持继续处理旋转后的数值范围。
令 。把激活看成表格,每行对应一个 token,每列对应一个通道。作者按当前通道的最大绝对值计算:
例如,一列 除以 10 后得到 ;另一列 除以 0.2 后也得到 。各通道被调整到更可比较的尺度。
这里使用的是当前激活的统计,下一去噪步骤可以重新计算。没有预先固定一批校准样例得到的缩放系数。
4.3 缩放补偿究竟是什么
缩放改变了数值大小,后续计算需要把尺度带回来。假设两个通道的激活为 ,对应权重为 ,缩放系数分别为 10 和 0.2。
原来的输出:
缩放后激活为 。如果只使用缩放后的值,输出会变成 5。补偿尺度后:
每个通道的系数不同,因此要补偿各通道的乘积贡献,再相加,通常不能在最终输出上统一乘一个最大值。
将系数写成对角矩阵:
量化后的近似计算可以理解为:
为方便解释,这里把量化后还原的近似值记为 。缩放与补偿之间插入了低比特量化,因此不是一次没有作用的除法与乘法。
例如,5 除以 10 得到 0.5,如果量化近似为 0.47,补偿后是 4.7。补偿恢复数值尺度,不能消除离散化误差。
论文公式按通道缩放描述机制,实际加速内核采用与 Tensor Core 矩阵乘法粒度匹配的分块缩放。所有正文速度和精度结果来自这种硬件对齐配置,不能把理论按通道写法直接等同于具体内核操作。原文 §3.2
5. δ-GBS:累计特征变化,决定下一步使用多少精度
去噪过程中的特征变化幅度不均匀。作者使用相邻模型输出的变化作为精度分配指标:变化较小时尝试 A4,累计变化较大时使用 A8。
将第 步的输出特征记为 ,相对变化量为:
分子计算所有分量绝对变化之和,分母用上一步特征的大小归一化。例如 、 时,变化总量为 0.2,原特征总量为 4,因此 。
这衡量的是模型输出特征的相对变化。没有额外运行全精度模型作参考,因此它不是直接测得的量化误差。
作者累加上次重置以来的变化:
若 ,下一步骤使用低位宽;达到阈值时使用高位宽并重置计数器。实验采用 、。
假设 ,从已经能够计算变化量的阶段开始:
| 已完成步骤的变化量 | 累计变化 | 下一步的激活位宽 | 处理 |
|---|---|---|---|
| 0.02 | 0.02 | 4 bit | 继续累计 |
| 0.03 | 0.05 | 4 bit | 继续累计 |
| 0.04 | 0.09 | 4 bit | 继续累计 |
| 0.025 | 0.115 | 8 bit | 计数器重置为 0 |
| 0.02 | 0.02 | 4 bit | 重新累计 |
这些是教学数字。每一步变化可能都不大,但连续的小变化也会触发高精度。决定当前待执行步骤位宽时使用的是此前已经产生的输出,符合正文公式(11)的求和上限。
重置的是变化计数器,使用一次 A8 并不自动修复之前的量化误差。该指标是作者提出的调度依据,不能直接视为每一步量化敏感性的精确测量。
较小,更容易触发 A8; 较大,更多步骤使用 A4。如果 50 步中 25 步使用 A4、25 步使用 A8,平均激活位宽为:
这就是 W4A6 的含义。它使用已有 A4、A8 内核,不要求每一步执行固定 6 bit 算子。实际分配随特征变化和阈值改变,不必每次都各占一半。原文 §3.3、§4.4
6. 主实验:低比特视频质量与视觉对比
正文使用 HunyuanVideo、50 步 flow matching 调度器,embedded CFG scale 为 6.0、flow shift factor 为 7.0,硬件为单张 RTX 4090。评价采用 VBench 的八个维度。
下表摘录表 1 的美学质量、成像质量与动态程度。其他一致性与运动平滑指标见原表。动态程度衡量视频是否呈现运动表现,应与画质和一致性联合阅读,数值较大不自动代表运动更正确。
| 方法 | 精度 W/A | 美学质量 | 成像质量 | 动态程度 |
|---|---|---|---|---|
| 原始 HunyuanVideo | 16/16 | 62.53 | 64.78 | 51.39 |
| MinMax | 4/8 | 59.44 | 60.62 | 52.78 |
| SmoothQuant | 4/8 | 60.50 | 64.47 | 51.39 |
| QuaRot | 4/8 | 58.80 | 56.86 | 55.56 |
| ViDiT-Q | 4/8 | 57.01 | 59.74 | 48.61 |
| DVD-Quant | 4/6 | 62.27 | 64.22 | 58.33 |
| MinMax | 4/4 | 24.20 | 24.78 | 0.00 |
| SmoothQuant | 4/4 | 48.41 | 59.46 | 1.39 |
| QuaRot | 4/4 | 44.85 | 54.30 | 87.50 |
| ViDiT-Q | 4/4 | 45.36 | 40.10 | 0.00 |
| DVD-Quant | 4/4 | 61.96 | 61.82 | 56.94 |
数据来自原论文表 1,PDF 第 7 页。
DVD-Quant 的平均 W4A6 美学与成像质量接近 BF16,同时使用更少的激活比特。但它没有在所有指标上超过所有 W4A8 对照:SmoothQuant 的成像质量为 64.47,略高于 DVD-Quant 的 64.22。
在统一 W4A4 时,DVD-Quant 的美学质量比最好的 W4A4 对照 SmoothQuant 高 13.55 分,成像质量高 2.36 分。SmoothQuant 的成像分数并不很低,但动态程度只有 1.39,说明单看清晰度会遗漏运动表现的问题。
“接近原模型”有具体指标范围。DVD-Quant W4A6 的场景一致性为 33.07,低于 BF16 的 42.81;W4A4 为 29.94。实验不能证明所有维度无损。

原论文图 5,PDF 第 7 页。左侧 W4A 对照使用 A8,DVD-Quant 使用平均 A6;右侧统一为 W4A4。*
火箭示例中,部分方法丢失细纹理或产生结构扭曲,MinMax W4A4 出现杂乱噪声。DVD-Quant 保留了较完整的火箭与发射场景。这里展示的是抽帧外观,不能只通过静态截图判断完整运动轨迹或时间一致性。原文表 1、图 5
7. 消融:分别检验三个模块的作用
7.1 BGR 与 ARQ 的模块移除
表 3 比较只保留一个模块,以及两者一起使用。以下数字只在表 3 内部比较:
| 精度 | 保留的模块 | 美学质量 | 成像质量 | 主体一致性 | 运动平滑度 | 背景一致性 |
|---|---|---|---|---|---|---|
| W4A6 | 仅 ARQ | 58.15 | 58.68 | 98.04 | 98.49 | 98.21 |
| W4A6 | 仅 BGR | 57.85 | 57.72 | 98.23 | 97.86 | 98.10 |
| W4A6 | BGR+ARQ | 60.46 | 61.93 | 98.91 | 98.95 | 98.40 |
| W4A4 | 仅 ARQ | 53.95 | 52.67 | 97.92 | 98.71 | 97.89 |
| W4A4 | 仅 BGR | 43.26 | 58.31 | 95.36 | 96.08 | 97.35 |
| W4A4 | BGR+ARQ | 59.57 | 58.93 | 98.67 | 99.00 | 98.47 |
数据来自原论文表 3,PDF 第 8 页。
以 W4A4 为例,拿掉 BGR 后,成像质量从 58.93 降到 52.67,下降 6.26 分。拿掉 ARQ 后,美学质量从 59.57 降到 43.26,下降 16.31 分。两者一起使用时,表中的五个指标都更好。
这支持权重量化与激活处理的互补作用。单项指标也可能掩盖差异:仅 BGR 的成像质量为 58.31,距完整组合只差 0.62 分,但美学质量差距很大。
表 3 没有“两者都不用”的行,也没有把 BGR 的边界搜索与网格细化、ARQ 的旋转与在线缩放分别拆开。因此,它支持模块整体贡献,不能精确分离每个内部操作或计算完整交互效应。
7.2 δ-GBS 与固定分配策略
表 2 在平均激活位宽约为 6 bit 的预算下比较不同分配方式:
| 策略 | 位宽分配方式 | 成像质量 |
|---|---|---|
| STP | 前 25 步 A4,后 25 步 A8 | 61.33 |
| ITP | 前 25 步 A8,后 25 步 A4 | 61.40 |
| ABS | A4、A8 交替使用 | 61.03 |
| SBA | 随机分配 A4、A8,维持匹配预算 | 61.26 |
| δ-GBS | 根据累计特征变化决定 | 61.93 |
数据来自原论文表 2,PDF 第 8 页。
这组实验比较的是高精度用在哪些步骤。δ-GBS 比最好的固定策略高 0.53 分,说明按实际特征变化分配精度具有一定收益。表中没有多次重复实验的方差或误差条,不能进一步判断这点差距的统计稳定性。原文 §4.3
7.3 阈值 δ 的敏感性

原论文图 6,PDF 第 9 页。逐步增大阈值,标注的平均成像质量逐渐下降。
| δ | 图中标注的成像质量 |
|---|---|
| 0.06 | 62.11 |
| 0.09 | 61.93 |
| 0.12 | 61.43 |
| 0.15 | 61.19 |
| 0.18 | 61.00 |
作者解释,较大的 δ 会减少高精度步骤,降低平均位宽,并带来一定质量下降。图 6 直接展示画质趋势,没有为每个 δ 同时列出平均位宽、显存与实际耗时,所以完整的质量—成本曲线仍需要更多数值。原文图 6
8. 效率与缓存组合实验
表 5 报告相对于 BF16 的显存和延迟优化:
| 配置 | 显存节省倍数 | 延迟加速倍数 |
|---|---|---|
| BF16 | 1.00× | 1.00× |
| W4A8 | 3.68× | 1.75× |
| 平均 W4A6 | 3.68× | 1.93× |
| W4A4 | 3.68× | 2.12× |
数据来自原论文表 5,PDF 第 9 页。
按报告倍数换算,显存用量约为原来的 27%,W4A4 的耗时约为原来的 47%。三种配置显存收益相同,激活位宽降低后速度继续提高。表中提供相对倍数,没有列出绝对秒数或 GB。
作者还将量化与 TeaCache 缓存机制配合。缓存通过复用部分中间特征减少计算,与降低数值精度属于不同方向。
| 组合方案 | 美学质量 | 成像质量 | 加速倍数 |
|---|---|---|---|
| DVD-Quant+TeaCache,W4A8 | 61.39 | 62.96 | 4.01× |
| DVD-Quant+TeaCache,W4A4 | 58.78 | 58.20 | 4.85× |
数据来自原论文表 4,PDF 第 9 页。
4.85× 是组合方案的结果,DVD-Quant 单独使用的最高报告加速为 2.12×。组合仍应同时考虑质量:表 4 的 W4A4 成像质量为 58.20。该表没有列出仅 TeaCache 的对照,不能单独据此精确拆分两种加速的贡献。原文 §4.4—4.5
9. 结论边界与原文数据核对
主结果、权重量化误差和模块消融共同支持:BGR 与 ARQ 的组合能在报告配置下维持较好的低比特生成效果。δ-GBS 支持更灵活的步骤精度分配,但它相对于固定策略的提升较小,需要重复评测判断稳定性。
阅读和复现时还应保留以下边界:
- Data-free 的含义是无需离线校准集。 ARQ 仍读取当前激活统计,δ-GBS 仍使用运行时输出特征;推理开销也不因此为零。
- W4A6 是平均位宽。 实际使用 A4 与 A8 的步骤组合,不能理解为所有激活始终按固定 6 bit 算子执行。
- 质量不是所有维度无损。 场景一致性仍低于 BF16,动态程度和运动平滑也需要与画质联合判断。
- 实验条件影响收益。 正文数字来自作者报告的模型、50 步调度器和 RTX 4090 配置,不自动推广到所有硬件、视频长度或分辨率。
- 评测统计信息有限。 相关段落没有充分列出样例数量、多种子方差和各模块的独立运行开销;当前 PDF 也未附正文所指向的 Wan2.1 补充结果。
- 模块内操作尚未完全拆分。 现有消融检验 BGR、ARQ 整体,以及不同位宽策略,没有完成所有内部因素的独立对照。
当前 v4 还有需要核对的数据差异:
| 位置 | W4A4 美学质量 | W4A4 成像质量 |
|---|---|---|
| 表 1 的 DVD-Quant | 61.96 | 61.82 |
| §4.2 正文举例 | 58.94 | 60.38 |
| 表 3 的 BGR+ARQ | 59.57 | 58.93 |
表 1 与 §4.2 对同类主结果的描述不一致;表 3 完整配置也与主表不同,相关正文没有充分解释差异。本文主性能比较采用表 1,模块移除比较只使用表 3 内部数据。复现或正式引用前,应进一步核对作者配置与结果,而不是将这些数值混成一组。
原始来源
- arXiv 固定版本摘要页:2505.18663v4
- 论文 PDF:DVD-Quant,ICLR 2026 标注版本
- 权重量化方法与算法 1,PDF 第 4 页
- ARQ 与 δ-GBS,PDF 第 6 页
- 主结果与图 5,PDF 第 7 页
- 模块消融与位宽策略,PDF 第 8 页
- 阈值、显存、速度与缓存组合,PDF 第 9 页
文中图 1—图 6 均裁自上述固定版本论文,并在相应位置保留图号、页码与解释。局部图来自图 2;教学算例由本文构造,未作为论文实验结果使用。
See also
- P4Q 论文解读:用提示学习和低位宽适配器修复 CLIP 的图文对齐 2026-10-05
- D4C 论文解读:没有真实图片,如何把 CLIP 量化到低位宽 2026-10-03
- 一次完整的 WSL2 安装排障:从 BIOS、TPM 判断到 Windows 11 修复安装 2026-07-07
- 把一个 SPA 博客补成可预渲染、可同步、可持续部署 2026-05-29
- 把宿舍 Windows 主机改成可远程训练的 WSL 工作站 2026-05-27