thoughts.ycjian.com · 研究笔记

WROP 评测指标:是什么、怎么算、哪里弱

依据论文 arXiv 2609.28654、代码仓库、Hugging Face 数据和排行榜页。只用已核实的事实。

1. 一句话结论

主指标是人工 Elo。像素类指标只是辅助。所有指标都没有及格线。仓库里没有任何评测代码。

项 状态
主指标 人工两两比较 → Bradley–Terry → Elo
辅助指标 与参考视频比的像素/特征指标
及格线 无(只有评分员资格线 8/10)
评测代码 无
原始人工判断 未公开
消融实验 无

2. 人工指标

20 名众包评分员。共 361 次有效两两判断。每个模型约 51 次。评分员一次点击,同时判三条:贴合文字、运动自然、物体恒存。

评分员很可能看了参考视频。§1 第 2 页写明:"Generated continuations are judged by human evaluators against physically consistent, hand-authored animation ground truth"。§4.4 第 9 页只写了 "the input video and the text prompt" 和 A/B 两段。所以 §4.4 的描述不完整。评分说明没有公开。

指标 测什么 怎么算 越高还是越低好
Elo 人更偏好哪个模型 选 A / B / 差不多;平局算半胜;Bradley–Terry 拟合;均值 1500 越高越好
95% CI Elo 的不确定性 按评分员重抽样 1000 次 越窄越确定
Score rate 原始胜率 胜 = 1,平 = 0.5,除以场次 越高越好
Games 参加的判断次数 计数;每个模型 50–52 —
Top-1 概率 排第一的机会 1000 次重抽样里排第一的比例 越高越好
分族 Elo / 排名 单个任务族上的偏好 每族单独拟合;每族 36–96 场 Elo 越高越好;排名 1 最好

经验值(Elo):标准 Elo 用 400 尺度。预期得分 = 1/(1+10^(−d/400))。差 100 分约 64%。差 200 分约 76%。WROP 的 1500 是均值。WROP 用 Bradley–Terry 拟合。换算系数没公开。下面的换算假设标准 400 尺度。例:PWM-WROP 比 Grok Imagine 高 222.5 分,约 78%。Wan 3.0 Prime 比 PWM-WROP 高 44.1 分,约 56%。出处:Wikipedia: Elo rating system

评分员质检 数
资格测试 及格线 8/10
注意力检查 90.0% 正确
重复题自洽 93.5%,Cohen's κ = 0.891
左右位置偏差 左边胜 51.4%(p = 0.615)

3. 自动指标

模型输出先按各模型规则裁剪。再均匀重采样到 60 帧。再缩到 320×192。然后和参考视频逐题比。最后对 300 题取平均。论文自己说:这些指标只测「像不像参考」,不测物理推理对不对。

指标 测什么 怎么算 越高还是越低好 报了吗
MSE 像素平方误差 320×192 越低越好 表 3
MAE 像素绝对误差 320×192 越低越好 算了,未报
PSNR MSE 的对数形式 320×192 越高越好 表 3
SSIM 局部结构相似 320×192;窗口未写 越高越好 表 3
MS-SSIM 多尺度 SSIM 320×192 越高越好 表 3
LPIPS 感知距离 320×192;骨干网未写 越低越好 表 3
时间差 L1 帧间变化是否一致 公式未写 应为越低越好 算了,未报
末帧 MSE / SSIM / LPIPS 只比最后一帧 320×192 和 1280×720 MSE、LPIPS 越低越好;SSIM 越高越好 算了,未列表(正文只给 PWM-WROP 末帧 LPIPS 0.166)
CLIP 语义相似 ViT-B/32,224×224;定义未写 越高越好 表 3
FID 生成帧与参考帧的分布距离 299×299;每 2 帧取 1;每边约 9030 帧;每个模型只有一个数 越低越好 表 3

经验值(只供参考;最后一列是我们打开读过的出处)

指标 经验值 对眼睛意味着什么 WROP 表 3 范围 出处
MSE 无通用阈值。PSNR = 10·log10(MAX²/MSE)。 要换算成 PSNR 再看 2.97–40.59(×10⁻³) Wikipedia: PSNR
PSNR 8 位有损压缩常见 30–50 dB。无线传输可接受约 20–25 dB。「>40 几乎看不出、30–40 好、20–30 看得出、<20 差」是常见说法,未找到可靠出处。 越高,像素差越小 15.03–27.51 dB 同上
SSIM / MS-SSIM 取值 −1 到 1。1 = 完全相同。0 = 不相似。无公认阈值。 越接近 1,结构越像 SSIM 0.768–0.942;MS-SSIM 0.594–0.921 Wikipedia: SSIM
LPIPS 0 = 相同。无公认阈值。原论文说:模糊让人眼差别大,但 L2 变化小;SSIM 不是为几何形变设计的。 越低,越接近人眼感觉 0.081–0.349 Zhang et al. 2018
FID 无绝对标准。只在同一协议内可比。原论文:干扰越强,FID 单调升高。原论文用 50,000 张图;WROP 每边约 9,030 帧。 越低,整体分布越接近 13.6–73.7 Heusel et al. 2017
CLIP(ViT-B/32) 无标准阈值。CLIP 用余弦相似度。 只反映语义像不像 0.853–0.962(挤在 1 附近) Radford et al. 2021

MSE 与 PSNR:论文没写 MAX。按表 3 的量级推断 MAX = 1(像素归一到 0–1)。若 MAX = 255,PSNR 会是 62–73 dB,与表 3 不符。

核对:14 个模型都满足「表 3 PSNR 高于用平均 MSE 算出的 PSNR」,高 1.1–7.1 dB。例:Wan 3.0 Prime 表 3 为 27.15 dB;用平均 MSE 4.48×10⁻³ 算是 23.49 dB。这提示 PSNR 是先逐段算、再取平均(推断)。

注意:这些经验值假设「同一画面加了失真」(压缩、噪声)。WROP 里候选和参考在时间和位置上都会不同。所以这些数只能比模型,不能读成「看起来多像」。例:G26 冻结最后一帧什么都没做,PSNR 仍有 27.22 dB(我们的复算,MSE 1.90×10⁻³)。这高于无线传输「可接受」的 20–25 dB,但它答错了。

考题元数据里还有一个规则判分器的接口(PermanencePhysicsEvaluator,300 题中 276 题有)。代码没公开。论文没提。没有结果。

4. 主要结果

头条指标是人工 Elo(表 2,第 10 页)。前四名的置信区间互相重叠。第一名是统计上的并列。

名次 模型 类型 Elo 95% CI Score rate Games
1 Wan 3.0 Prime Reference-to-video 1723.6 [1629.2, 1864.9] 77.9% 52
2 MiniMax H3 Reference-to-video 1723.6 [1644.5, 1837.6] 77.9% 52
3 PWM-WROP True continuation 1679.5 [1603.5, 1781.5] 73.1% 52
4 Seedance 2.5 Reference-to-video 1649.6 [1554.2, 1751.5] 69.6% 51
14 MAGI-1 24B True continuation 1248.0 [1137.2, 1315.6] 19.2% 52
其他 数
Top-1 概率 Wan 3.0 Prime 46.8%,MiniMax H3 36.4%,PWM-WROP 12.3%,Seedance 2.5 4.5%,其余 0
PWM-WROP 自动指标 LPIPS 0.081、MS-SSIM 0.921,两项都是最好

5. G26 例子

题目:G26 bottom_rail_screen_0000。输入结尾时屏风挡住物体。参考视频里屏风滑回右边,藏青球和黄色方块重新出现。

下表是我们自己的复算。只算了这一题。不是作者的代码。

候选 最后一帧 MSE ×10⁻³ ↓ PSNR ↑ SSIM ↑ 末帧 MSE ×10⁻³ ↓
PWM-WROP 球和方块回来了 → 对 0.42 33.79 0.970 0.81
Grok Imagine (extend) 球和方块回来了 → 对 0.66 31.83 0.972 0.53
Gemini Omni Flash 1.1 屏风一直挡着 → 错 3.84 24.15 0.928 5.09
基线:冻结最后一帧 屏风一直挡着 → 错 1.90 27.22 0.961 4.98
基线:复制输入视频 不出现揭开 → 错 3.79 24.21 0.932 4.98

冻结最后一帧什么都没做。它的 SSIM 是 0.961。这高于表 3 里所有模型 300 题平均 SSIM 的最高值 0.942。只有一题,所以这是示例,不是全基准结论。

末帧 MSE 能分开对错。答对的在 0.53–0.81。答错的都约 5.0。论文没有列出这个指标。

G26 帧对比:上排为输入末帧和参考视频;下排为 PWM-WROP、Gemini、Grok 的最后一帧
G26 帧对比:上排为输入末帧和参考视频;下排为 PWM-WROP、Gemini、Grok 的最后一帧

6. 主要问题

  1. 人工协议写得不全。 §4.4 没写评分员看了参考视频。评分说明、界面、截图都没公开。一次 A/B 点击同时判三条,恒存和贴合文字、画质分不开。142/197 个提示词已写出答案,所以「贴合文字」这一条部分在奖励照着文字演。
  2. Elo 的数据少,且未公开。 只有 361 次判断,每个模型约 51 次。用了哪些考题没写。300 题里多数可能没人评过。前四名置信区间重叠。原始判断、Elo 换算系数、拟合代码都没公开。
  3. 自动指标能被钻空子。 冻结一帧就能拿高 SSIM。Reference-to-video 模型按自己的时间线重生成,再被硬拉到 60 帧比。对恒存更敏感的指标(末帧、时间差 L1、MAE)算了却没列表。

小的不一致:正文和表 2 对不上(Grok 区间 1368 对 1362.7;LTX-2.3 Extend 1452 对 1453.4;MAGI-1 24B 1240 对 1248.0;领先 224 对 222.5);14 个模型只有 91 对,正文写 120 对;FID 分辨率前后说法不一。

7. 改进建议

  1. 把协议写明。 写清评分员看到什么:输入 → 参考视频(标「正确结果」)→ 一个候选。公开评分说明和界面。
  2. 每题问 3–5 个是/否问题。 问题从每题的预期结果标记生成。G26 的例子:屏风走后是不是 2 个物体?颜色不变吗?位置不变吗?有没有东西穿过屏风?有没有揭开?加「看不清」选项。让评分员忽略时间先后、机位和分辨率。
  3. 加对照。
对照 预期
参考视频本身当候选 约 100% 通过
冻结最后一帧当候选 揭开类问题不通过
重复题 测前后一致
不给提示词的一组 测提示词当答案的影响
  1. 按通过率计分。 先算每题,再按出题器平均,再按任务族平均。
  2. Elo 降为辅助。 两两比较只作「整体质量」参考。

详见英文完整版:wrop-metrics.md

评论 0

选中正文里的文字。点「评论」按钮。评论会贴在那段文字上。

无需登录。任何人都可以回复、编辑、删除、解决任何评论。昵称可不填,会记在本浏览器里。

还没有评论。