thoughts.ycjian.com · 研究笔记

WROP 后续改进方向

依据作者在 X 上已承认的问题,以及我们核实过的事实(含 Max 的惯性标准:继续滑走不算方向歧义)。

1. 只测了分布内,没有测泛化

训练和考试用同一批出题器。共 150 个出题器,分 6 个任务族。考试共 300 题。每个出题器出 2 题。每道考题都是训练样本 0 或 1 的重渲染。考题用同一脚本。考题种子等于训练种子的后 5 位。考题只换颜色、材质和光照。所以分数只说明模型会做「换皮」的同类题。

没有考题来自训练外的出题器。没有验证集。

泄漏风险(未知):模型实际用一版「更早的渲染」训练。这版没有公开。若它也用 5 位种子,考题可能和训练样本逐像素相同。公开文件无法核实这一点。

下一版应做两种留出。第一种:按出题器留出。第二种:按任务族整类留出。第二种更难。两种都只需用现有出题器的子集重训。两种都不需要新造出题器。

项 数
出题器 150
任务族 6
训练样本 150 万(每个出题器 1 万)
验证集 无
考题 300(150 × 2)
考题来自训练外出题器 0
作者计划 generator-disjoint + 整类任务留出
切分 例子 训练中看不到
分布内(现状) G26 bottom_rail_screen。训练样本 0:藏青球 + 橙色方块。考题 0:藏青球 + 黄色方块。滑轨屏、路径和结果都相同。 无
跨出题器 静态遮挡族(29 个)留出 G81 rolling_shutter。训练仍有滑轨屏、幕布和百叶。 从上方降下的卷帘
跨任务 留出全部 35 个容器恒存出题器。更严:留出两个遮挡族,共 55 个。 物体随容器移动或交换(杯子戏法、推车互换、转盘、抽屉)

链接:同意帖 · 详见:generalization-splits.md

2. 只有 Blender 仿真,没有真实视频

考试素材全是仿真。仿真里考得好,不等于真实摄像头视频里也行。作者说真实视频才是真正的检验,还没做。好解决:多造其他环境。若先不碰这一条,其余几条仍可在 Blender 里推进。

项 数
Blender 脚本 197
MuJoCo / 真实视频考试 0

链接:承认帖

3. 只测行为,不看内部表示

只看画面结果对不对。没有打开模型内部,看遮挡时有没有「记住」物体。所以只能说表现得像会,不能说内部真存了物体。好解决:去测 latent。

项 状态
行为考试 有
Latent / 内部探测 无(作者说下一步可做)

链接:承认帖

4. 没有镜头难度

每条都是一镜到底,相机在一条视频里完全不动。硬切没有,连续运镜也没有。作者承认切镜是更难的一半,更像要新造一批任务,不是只在老场景上拧参数。造法:优先硬切,再加一镜内连续运镜。

项 数
脚本数 约 197
一镜内相机关键帧 0
硬切 0
样本间固定机位变化 有(左/中/右)

链接:切镜帖

5. 没有真实感的大遮挡

仿真里已有会动的硬板遮挡。缺的是真实感场景里那种干净大遮挡(如车开过去挡住)。这和「必须用真实视频」不是一回事:Blender 里也能造大遮挡物扫过;真实视频是更强的最终检验,不是唯一造法。

项 状态
现有遮挡 屏风/帘/百叶等硬板关键帧(如 G19/G22/G47/G53/G79/G81/G82)
车挡一类真实感大遮挡 无;作者称 working towards

链接:原帖 · 作者回复

6. 全是刚体关键帧,没有物理引擎

没有 MuJoCo,没有柔体、布料、流体。运动是人工关键帧,不是物理算出来的。

项 数
外部物理引擎(MuJoCo 等) 0
柔体 / 布料 / 流体 0
例外 G73:Blender 自带刚体再烤关键帧

7. Prompt 把恒存答案写进去了

按正常人常识,「遮挡后物体应回来」不该写进 prompt。遮挡物继续滑走按惯性默认即可,不算欠写。主要问题是 OVER(over-guidance)。造法上:无 LLM 管线说明,正文写死在 CASE["prompt"],渲染时只换颜色词并加前缀;Hugging Face 上已是成品完整 prompt。

桶 n 占比
OK 55 28%
OVER 142 72%
UNDER 0 0%
MIXED 0 0%
合计 197 100%
其他 数
OP-2 恒存说教 约 43/44(97.7%);唯一未讲:G24
避免 over-guidance 的作者规则 无

详见:prompt-ambiguity-197.md、prompt-authorship.md

评论 0

选中正文里的文字。点「评论」按钮。评论会贴在那段文字上。

无需登录。任何人都可以回复、编辑、删除、解决任何评论。昵称可不填,会记在本浏览器里。

还没有评论。