warp / knownness 数据图鉴 8 clips × 4 行
每 clip:GT / z_mem(前向 warp 画布)/ knownness k 热力图 / z_mem 被 k>.5 门控。帧 0/20/40/60/80。2026-07-29
🔴 发现:density-k 有系统性乐观偏差 —— 它量的是"有多少源像素落在这里",不是"落得对不对"。
看 clip 111b656f 帧 60/80:z_mem 里石墙已经被拉成一团模糊、货架严重变形,但同位置的 k 图是纯红(k≈1,"完全可信") 。
同样在 00e3fa12 帧 40-80:地面在 z_mem 里是一片糊掉的灰白,k 却给了一整块红色三角。
机理: 掠射角(grazing angle)表面在前向 splat 时会有大量源像素堆积到少数目标像素上 → 密度很高,保真度很低 。density-k 对"拉丝"完全盲。
后果: τ₀ = 1−λk 会给这些拉丝区一个低噪声上限 (expF 降到 .45)= 告诉模型"这里基本对了,抛光即可" —— 可那里根本没有能抛的东西。这为我们长期看到的拉丝伪影提供了一个具体机制。
k 做对的部分: 从未观察的区域判得很准 —— 天空、视锥外、被遮挡后露出的新区域都干净地判成蓝色(见 00e3fa12 的天空、111b656f 帧 60/80 的右侧新墙)。所以问题不是"k 没用",而是k 只有覆盖维度,缺保真维度 。
可落地的修法(候选 expN): 给 k 乘一个抗拉丝因子 —— ① warp 雅可比行列式(表面前缩比)② 深度梯度幅值(掠射面 = 大梯度)③ 多源帧投到同一目标像素的互相矛盾度 (拉丝区不同源帧会给出不一致颜色)。三者都能从现有 cache 离线算出来,不需重跑 VGGT。
覆盖率分布(8 clips)
clip mean k coverage frac(k>.5) split
0130348e 0.783 0.787 held-out 111b656f 0.755 0.751 TEST 00534f58 0.713 0.707 TRAIN 2501f488 0.677 0.678 TEST 010533f2 0.645 0.643 held-out 0003dc82 0.521 0.516 TRAIN 0194be61 0.445 0.449 held-out 00e3fa12 0.438 0.436 held-out
覆盖率跨 clip 差了近 1.8 倍 (0.438 ~ 0.783)。这直接解释了为什么各 clip 的 PSNR 差这么多(2501f488 只有 10.5dB 而 111b656f 有 16-17dB)—— 难度主要由几何覆盖决定,而不是模型好坏。这也说明 4-clip dev 集的平均值对覆盖率分布很敏感 ,又一条"终判必须上 20-clip"的理由。
逐 clip 大图
clip 0130348e | mean k = 0.783, coverage = 0.787 clip 111b656f | mean k = 0.755, coverage = 0.751 clip 00534f58 | mean k = 0.713, coverage = 0.707 clip 2501f488 | mean k = 0.677, coverage = 0.678 clip 010533f2 | mean k = 0.645, coverage = 0.643 clip 0003dc82 | mean k = 0.521, coverage = 0.516 clip 0194be61 | mean k = 0.445, coverage = 0.449 clip 00e3fa12 | mean k = 0.438, coverage = 0.436