总览 — 每个方法的全部指标
指标
CLIP12 average:每次生成的 12 个视角先取平均,再把同一 prompt 的两条有效推理重复取平均,最后按 prompt 汇总——“average of average”。
CLIP12 best-view:每次生成的 12 个视角先取最大,其余聚合完全相同——best 与 average 都不对训练 seed 或推理重复做择优。
Δ 一栏是 OURS(固定参考)− 该方法,正数表示 OURS 更高;括号内为配对 bootstrap 95% 区间,只有 7 个外部方法有归档区间(见「配对对比」页)。
Uni3D:LGM 为高斯表示,该指标按当前评测范围不适用,显示 N/A,不填 0。
CLIP12 best-view:每次生成的 12 个视角先取最大,其余聚合完全相同——best 与 average 都不对训练 seed 或推理重复做择优。
Δ 一栏是 OURS(固定参考)− 该方法,正数表示 OURS 更高;括号内为配对 bootstrap 95% 区间,只有 7 个外部方法有归档区间(见「配对对比」页)。
Uni3D:LGM 为高斯表示,该指标按当前评测范围不适用,显示 N/A,不填 0。
配对对比 — 与固定参考 OURS-seed2027-step12000 的逐 prompt 配对
分类拆分 — CLIP12 average ×100,行 = 8 个类别
划分拆分 — 行 = 6 个测试划分
每格是该单元格内所有有有效 CLIP 的 prompt 的算术平均;括号内为有效 prompt 数。单元格之间样本不同,不做显著性检验,仅用于看方法在不同类别/划分上的相对强弱是否稳定。
OURS 的两种计算口径 — 论文主数字只用第一种
口径 A(固定参考,论文口径):
口径 B(best-of-3 seed oracle,事后上界):逐 prompt、逐指标在
OURS-seed2027-step12000,预注册的单一参考分支;本页与图库中所有 “OURS” 与 Δ 都以它为准。口径 B(best-of-3 seed oracle,事后上界):逐 prompt、逐指标在
seed2026 / seed2027 / seed2028 三个训练 seed 中取最大值。它是一个事后、按指标分别择优的上界参考,不是冻结假设的替代,也不用于任何论文主张。区间与胜负只在这两个口径之间比较。
三个训练 seed 的各自表现
best-of-3 实际选中了哪个 seed
「相对 BASE 的 Δ」在 OURS ∩ BASE 共同有效的 prompt 上配对计算,属描述性对照;归档的事后分析文件用的是它自己的 1519 条交集,因此与这里的数值会有千分位量级的差别。胜/负/平按 Δ 符号统计(1e-9 容差内记平)。抽中次数合计 = 该指标上三个 seed 都有值的 prompt 数,与「完整三 seed 的 prompt 数」略有差异,原因是有少量 prompt 只有 1–2 个 seed 可用。
逐 prompt 明细 — 全部 1536 条冻结提示词 × 10 个方法
表内数值 ×100(CLIP);— 表示该 prompt 在该方法上没有有效结果(保留为空,不填 0、不重抽)。表头可点击排序。原始数据:scores.json(逐 prompt)、scores_aggregate.json(汇总)。