本章资料核验截至 2026-08-30。这里的 VAE 指用训练 posterior 与部署 prior 建模同一历史之后的随机未来;把已知完整视频压缩成 latent、供 diffusion / flow / AR 使用的“video VAE”属于视频 Tokenizer、Codec 与生成式压缩,不是本章同一个概率合同。
本章先回答一个比“模型名里有没有 latent/VAE”更严格的问题:部署时,随机变量究竟从哪里来? 若它来自不看未来的 generative prior(可固定,也可由历史和合法条件学习),并在训练中由能看真实未来的 posterior 通过 KL/ELBO 对齐,才进入严格主线。
给定相同历史
其中
图 1:future-aware posterior 只属于训练;history-only prior 才是部署接口。生成“左/右/停”三个样本还不够,必须继续检查 latent 使用、prior gap、有效覆盖和频率校准。
顺序化文字替代:训练时,历史和已发生的真实未来进入 posterior,得到用于解释该未来的
| 判定问题 | 严格主线需要的答案 | 常见伪阳性 |
|---|---|---|
| 随机量是什么? | 未被历史与合法条件决定的未来状态/事件 | 已知视频的压缩 latent、diffusion noise、GAN seed |
| 训练 posterior 看什么? | 历史 + 待解释的真实未来/新观测 | 只编码当前帧,或根本没有 amortized posterior |
| 部署 prior 看什么? | 固定,或只看历史 + 合法 action/language/goal;绝不能看隐藏未来 | 测试仍用 posterior、看终点帧、人工给 latent action |
| 怎样对齐? | KL、ELBO 或等价 variational free energy | 只有 reconstruction/VQ/GAN/contrastive loss |
| 验收什么? | 条件分布、mode 频率、calibration、open-loop horizon | 只看 reconstruction、单样本锐度或 token 压缩率 |
| 角色 | 随机/潜变量表示什么 | 部署来源 | 首要验收 | 所属章节 |
|---|---|---|---|---|
| stochastic future latent | 同一历史后的不可约未来分叉 | history-conditioned prior | 覆盖、校准、条件一致、horizon | 本章 |
| representation tokenizer | 已知视频的紧凑表示 | encoder 或上层 generator | 重建、shape、压缩账、codec 成本 | Video Tokenizer |
| belief / RSSM state | 部分可观测环境的 belief 与动力学随机性 | action-conditioned dynamics prior | reward/continue、return、model exploitation | World Models |
| latent action / plan | 对未来转移的控制码或技能 | 人、policy 或 conditional plan prior | controllability、policy agreement、任务成功 | 可控与交互路线 |
| diffusion / flow noise | 生成路径上的随机状态 | noise schedule / base distribution | score/flow objective、sampler、生成分布 | Diffusion / Flow |
顺序化文字替代:遇到 latent/VAE 名称,先找能看真实未来的训练 posterior;再找固定或只看历史与合法条件、绝不看未来的部署 prior;再核对 KL/ELBO;最后确认测试确实从 prior 采样。四项都成立才进入严格随机未来主线。缺任一项时分别检查 tokenizer、diffusion/flow、确定性层级、latent action 或 posterior oracle。
VAE 用
对角 Gaussian 常用重参数化
这只是可微采样技巧。ELBO 不是视觉质量分数;Gaussian likelihood 的均值预测可能平均多个 mode;KL 非零也不证明 decoder 使用了对任务有意义的
一种通用顺序模型写成
训练 posterior 则是
对应条件 ELBO:
VRNN 给出逐步 latent 的通用序列框架 [2];SV2P 将其用于多未来视频预测 [3];SVG-LP 的关键推进是让部署 prior 显式随历史变化 [4]。
实践常优化
其中
- β=1 且没有破坏概率解释的额外项时,才是原模型的标准 ELBO。
- β<1 常让 latent 更容易携带信息,却可能扩大部署 prior gap;β>1 可能强化正则,也可能更快 collapse。
- free bits 在目标中不再继续压低阈值以下的 KL,使 latent 通道有机会形成;它不保证实际 KL 达到某个下限,也不证明通道承载的是语义事件。
- adversarial/perceptual loss 可提高锐利度,但会改变 likelihood 解释;SAVP 正是 VAE + GAN 的代表 [5]。
- masked、flow、landmark、reward 等辅助目标能改变 representation;下游收益必须和未来分布校准分开。
| gap | 定义 | 最小诊断 | 常见误判 |
|---|---|---|---|
| model / likelihood gap |
|
提升 decoder/likelihood、控制 latent 不变 | 把所有模糊都叫 posterior collapse |
| approximation gap | 选定 |
richer posterior / hierarchy / flow ablation | 只增加 decoder 容量 |
| amortization gap | 共享 inference network 未达到每样本最优 | per-instance refinement 与 amortized |
把它与 prior gap 混为一谈 |
| prior–posterior gap | 部署 |
posterior oracle 与 prior rollout 并排、mode JS/KL | 用 posterior 样本代表测试能力 |
| open-loop / exposure gap | 训练读真实状态,部署读自身预测后分布漂移 | horizon 曲线、multi-step/overshooting | 短期重建好就称长期可靠 |
Improved Conditional VRNNs 将一部分模糊定位为 hierarchy 与 likelihood capacity 不足 [7];PlaNet 的 latent overshooting 则直接针对多步 prior 对齐 [9]。二者修的不是同一个 gap。
| 结构 | 主要表达 | 代表节点 | 常见失败 | 必须做的干预 |
|---|---|---|---|---|
| sequence/global |
身份、背景、整体意图 | SV2P | 一次采样锁死长视频,新事件不足 | 跨整段 swap |
| per-step |
持续出现的局部分叉 | SVG-LP、VRNN | 无时序先验时抖动,AR 漂移 | 单步/连续区间替换 |
| deep hierarchy |
多尺度随机因素和 richer posterior | Improved VRNN、GHVAE | 高层被低层/decoder 绕过 | per-level KL、active units、逐层 ablation |
| temporal hierarchy | 慢计划与快细节 | CW-VAE、VPR | fixed clock 错过事件;event gate 过拟合 | 改 clock/event threshold,比较 boundary 与 rollout |
| static/dynamic 或 appearance/motion | 内容与运动的结构先验 | S3VAE、SLAMP | 命名不等于可识别解耦 | swap、反事实、probe、遮挡/相机运动测试 |
| object/module/particle | 对象状态、交互机制与 latent action | G-SWM、VIM、DDLP、LPWM | slot identity 漂移、对象数/相机运动失败;VIM 主要结果依赖 posterior-assisted inference | count/ID/collision、对象消失/新生、prior-only OOD 组合 |
SRVP 把完整时序演化移到 latent residual process,frame generator 只负责渲染 [10]。这不是“再堆一层 latent”,而是把动力学和像素回灌解耦。
顺序化文字替代:VRNN 建立逐步随机状态,SV2P 将未来 posterior 与固定 prior 接到视频,SVG-LP 改为历史条件 learned prior。随后一支提升容量和 latent 深度,一支把 dynamics 完全移入 latent;再分别发展成贪心深层、固定/事件时间抽象和 object/module 结构。DDLP 在 2023/2024 把粒子 posterior 与 Transformer dynamics prior 接成直接对象粒子预测,LPWM 在 2026 再加入 latent action 与多条件控制。PlaNet–Dreamer 则把同类数学接到 action/reward/return。开放域高保真生成的另一主流转向表示 VAE/VQ 加 diffusion/flow/AR,那是不同合同。
| prior 家族 | 优点 | 风险 | 公平比较 |
|---|---|---|---|
| fixed isotropic Gaussian | 简单稳定、便于定位 decoder | 与 history-dependent posterior 错配 | 与 learned prior 匹配容量/FLOPs |
| learned diagonal Gaussian | 随历史改变均值/方差 | 仍可能单峰漏 mode | mode event proper score,不只 best-of-$K$ |
| hierarchical conditional | 多尺度容量与依赖 | 高层 under-use、优化困难 | per-level KL 与预算匹配 |
| mixture / flow prior | 更复杂多峰或非 Gaussian | 采样/训练成本、component collapse | 等推理预算与相同 sample 数 |
| categorical prior | 适合离散 belief 或 mechanism | code collapse、straight-through 偏差 | usage/perplexity、unimix/free-bits ablation |
| structured object/particle prior | 对象交互和 birth/death 可解释 | identity、count、occlusion、camera motion | object metric + frame metric + OOD |
“learned prior”只证明参数依赖历史,不证明它覆盖 posterior,更不证明 rollout 频率正确。
| 类型 | 来源 | 单 checkpoint 重采样能否充分测到 | 推荐证据 |
|---|---|---|---|
| aleatoric / future branching | 世界本身随机,或历史不足以唯一决定未来 | 通常是本章 |
多标注/模拟真分布、event frequency、Brier/NLL/coverage |
| partial observability / belief | 隐藏状态未被历史完全观察 | 可由 RSSM posterior/prior 部分表达 | 新观测校正、belief calibration、action-conditioned rollout |
| epistemic / model uncertainty | 数据有限、参数或模型结构不确定 | 单 checkpoint 的 latent sampling 通常不够 | bootstrap/ensemble、训练 seed 方差、Bayesian/OOD stress |
NUQ 用层级变分网络从 latent variance 构造 predictive uncertainty 并加权 MSE [16]。这说明“模型不确定时如何训练”是独立问题,但 latent-space uncertainty 未经事件频率或输出空间 reliability 验证时,不能自动称为 calibrated epistemic uncertainty。
最低报告要求:把同一 checkpoint 内 seed 方差与不同数据重采样/训练 seed/模型成员方差分开。前者主要反映 learned stochasticity,后者才更接近 epistemic component。
posterior collapse 指 decoder 或 deterministic recurrence 能绕过
顺序化文字替代:历史进入 prior,并从 prior 采样部署 latent;历史和真实未来进入训练 posterior,并从 posterior 采样训练/oracle latent。二者各自把样本送入共享 decoder,KL 只负责形成训练对齐损失,并不“生成” latent;历史也可能沿强 AR/确定性旁路直达 decoder。随后联合检查逐层 KL/active units、置零/打乱/重采样
- per-time / per-level KL:总 KL 会掩盖“只有一层在工作”。
- active units/channels:例如 Improved Conditional VRNN 以平均 KL 阈值定义 active channel;阈值必须披露,不能当通用物理常数。
-
decoder sensitivity:固定
$h$ ,zero/shuffle/resample$z$ ,看输出是否改变持续事件而非纹理噪声。 -
prior–posterior rollout gap:相同 decoder 下分别从
$q$ 与$p$ 采样。 -
conditional mutual-information proxy:估计
$I_q(z;y\mid h,c)$ ,检查在固定历史/条件后$z$ 是否仍携带未来信息;普通$I(z;\text{data})$ 可能只证明 latent 编码了历史,非零条件 MI 也仍需语义干预。 - hidden-future leakage test:只改变隐藏未来,部署 prior 输出必须逐 bit/统计不变。
- horizon profile:短期有用不代表长时仍有用。
| 手段 | 代表路线 | 修什么 | 代价/反例 |
|---|---|---|---|
| KL warm-up / cyclical schedule | Improved VRNN | 避免 inference 尚未学会时被 prior 压平 | 后期仍可能 collapse,schedule 也改变预算 |
| free bits / KL floor | DreamerV3 | 阈值以下不继续用 KL 梯度压缩 latent group | 不保证实际 KL 下限;更大 KL 也不等于更有意义 |
| stop-gradient KL balance | DreamerV2/3 [31] | 分开训练 prior 与 representation | 权重改变 rate–distortion,不是标准 ELBO |
| dense hierarchy / richer q,p | Improved VRNN | approximation 与 high-level under-use | 参数/显存/采样成本上升 |
| greedy layerwise training | GHVAE | 层级联合优化与显存瓶颈 | 不是联合 end-to-end optimum |
| structured state→attribute path | G-SWM | 阻断 observation shortcut | 结构假设不适合所有场景 |
| latent overshooting | PlaNet | 多步 prior 对齐 | 额外 rollout 计算,仍会 model exploitation |
| adversarial/diversity objective | SAVP | 锐利度或样本差异 | mode collapse、无意义噪声、多目标难比较 |
停止条件不是“KL 变大”,而是:$z$ 干预产生可解释且持续的事件变化,prior 样本符合历史,覆盖提升没有靠事实错误或噪声换取。
| 首次公开 / 正式状态 | 节点 | 核心变化 | 协议锚点 | 不可越界的结论 |
|---|---|---|---|---|
| 2015 / NeurIPS 2015 | VRNN [2] | 每步 stochastic state | 主要为语音/手写序列 | 是序列前史,不是视频 SOTA |
| 2017 / ICLR 2018 | SV2P [3] | future posterior + fixed prior | 100 samples 按最高 PSNR 选 oracle 样本并报告相应 PSNR/SSIM | 该 oracle 不是 calibration |
| 2018 / ICML 2018 | SVG-LP [4] | per-step learned prior | SM-MNIST/KTH/BAIR | learned prior 仍会漏 mode |
| 2018 / arXiv preprint | SAVP [5] | VAE + prior-sampled GAN | best/avg/worst over 100 | 锐利与人评不等于分布忠实 |
| 2019 / ICCV 2019 | Improved Conditional VRNN [7] | deep latent hierarchy + higher-capacity likelihood | BAIR 2→10 train、2→28 test;$K=100$ | hierarchy 与 capacity 效应缠绕 |
| 2019 / NeurIPS 2019 | Large Stochastic RNN [8] | 少手工 flow/mask、扩大 stochastic RNN | 交互/人体/驾驶三数据域 | scale 是混杂,不是新 uncertainty 语义 |
| 2018 / ICML 2019 | PlaNet [9] | RSSM + latent overshooting | 6 个 64×64 控制任务 | 样本效率/return 不是开放视频质量 |
| 2020 / ICML 2020 | SRVP [10] | fully latent residual dynamics | 每 context 100 futures;FVD 独立生成集 | 一阶 latent update 仍有限 |
| 2020 / CVPR 2020 | S3VAE [11] | static/dynamic self-supervised sequential VAE | SM-MNIST/Sprite/MUG | probe/IS 不证明因果解耦 |
| 2020 / ICML 2020 | G-SWM [12] | object/global stochastic world model | 合成碰撞和 CLEVR-like 场景 | toy object 不能外推自然视频 |
| 2020 / ICLR 2021 | DreamerV2 [31] | categorical RSSM + KL balancing | Atari 55 tasks + continuous-control transfer | discrete state 的里程碑不应误归给 V3 |
| 2021 / CVPR 2021 | GHVAE [13] | greedy modular hierarchy | 4 视频集 + 机器人规划 | 作者任务增益不可跨协议硬排 |
| 2021 / NeurIPS 2021 | CW-VAE [14] | slow-clock latent hierarchy | 最长 1000-frame 受控 rollout | 固定 clock 不是事件理解 |
| 2021 / ICCV 2021 | SLAMP [15] | stochastic appearance/motion + history | KTH/KITTI/Cityscapes | 分支命名不证明解耦 |
| 2021 / ICCV 2021 | NUQ [16] | variational predictive uncertainty | 3 个 final-version benchmark | latent variance 不自动 calibrated |
| 2021 / arXiv | FitVid [17] | 简单大容量 VAE、过拟合审计 | H3.6M/KITTI/RoboNet/BAIR | 不冒充 ICLR 正式接收 |
| 2021 / ICLR 2022 | VPR [18] | event-triggered temporal hierarchy | 主要合成事件数据 | 不外推开放域长视频 |
| 2022 / CLeaR 2022 | VIM [19] | object + categorical mechanism + Gaussian residual | 32×32 Random-Walk toy | 主要结果用 inference network 读当前目标观测,是 posterior-assisted reconstruction,不能当 prior-only deployment 生成证据 |
| 2023 / ICLR 2023 | VP² [20] | 固定 planner 的控制中心 benchmark | 11 类、310 task instances | 是评测里程碑,不是新 VAE |
| 2023 / TMLR 2024 | DDLP [30] | particle tracking posterior + Transformer dynamics prior | object-centric prediction / what-if / compact diffusion | 是 LPWM 的直接粒子前身;仍依赖对象化场景 |
| 2024 / ICML 2024 | RSP [21] | categorical future latent 用于表示学习 | Kinetics-400 预训、单 future frame | 下游表示收益不等于生成校准 |
| 2023 / Nature 2025 | DreamerV3 [22] | categorical RSSM + split KL/free bits/unimix | 150+ 控制任务;5→45 action rollout | return 不是 uncertainty calibration |
| 2026 / ICLR 2026 Oral | LPWM [23] | particles + latent action + variational dynamics | 多个机器人/游戏数据,开放代码/权重 | 对象粒子前沿,不是通用 camera-motion 解法 |
| 2026 / Neural Networks | Implicit hierarchical temporal–spatial residual model [24] | prior–posterior residual + spatial hierarchy | 3 个长预测数据集,作者协议 | 正式延续不等于重回 foundation-model 主干 |
一个重要纠错:Hierarchical Long-term Video Prediction without Supervision 使用高层 feature prediction、feature-space adversarial loss 和 decoder/mask,没有上述 q/p/ELBO 合同 [25]。它仍是层级长预测历史节点,但必须从“分层随机 latent”表中移出。
SV2P 的价值是承认给定同一过去时未来多峰,并让 posterior 在训练解释实际未来;其 fixed
SVG-LP 将
SAVP 为 prior sample 加 video discriminator,尝试同时保留 VAE coverage 与 GAN sharpness。论文还展示远超训练 future=10 的长 rollout;这类质性外推可用于发现失败,不能当作 500-step 定量保证。
Improved Conditional VRNN 在每时刻引入多层 Gaussian prior/posterior、dense latent connections 与高容量 likelihood。作者 BAIR 表中 hierarchical 模型的 FVD/LPIPS 优于 SVG-LP,但 LPIPS/SSIM 是 best-of-100,FVD 是从 100 中随机取样后多次估计;两种 aggregation 回答不同问题,不能合成“全面更好”。
Large Stochastic RNN 去掉部分 flow/mask/foreground-background 手工偏置,以大容量网络检验简单归纳偏置是否足够 [8]。它说明 capacity 是视频预测的重要轴,也提醒后续比较必须匹配参数和训练 FLOPs。
GHVAE 不再强求整套 deep hierarchical VAE 一次装入显存并联合收敛,而是逐层冻结、顺序增加 module。作者报告 17–55% prediction gains 和 35–40% 更高机器人任务成功率;这应写为“作者协议下的扩展证据”,不是跨数据集统一百分比。
SRVP 使用
CW-VAE 让高层按
VPR 不使用固定 clock,而由 latent change detection 触发 renewal,适合事件边界不均匀的序列。它补的是何时更新高层,不是提高开放域像素 fidelity 的直接证据。
S3VAE 将 sequence latent 拆成 static
G-SWM 的关键不是 slot 数,而是让观测 posterior 先产生 high-level stochastic state,再由 state 生成 what/where/presence/depth attributes,从结构上减少 attribute 直接绕过 state。VIM 进一步为对象选择可复用 categorical transition module,并加 Gaussian residual;但论文主要结果在测试时使用 inference network 读当前目标观测,更接近 posterior-assisted reconstruction,不能作为 prior-only deployment generation 的充分证据。DDLP 则用 particle-tracking posterior 对齐跨帧对象,以 Transformer dynamics 作为只看过去粒子的 variational prior;它是 LPWM 的直接对象粒子前身 [30]。这些工作对对象交互的证据强于无结构像素模型,但数据规模、遮挡、对象 birth/death 和相机运动仍限制明显。
FitVid 用简单 fixed-prior convolutional VAE + LSTM 扩大容量,并系统展示常见视频预测集可过拟合或记住训练身份 [17]。H3.6M/KITTI 使用 5→25,RoboNet 2→10 + actions,BAIR 1→16;best-of-100 PSNR/SSIM/LPIPS 与使用全部样本的 FVD 不能互换。它是 benchmark contamination/augmentation 里程碑,不是新 learned-prior 理论。
PlaNet 将 deterministic recurrent state 与 stochastic state 组合,posterior 用新观测校正,prior 按动作想象;latent overshooting 直接约束多步 dynamics。DreamerV2 才是把 categorical/discrete RSSM state 与 KL balancing 推到 Atari 55-task 规模的关键节点 [31];DreamerV3 在此基础上加入 split KL、free bits、1% uniform mixture 和跨域稳定化设计。
这条路线把“视频是否好看”降为中间证据,最终看 reward、continue、policy return 和 model exploitation。Nature 论文展示 5 context frames + actions 后预测 45 frames,但 150+ task return 才是主证据 [22]。因此它应在本章讲变分接口,在 World Models 讲控制效用。
RSP 在 Kinetics-400 上用 32×32 categorical future latent 与 masked-image objective 学表示,作者明确承认生成质量不高、只预测单个 future frame、未扩到大模型/多帧 [21]。这是“随机预测作为 representation learning signal”的复兴,不是高保真视频生成里程碑。
2023 后开放域高保真生成更多采用表示 VAE/VQ + diffusion/flow/AR。这里 VAE 编码已知视频,随机性主要由上层 generator 提供。CVPR 2025 的 Improved Video VAE 即使含 KL,仍是 latent video diffusion 的 tokenizer,而不是 stochastic future posterior [28]。
LPWM 在 2026 重新把显式 stochastic ELBO、对象粒子和 latent action 接到真实机器人/游戏数据:训练 inverse-action posterior 看转移,部署 policy prior 从历史/条件采样,particle posterior 与 dynamics prior 也对齐 [23]。这是严格且重要的新接口;对象数、identity、bounded movement 与开放相机运动仍是边界。
同年 Neural Networks 的 implicit hierarchical temporal–spatial residual model 直接建模 prior–posterior residual 并做 spatial hierarchy [24]。它说明 direct variational long-term prediction 仍在发展;目前证据不足以声称其重新成为通用视频 foundation model 的主 backbone/objective。
设
对可枚举事件
它同时惩罚漏掉真实 mode 和给虚假 mode 过高概率。应再报告 NLL、reliability diagram/ECE、rare-mode recall 与 spurious-mode rate。若真实数据每个历史只有一个未来,无法充分识别条件分布;需要多标注、受控 simulator 或明确承认不可识别边界。
sample-based energy score 可写成
第一项约束准确,第二项奖励有根据的 spread。其 proper-score 保证要求
FVD 也不能单独定义成功。研究已显示 I3D-FVD 存在 content bias,对 frame content 可能比 temporal realism 更敏感 [26];VBench 将生成质量拆成 16 个维度,也说明一个总分会掩盖明显强弱项 [27]。因此至少并列:
- 条件身份、数量、动作前提和已发生事件是否延续;
- mode coverage/precision、事件频率和 calibration;
- sample-average 与 oracle best-of-$K$;
- 对象轨迹、collision/interaction、状态漂移随 horizon;
- FVD、video precision/recall、LPIPS 等视觉指标及生成样本数;
- world model 的 reward/continue、固定 planner return 与 OOD exploitation。
data: snapshot/hash; split unit; repeated-future availability; leakage audit
condition: context frames; action/language/goal; train-only future paths
horizon: train/test context→future; fps; resolution; crop
model: prior/posterior family; latent levels; decoder; forcing; checkpoint hash
sampling: K; temperature; deterministic/stochastic seeds; sampler steps
metrics: single; average; best-of-K; posterior oracle; proper scores; horizon curves
statistics: training seeds; sample seeds; bootstrap unit; CI; multiple comparisons
compute: params; active FLOPs; train FLOPs; wall-clock; hardware; memory
状态:协议草案,尚未运行。下述阈值用于 private test 前预注册,不是论文结果或领域公认标准。
- 64×64;8 context + 24 future。
- 同一 prefix 的 64 个重复未来完全共享前 8 帧;prefix 中有可见 cue
$g\in\lbrace\text{cyan},\text{amber},\text{violet}\rbrace$ ,对应 left/right/stop 真分布分别为$(0.6,0.3,0.1)$ 、$(0.2,0.7,0.1)$、$(0.1,0.2,0.7)$。三种 cue 在 split 内平衡,模型不得读取未来随机数。 - 按初始状态分组切分 10,000 train / 2,000 val / 2,000 test,禁止同一初始参数跨 split。
- 每个 test prefix 由 simulator 生成 64 个真实 futures,并保存 mode、概率、轨迹、identity 和 validity。
- generator、manifest、split 与输出 hash 在训练前冻结;隐藏未来被替换时,部署 prior 输出不得变化。
外部效用 smoke test 使用 VP² RoboDesk 官方数据、任务实例、planner 与公开 SVG′ checkpoint 作锚点 [20]。所有 fork 仍须等预算重训;checkpoint 只用于 pipeline smoke test,不能与新训练分支直接排名。
| Fork | 唯一变化 | 问题 |
|---|---|---|
| A | 无 stochastic latent;容量回填 deterministic residual adapter | deterministic 下界 |
| B | posterior + fixed |
fixed prior 能否覆盖 |
| C | posterior + history/action-conditioned learned prior | 在与 B 都可表达条件分布时,learned prior 是否更易优化到校准分布 |
| D | global |
hierarchy 是否改善长时覆盖 |
| Q | posterior-oracle,量 posterior-assisted 上限与 deployment-prior gap | 禁止当部署结果 |
预算约束:参数 ±1%,单 rollout active FLOPs ±5%,总训练 FLOPs ±2%;同数据顺序、优化步数、增强、decoder、forcing 和 5 training seeds。每个 prefix 固定
- single、sample-average、best-of-64、Q oracle;
- event Brier/NLL/ECE、mode coverage、rare-mode recall、spurious-mode rate;
- prior event distribution 对 simulator truth 的 per-prefix JS(主指标);同一
$h$ 的 64 个真实未来分别经 posterior 后再聚合的 event distribution,与 prior samples 的 JS(次指标);禁止拿单个真实未来的集中 posterior 直接对混合 prior; - per-level KL、active units、$I_q(z;y\mid h,c)$ proxy、zero/shuffle/resample/swap
$z$ 视频与持续事件分类; - 条件违规、identity、轨迹误差、perceptual error 与 horizon 曲线;
- VP² 中同 planner、候选 action 数、rollout 数、wall-clock 的成功率。
- C 相对 B 的 Brier 至少改善 0.02,paired-bootstrap 95% CI 下界 (>0)。
- 概率 0.1 的 rare mode:recall@64 ≥ 0.80;spurious mode ≤ 1%。
- 条件违规相对 A/B 增幅 ≤ 1 个百分点;expected state/perceptual error 劣化 ≤ 3%。
- per-prefix
$\mathrm{JS}(p_{\mathrm{prior}}(m\mid h),p_{\mathrm{sim}}(m\mid h))\le\mathbf{0.05}$ ;聚合 posterior–prior event JS 作为诊断另报,不对单样本 posterior 设混合分布阈值。 - 重采样
$z$ 至少在 30% test histories 中改变持续事件;相同$(h,z)$ 重跑一致率 ≥ 99%。 - D 只有在 horizon-24 coverage 比 C 提高 ≥ 5 个百分点,且质量/违规通过非劣界时,才能写“层级改善长期覆盖”。
- VP² 的“有助规划”声明要求成功率至少 +5 个百分点 且 95% CI 排除 0。
- 收益只存在于 Q 或 best-of-$K$;
-
$z$ 只改变纹理/闪烁,不改变持续事件; - coverage 来自非法或条件冲突 mode;
- 参数/FLOP 匹配后 D 的收益消失;
- learned prior 未改善 fixed prior 的 proper score;
- 控制收益只来自更多 planner rollouts;
- 把同一 checkpoint 的 aleatoric sampling 当成 epistemic uncertainty。
| 症状 | 优先怀疑 | 最小诊断 | 不应立即下的结论 |
|---|---|---|---|
| 所有 seed 几乎相同 | collapse、旁路太强 | per-level KL + intervention + active units | “数据本来确定” |
| posterior 好、prior 差 | prior–posterior gap | Q 与 prior 并排、mode JS、hidden-future test | “decoder 不够大” |
| seed 不同但只抖纹理 |
|
event classifier、时间支持、轨迹 probe | “多样性已解决” |
| 长期越来越随机 | prior 时序相关不足、exposure gap | horizon curves、overshooting ablation | “短片分数高即可长推” |
| 图像锐利但事实漂移 | adversarial/perceptual 补了纹理 | identity/count/state/condition audit | “感知分数高即更准确” |
| object slot 频繁换 ID | assignment/occlusion/birth-death 失败 | tracking ID、count、遮挡恢复 | “对象模型更可解释” |
| return 提升但 calibration 变差 | planner 利用模型偏差 | fixed-budget OOD/model exploitation | “控制成功证明世界模型正确” |
连续两轮在同数据、容量和采样预算下,prior gap、proper score、条件覆盖与 long-horizon state error 都没有改善时,应先检查数据是否真的包含可学习分叉、评测是否能识别 mode、decoder 是否旁路 latent,以及 split 是否泄漏,再决定是否增加 hierarchy/prior complexity。
现代系统接口边界:
- stochastic future
$z$ 表达未知未来;tokenizer latent 表达已知视频。 - diffusion/flow 在 tokenizer latent 上生成,不会把 tokenizer KL 与 score/flow objective 合成一个 posterior。
- RSSM 的变分接口可在本章复用;action/reward/value、planning 和 return 留在 World Models。
- latent action 只有在 inverse posterior 与 deployment policy/generative prior 有变分对齐时,才进入本章的交叉区域;PlaySlot 这类无该合同的方法应留在可控路线 [29]。
- causal/streaming 还需独立验收 cache、commit、latency 与 SLO,见 Causal / Streaming。
- 用第 1 节五问门判断“latent”属于哪一角色。
- 用第 2 节写出训练 posterior 和部署 prior 的可见信息,不先看模型图。
- 用第 3–5 节定位 latent placement、uncertainty type 与 collapse/gap。
- 按第 7 节的问题链读 paper,而不是按 best-of-100 排榜。
- 用第 8 节重建 protocol manifest;协议不同的数字不横排。
- 先跑
Forking-Squares-v1证伪接口,再决定是否进入 VP² 或真实视频。
检索式、首次公开/正式状态、作者协议、近似项排除与教学图生成记录见专项研究轨迹。
[1] Diederik P. Kingma, Max Welling. Auto-Encoding Variational Bayes. ICLR, 2014.
[2] Junyoung Chung et al. A Recurrent Latent Variable Model for Sequential Data. NeurIPS, 2015.
[3] Mohammad Babaeizadeh et al. Stochastic Variational Video Prediction. ICLR, 2018.
[4] Emily Denton, Rob Fergus. Stochastic Video Generation with a Learned Prior. ICML, 2018.(作者名沿正式 PMLR 版本的 published byline。)
[5] Alex X. Lee et al. Stochastic Adversarial Video Prediction. arXiv preprint, 2018.
[6] Junxian He et al. Lagging Inference Networks and Posterior Collapse in Variational Autoencoders. ICLR, 2019.
[7] Lluis Castrejon, Nicolas Ballas, Aaron Courville. Improved Conditional VRNNs for Video Prediction. ICCV, 2019.
[8] Ruben Villegas et al. High Fidelity Video Prediction with Large Stochastic Recurrent Neural Networks. NeurIPS, 2019.
[9] Danijar Hafner et al. Learning Latent Dynamics for Planning from Pixels. ICML, 2019.
[10] Jean-Yves Franceschi et al. Stochastic Latent Residual Video Prediction. ICML, 2020.
[11] Yizhe Zhu et al. S3VAE: Self-Supervised Sequential VAE for Representation Disentanglement and Data Generation. CVPR, 2020.
[12] Zhixuan Lin et al. Improving Generative Imagination in Object-Centric World Models. ICML, 2020.
[13] Bohan Wu et al. Greedy Hierarchical Variational Autoencoders for Large-Scale Video Prediction. CVPR, 2021.
[14] Vaibhav Saxena, Jimmy Ba, Danijar Hafner. Clockwork Variational Autoencoders. NeurIPS, 2021.
[15] Adil Kaan Akan et al. SLAMP: Stochastic Latent Appearance and Motion Prediction. ICCV, 2021.
[16] Moitreya Chatterjee, Narendra Ahuja, Anoop Cherian. A Hierarchical Variational Neural Uncertainty Model for Stochastic Video Prediction. ICCV, 2021.
[17] Mohammad Babaeizadeh et al. FitVid: Overfitting in Pixel-Level Video Prediction. arXiv / CoRR, 2021.
[18] Alexey Zakharov, Qinghai Guo, Zafeirios Fountas. Variational Predictive Routing with Nested Subjective Timescales. ICLR, 2022.
[19] Rim Assouel et al. VIM: Variational Independent Modules for Video Prediction. CLeaR, 2022.
[20] Stephen Tian, Chelsea Finn, Jiajun Wu. A Control-Centric Benchmark for Video Prediction. ICLR, 2023.
[21] Huiwon Jang et al. Visual Representation Learning with Stochastic Frame Prediction. ICML, 2024.
[22] Danijar Hafner et al. Mastering Diverse Control Tasks through World Models. Nature, 2025.
[23] Tal Daniel et al. Latent Particle World Models: Self-supervised Object-centric Stochastic Dynamics Modeling. ICLR Oral, 2026. Official project and code.
[24] Guiqin Wang et al. Implicit Hierarchical Temporal-Spatial Residual Model for Long-Term Video Prediction. Neural Networks 199:108732, 2026.
[25] Nevan Wichers et al. Hierarchical Long-term Video Prediction without Supervision. ICML, 2018.
[26] Songwei Ge et al. On the Content Bias in Fréchet Video Distance. CVPR, 2024.
[27] Ziqi Huang et al. VBench: Comprehensive Benchmark Suite for Video Generative Models. CVPR, 2024.
[28] Jinbo Wu et al. Improved Video VAE for Latent Video Diffusion Model. CVPR, 2025.
[29] Ángel Villar-Corrales, Sven Behnke. PlaySlot: Learning Inverse Latent Dynamics for Controllable Object-Centric Video Prediction and Planning. ICML, 2025.
[30] Tal Daniel, Aviv Tamar. DDLP: Unsupervised Object-Centric Video Prediction with Deep Dynamic Latent Particles. TMLR, 2024. Official project and code.
[31] Danijar Hafner, Timothy Lillicrap, Mohammad Norouzi, Jimmy Ba. Mastering Atari with Discrete World Models. ICLR, 2021.
