感谢团队开源这个极具启发性的工作!阅读论文后,我有一个关于如何将该能力扩展到回环检测(Loop Closure,即相机轨迹绕回原点)的问题。传统 SLAM 通常把回环检测当作一个纯数学的后端“图优化”任务,这意味着几何一致性本身是可以通过轨迹和观测联合求解的。
在 Fantasy World 的双分支架构下,Wan2.1 的前 16 层潜空间已经保留了很好的空间位置关系,且本模型已经能预测出隐式的 3D 几何场(深度、点云)。在SFT训练充分的现有模型基础上,我们能否尽量避免引入全新的沉重训练模块比如为回环检测单独设置一个分支,而是通过在推理时动态操控 Attention 引导,配合少量回环数据微调或者完全自监督的方式做RL来实现相机轨迹绕回原点的一致性?
具体的设想思路如下:
历史特征的 3D 引导:利用解算出的相对位姿,将历史帧 $y$ 的特征对齐/重投影到当前帧 $x$ 的视角下。
对任意x,y大于等于0小于等于81,相机轨迹中几何解算x帧 $Pose_x$ 与y帧 $Pose_y$ 之间的位姿变换(旋转和平移的复合)。然后把解算后对齐的历史特征互相引导,也就是每个step的过程中x帧上有一个从0到81的y帧和x帧的相对位置关系的attention层的积分以一个可调整的参数g(x,y)强度直接叠加或注入到x帧的 Attention 层中作为强引导(Guidance)。这个可调整的参数g(x,y)和x帧 $Pose_x$ 与y帧 $Pose_y$ 之间的位姿变换有关,如果位姿变换距离I越近这个强度越高。 ————————————————(*)
Attention 层注入:在降噪的 step 过程中,将对齐后的历史特征(可以是整个 0 到 81 帧中相关性较高的特征聚合)直接叠加或注入到帧 $x$ 的 Attention 层中作为强引导(Guidance)。
这种 Attention 操控的做法,本身逻辑上类似于 Wan2.1 的免训练编辑工作:Awesome-Training-Free-WAN2.1-Editing。
感谢团队开源这个极具启发性的工作!阅读论文后,我有一个关于如何将该能力扩展到回环检测(Loop Closure,即相机轨迹绕回原点)的问题。传统 SLAM 通常把回环检测当作一个纯数学的后端“图优化”任务,这意味着几何一致性本身是可以通过轨迹和观测联合求解的。
在 Fantasy World 的双分支架构下,Wan2.1 的前 16 层潜空间已经保留了很好的空间位置关系,且本模型已经能预测出隐式的 3D 几何场(深度、点云)。在SFT训练充分的现有模型基础上,我们能否尽量避免引入全新的沉重训练模块比如为回环检测单独设置一个分支,而是通过在推理时动态操控 Attention 引导,配合少量回环数据微调或者完全自监督的方式做RL来实现相机轨迹绕回原点的一致性?
具体的设想思路如下:
历史特征的 3D 引导:利用解算出的相对位姿,将历史帧$y$ 的特征对齐/重投影到当前帧 $x$ 的视角下。$Pose_x$ 与y帧 $Pose_y$ 之间的位姿变换(旋转和平移的复合)。然后把解算后对齐的历史特征互相引导,也就是每个step的过程中x帧上有一个从0到81的y帧和x帧的相对位置关系的attention层的积分以一个可调整的参数g(x,y)强度直接叠加或注入到x帧的 Attention 层中作为强引导(Guidance)。这个可调整的参数g(x,y)和x帧 $Pose_x$ 与y帧 $Pose_y$ 之间的位姿变换有关,如果位姿变换距离I越近这个强度越高。 ————————————————(*)
对任意x,y大于等于0小于等于81,相机轨迹中几何解算x帧
Attention 层注入:在降噪的 step 过程中,将对齐后的历史特征(可以是整个 0 到 81 帧中相关性较高的特征聚合)直接叠加或注入到帧$x$ 的 Attention 层中作为强引导(Guidance)。
这种 Attention 操控的做法,本身逻辑上类似于 Wan2.1 的免训练编辑工作:Awesome-Training-Free-WAN2.1-Editing。