https://github.com/taco-group/SparkVSR/blob/a082284b80005bb5615c0f5f5f5ed66650b1b1e7/finetune/models/SparkVSR/sparkvsr_s1_ref_trainer.py#L272 我理解CogVideoX1.5-5B-I2V的VAE是将4N+1视频帧编码为N+1个latent,其中首帧单独编码,后面每4个视频帧对应一个latent。那么在_prepare_ref_latent_i2v函数中,target_idx对应的应该是(vid_idx+3)// 4,而非target_idx = vid_idx // 4。我的理解是否正确?
SparkVSR/finetune/models/SparkVSR/sparkvsr_s1_ref_trainer.py
Line 272 in a082284
我理解CogVideoX1.5-5B-I2V的VAE是将4N+1视频帧编码为N+1个latent,其中首帧单独编码,后面每4个视频帧对应一个latent。那么在_prepare_ref_latent_i2v函数中,target_idx对应的应该是(vid_idx+3)// 4,而非target_idx = vid_idx // 4。我的理解是否正确?