Skip to content

问题 #1

Description

@xiaoxiaohe233

首先感谢你们的这份工作,具有很大的启发价值,你们的方法在论文中的评估结果特别好!

我在推理时遇到了关于参数设置的问题,想要请教一下:
我在复现的时候按照仓库给出的默认推理参数,发现无法还原出相对于deepforcing的性能提升.而且代码和论文中给出的参数不太一样?请问论文中的评估结果是按照仓库配置得到的吗?sink size在不同head下好像也是不同的,中间的key的动态rope方式也是不一样的?似乎在第一个块生成的时候三帧的rope就已经重新统一映射到了训练最远时间,而不是连续的,该怎么理解?

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions