首先感谢你们的这份工作,具有很大的启发价值,你们的方法在论文中的评估结果特别好!
我在推理时遇到了关于参数设置的问题,想要请教一下:
我在复现的时候按照仓库给出的默认推理参数,发现无法还原出相对于deepforcing的性能提升.而且代码和论文中给出的参数不太一样?请问论文中的评估结果是按照仓库配置得到的吗?sink size在不同head下好像也是不同的,中间的key的动态rope方式也是不一样的?似乎在第一个块生成的时候三帧的rope就已经重新统一映射到了训练最远时间,而不是连续的,该怎么理解?
我在推理时遇到了关于参数设置的问题,想要请教一下:
我在复现的时候按照仓库给出的默认推理参数,发现无法还原出相对于deepforcing的性能提升.而且代码和论文中给出的参数不太一样?请问论文中的评估结果是按照仓库配置得到的吗?sink size在不同head下好像也是不同的,中间的key的动态rope方式也是不一样的?似乎在第一个块生成的时候三帧的rope就已经重新统一映射到了训练最远时间,而不是连续的,该怎么理解?