请问作者,按照官方设置per_device_train_batch_size为16,显存显然不够。我把batch size改为2,梯度累加设为4,分别率改为262144,sft得到的模型性能和论文相比还是有不小的差距(pretrain 模型是用你提供的)。请问您论文中最佳结果是用什么配置参数训练的,train loss最终能降到多少?
请问作者,按照官方设置per_device_train_batch_size为16,显存显然不够。我把batch size改为2,梯度累加设为4,分别率改为262144,sft得到的模型性能和论文相比还是有不小的差距(pretrain 模型是用你提供的)。请问您论文中最佳结果是用什么配置参数训练的,train loss最终能降到多少?