1.
|
advantages, returns = compute_advantages_and_returns( |
这里reward的维度是(batch_size,),而该计算回报函数内部认为reward的维度是(batch_size, seq_len)。 2.
|
metrics = self.train_step(episode_experiences) |
这里也没用experience_buffer,把整个数据集喂进来的,如果是真实数据显存会爆。另外想问一个eposide直接用整个数据的响应,这个是通常的做法吗?
1.
PipelineLLM/Post_train/rlhf/PPO/ppo_trainer.py
Line 324 in 40278bd
PipelineLLM/Post_train/rlhf/PPO/ppo_trainer.py
Line 417 in 40278bd
PipelineLLM/Post_train/rlhf/PPO/ppo_trainer.py
Line 356 in 40278bd
PipelineLLM/Post_train/rlhf/PPO/ppo_algorithm.py
Line 431 in 40278bd