为什么optimizer在每个batch之后不需要把梯度清零,并且可以得到正确结果 我写了个类似的代码,但是不加optimizer.zero_gard()会导致正确率越训越低直到10%
为什么optimizer在每个batch之后不需要把梯度清零,并且可以得到正确结果
我写了个类似的代码,但是不加optimizer.zero_gard()会导致正确率越训越低直到10%