so why this loss is defined during training but not used during backpropagation?
so why this loss is defined during training but not used during backpropagation?