Description
Currently, training with long context lengths increases activation memory significantly, leading to potential CUDA OOM errors. We need to implement activation checkpointing (gradient checkpointing) for our custom attention mechanism.
To-Do
Description
Currently, training with long context lengths increases activation memory significantly, leading to potential CUDA OOM errors. We need to implement activation checkpointing (gradient checkpointing) for our custom attention mechanism.
To-Do
torch.utils.checkpointor custom CUDA backward hooks to recalculate activations during backward propagation.