FlashAttention – optimizing GPU memory for more scalable transformers(paepper.com)
paepper.com
FlashAttention – optimizing GPU memory for more scalable transformers
https://www.paepper.com/blog/posts/flash-attention-optimizing-gpu-memory-for-more-scalable-transformers/
0 comments
—