flash-attention

通过 IO感知 tiling 算法,将 Transformer 注意力计算提速 2-4 倍、内存占用降低 N 倍,成为 PyTorch/HuggingFace/DeepSpeed 事实标准的底层加速库

Stars24.9k
Forks3.1k
主语言Python
分类模型与框架
作者Dao-AILab
LicenseBSD-3-Clause

加载项目详情…