FlashMLA:DeepSeek 开源的极致注意力内核库,驱动 V3 系列模型性能飞跃
你是否正在为大模型推理中的注意力计算效率低下而苦恼?传统注意力机制在长序列场景下既消耗大量显存带宽,又难以发挥 GPU 算力。FlashMLA 是 DeepSeek 推出的高效多潜变量注意力(Multi-head Latent Attention)内核库,专门为 DeepSeek-V3 和 DeepSeek-V3.2-Exp 模型打造,同时提供稀疏注意力和密集注意力内核,帮助开发者显著提升 Transformer 模型在训练、推理时的性能。本文将带你全面了解这个来自 DeepSeek 的性能利器。
截至收录:
FlashMLA stars数:12848
FlashMLA forks数:1126
FlashMLA 项目目录截图

FlashMLA 核心亮点
🌟 极致性能:针对 NVIDIA H800 SXM5 GPU,密集 MLA 解码内核在内存受限场景下可达 3000 GB/s 带宽,在计算受限场景下可达 660 TFLOPS;稀疏注意力解码内核可达 410 TFLOPS,稀疏 prefill 内核更高达 640 TFLOPS。
🎯 稀疏注意力支持:原生支持 DeepSeek Sparse Attention(DSA)所需的 token 级稀疏注意力,prefill 和 decoding 阶段均可用,且 decode 阶段支持 FP8 KV Cache,在保证精度的同时大幅节省显存。
🔒 版本兼容与稳定性:新版本内核接口完全兼容旧版,只需升级即可获得 5%~15% 的性能提升,无需修改业务代码,保障生产环境平滑演进。
🧩 多架构适配:不仅支持 NVIDIA SM90/SM100,社区还提供了针对 MetaX、摩尔线程、Hygon DCU、AMD Instinct 等国产及主流 GPU 的移植版本,生态覆盖广泛。
📦 无缝集成 PyTorch:以 Python 包形式提供,API 设计简洁,可在现有 PyTorch 项目中直接调用,无需学习复杂的 CUDA 编程。
FlashMLA 快速开始
只需几个步骤,你就能在本地运行起 FlashMLA:
- 克隆仓库并初始化子模块:
bash
git clone https://github.com/deepseek-ai/FlashMLA.git flash-mla
cd flash-mla
git submodule update --init --recursive - 安装:
bash
pip install -v . - 运行 MLA 解码测试(以稀疏解码为例):
bash
python tests/test_flash_mla_sparse_decoding.py - 查看性能表现:
测试脚本会自动输出吞吐量、TFLOPS 等关键指标。例如,在 H800 SXM5 上,密集解码内核可达到 660 TFLOPS 的计算吞吐。
FlashMLA 应用场景
场景一:大模型推理加速:FlashMLA 作为 DeepSeek-V3 和 V3.2 系列的底层注意力内核,可直接用于各类基于 MLA 架构的模型服务。无论是单次请求的低延迟响应,还是高并发的批量推理,都能有效降低 TTFT(首 token 时延)和单 token 生成时延。
场景二:长上下文稀疏注意力:借助 token 级稀疏注意力内核,模型可以在长上下文场景下只关注关键 token,大幅减少计算量。配合 FP8 KV Cache,还能压缩显存占用,使超长序列的推理在单卡上成为可能。
场景三:训练与预填充(Prefill)阶段加速:提供的稀疏 prefill 内核在 H800 上可达到 640 TFLOPS,在 B200 上更是高达 1450 TFLOPS,显著加速模型预填充阶段,提升训练和首轮响应的效率。
用户案例:FlashMLA 是 DeepSeek-V3 和 DeepSeek-V3.2-Exp 官方模型的基础加速组件;同时,MetaX、摩尔线程、Hygon DCU、Intellifusion、Iluvatar Corex 等多家硬件厂商均基于 FlashMLA 进行了适配移植,使其能在更广泛的计算平台上发挥性能。
FlashMLA 链接
deepseek-ai / FlashMLA项目地址:https://github.com/deepseek-ai/FlashMLA
本文地址:https://www.tgoos.com/45650
