资讯动态

MLA + CSA 各场景表现对比

发布时间:2026/8/11 22:17:58 来源:尧图企业网站定制
MLA CSA 各场景表现对比基础回顾MLA特征维度压缩每个token内部把K/V压缩成latent解决KV‑Cache显存序列长度S不变。CSA序列维度块压缩多个token合并成1条entry把序列S变短工作在MLA输出之后二者叠加。HCA是CSA的激进版本block128下文一并纳入CSA体系V3.2 DSA是token粒度稀疏拿来对照。场景纯MLA(V2/V3)MLADSA(V3.2)MLACSA(V4)核心原因短上下文 ≤8K⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐短序列CSA做块压缩带来轻微信息损失压缩收益几乎没有还多compressor计算中等上下文 8K‑64K⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐DSA token‑level topk足够好用CSA块压缩有微小损失但吞吐更高超长上下文 64K‑1M❌显存爆炸OOM⚠️索引开销爆炸⭐⭐⭐⭐⭐DSA要对百万token做索引打分索引本身FLOPs、显存很高CSA先压缩成entry在小块上做索引开销可控Prefill预填充中等FLOPs高FLOPs(indexer)中高FLOPs(compressor)DSA prefill要跑完整Lightning Indexer遍历全部tokenCSA要跑块压缩纯MLA最轻量Decode解码吞吐良好较好最优Decode阶段MQA‑MLA CSA大幅减少参与注意力的KV条目数量访存大幅下降局部细节任务代码、填空、nearby检索⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐CSA保留SWA滑动窗口最近128token不压缩局部质量几乎无损远距离靠压缩entry超长距离检索百万字找跨万字线索很差差⭐⭐⭐⭐CSA/HCA把远距离token压缩为entry注意力可以低成本覆盖极远位置纯MLA/DSA受限于显存无法完整加载全部KV硬件GPU/GPGPU支持动态shape很好较好较好动态shape友好CSA的分块压缩可以做kernel融合硬件静态数据流AI芯片如鲲云RainBuilder较好差很差CSA输出entry数量动态变化静态编译必须padding引入大量无效计算浪费算力分场景详细拆解1短上下文场景≤8k日常对话、代码补全纯MLA最优不需要任何序列压缩没有信息损失没有额外compressor/indexer开销。MLADSAindexer带来少量额外计算收益很小。MLACSA4:1块压缩虽然有SWA窗口保护局部但压缩矩阵会引入微小精度损耗压缩收益几乎没有反而多做compressor gemm。V4推理可以做开关短上下文自动关闭CSA退化成纯MQA‑MLA。2中等上下文 8K‑64K文档问答、长文档摘要V3.2 MLADSA表现最好token数量还没到百万Lightning Indexer遍历全部token开销可控直接在原始token上做top‑k没有块压缩信息损失。CSA有轻微压缩损失但吞吐更高质量略低于DSA速度占优。3超长上下文 64K‑1M百万书籍、长日志、大文档库纯MLAKV‑Cache巨大直接OOM。MLADSADSA需要对全部原始token做indexer打分S1Mindexer QK打分是O(S2)O(S^2)O(S2)索引本身开销爆炸速度暴跌。MLACSA/HCA是唯一可行方案先4:1/128:1压缩序列直接缩小几倍~上百倍索引操作运行在压缩后的少量entry上把索引开销压下来。代价远距离信息存在压缩带来的微小精度损失靠增大head_dim(V4提升到512)做补偿。4Prefill预填充 vs Decode解码Prefill纯MLA开销最低只有MLA本身latent升降维。DSA每个token跑indexer QK/KV额外开销大。CSA每个块跑compressor有额外gemmprefill阶段速度慢于纯MLA。Decode自回归生成访存瓶颈MLACSA收益最大参与注意力计算的KV条目数量大幅下降访存压力下降吞吐显著提升。工程上超长场景下prefill慢一点换decode巨大收益整体收益为正。5任务类型差异局部任务代码、填空、就近事实查询CSA依靠SWA滑动窗口最近128token不压缩局部质量几乎无损只有超过窗口的远距离token才会被压缩。超远距离检索需要召回相隔几万token的细节DSA百万token下索引开销爆炸跑不动。CSAHCA把大量远距离token压缩为entry可以低成本访问超长距离但细粒度微小细节会丢失适合抓全局逻辑不适合精准抠远距离细粒度token。6硬件编译器视角你在RainBuilder做算子部署重点纯MLAshape基本固定仅latent升降维gemm数据流架构友好只有GQA/MQA的广播逻辑。MLADSA输出mask张量shape不变但indexer输出top‑k索引是动态需要动态mask。MLACSA动态shape最重输入序列长度变化压缩后的entry数量动态改变。GPU动态shape原生支持kernel可以做融合性能可接受。静态数据流芯片鲲云代价很高静态编译需要padding到最大可能entry数量大量无效计算硬件利用率掉下去。实际部署策略短序列关闭CSA长序列才打开CSA。工程部署策略生产上怎么选context ≤8k关闭CSA/DSA只用MQA‑MLA。8k context ≤64k优先DSA(V3.2)V4上可以关闭HCA轻量CSA。context64k尤其是128k必须打开CSAHCA否则显存/速度不可接受。面试高频问题为什么V4不用DSA改用CSADSA在百万上下文indexer要遍历全部原始token索引本身开销爆炸CSA先做块压缩索引跑在压缩后的少量entry上把索引开销压下去代价是块压缩带来微小信息损失。CSA有没有短板块压缩会丢失部分细粒度信息对距离很远、需要精准定位单个token的任务会掉点依赖滑动窗口保护局部细节对静态编译器不友好。MLA、CSA分别解决什么瓶颈MLA每个token内部特征维度压缩降低单tokenKV存储大小CSA序列维度把多个token合并减少参与注意力的KV条目总数降低注意力计算与访存。二者解决的是两个不同维度的瓶颈。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价