开源|Random Attention:随机采样KV缓存淘汰,让大模型推理更高效
thinkindev • 2026-09-07
1488 views
Salesforce AI Research 发布了 Random Attention 代码仓库,对应论文《Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning》。在大语言模型推理中,KV缓存占用大量显存,现有方法通常依赖学习到的重要性信号或注意力统计来决定哪些缓存条目可被淘汰。该研究反其道而行,提出直接对已生成的KV缓存条目进行均匀随机采样保留,不引入额外的重要性评估。结果显示,在多个推理基准和模型家族上,这种简单随机策略能够匹配甚至超越更复杂的淘汰方法,同时显著降低淘汰开销。这一发现对大模型长序列推理和资源受限部署具有启发意义,提示在缓存淘汰设计中,简单随机基线不可忽视。
核心要点
- Random Attention 采用均匀随机采样保留KV缓存子集,摆脱对重要性信号和注意力统计的依赖。
- 在多个推理基准与模型家族上,随机策略匹配或超越复杂淘汰方法。
- 该方法降低淘汰开销,为大模型高效推理提供简单有效新思路。