
长推理与 long-horizon agent 的上下文越来越长,KV cache 随之成为显存瓶颈。
现有压缩方法多用最近若干 post-RoPE query 的注意力分数估计 key 的重要性;但 query 经 RoPE 后随位置旋转,只有最近一小段仍保持当前朝向,可用样本有限,估计精度受限,对 reasoning 影响较明显。
RoPE 旋转(频率带 f,频率 \omega_f=\theta^{-2f/d},\theta=10000,位置 p)
旋转前的 Q/K 称为 pre-RoPE,旋转后为 post-RoPE。

TriAttention(ICML 2026)源于一个实验发现:pre-RoPE 空间中的 Q 与 K 高度集中于固定中心,几乎不随内容与位置变化。
论文标题:TriAttention: Efficient Long Reasoning with Trigonometric KV Compression
原文链接:https://arxiv.org/abs/2604.04921
Github地址:https://github.com/WeianMao/triattention
主页:https://weianmao.github.io/tri-attention-project-page
既然如此,重要性便可用一种近似直接估计:用中心点代表所有 Q 与 K,相当于假设各 token 的 pre-RoPE Q/K 彼此相同;再让这对代表向量走一遍正常的 attention 流程——先加 RoPE,再点乘。
RoPE 注意力 logit 的一般形式(q 在位置 p_q、k 在位置 p_k,距离 \Delta=p_q-p_k)

点乘结果代表了 query 对不同相对位置 key 的偏好,且该过程展开后正好是一个三角函数。
Q/K 中心近似 → 三角级数:pre-RoPE 空间中 Q/K 高度集中于固定中心,近似 q_f\approx\bar{q}_f、k_f\approx\bar{k}_f 后,logit 退化为只依赖距离的三角级数
TriAttention 重要性打分:以 Q 中心 \mathbb{E}[q_f] 代理未来 query,结合范数项并按集中度自适应加权
三角级数分数:
范数分数(集中度 R_f=\|\mathbb{E}[q_f]\|/\mathbb{E}[\|q_f\|],R_f\to 1 表示高度集中):
综合打分并跨未来偏移平均(\mathcal{D}=\{1,2,4,\ldots,2^{16}\},key 可能被任意未来位置查询):
按 \tilde{S}(k) 对缓存中的 key 排序,仅保留 top-B,实现 KV cache 剪枝。
以此打分构建的 KV cache 压缩方法,在长推理与视频生成两类任务上均取得明显收益。
目前 TriAttention 已合入 NVIDIA TensorRT-LLM 官方仓库,并被 NVIDIA 实时长视频生成框架 LongLive 采用:集成进 LongLive 因果推理管线后,local-attention 窗口内 KV 显存削减 50% 且无质量损失。

8月25日(周二)晚8点,青稞Talk 第148期,NVIDIA Research 研究科学家毛伟岸,将直播分享面向长上下文推理的三角级数式 KV Cache 压缩:TriAttention。
青稞介绍
毛伟岸,NVIDIA Research 研究科学家,前 MIT CSAIL 博士后研究员。研究聚焦大模型与生成式基础模型的效率与长上下文生成。已在 ICLR、ICML、CVPR、ICCV、ECCV 等顶级 AI 会议发表 10 篇论文,其中 7 篇为第一作者或共同第一作者,2 篇入选 ICLR Spotlight(接收率约 5%)。近期以共同第一作者完成的 TriAttention(ICML 2026)已合入 NVIDIA TensorRT-LLM 官方仓库,并被 NVIDIA 实时长视频生成框架 LongLive 采用。
主题提纲
TriAttention:面向长上下文推理的三角级数式 KV Cache 压缩
1、长上下文推理中,KV cache 为什么非压缩不可?
2、现有压缩方法介绍与缺陷
3、TriAttention:用三角函数为 KV 重要性打分
4、从长推理到视频生成任务上的实验验证
5、在 TensorRT-LLM、LongLive 上的集成应用
6、未来技术的探索 & AMA (Ask Me Anything)环节
直播时间
8月25日(周二)20:00 - 21:00