1. 首页
  2. 青稞Talk
  3. 直播预告!和 NVIDIA Research 研究科学家毛伟岸,聊聊 TriAttention:面向长上下文推理的三角级数式 KV Cache 压缩

直播预告!和 NVIDIA Research 研究科学家毛伟岸,聊聊 TriAttention:面向长上下文推理的三角级数式 KV Cache 压缩

  • 发布于 2026-08-20
  • ·
  • 2 次阅读
  • ·
  • ·
即将开始

相关资源

演示文稿 (PPT)

直播配套幻灯片

暂未提供

长推理与 long-horizon agent 的上下文越来越长,KV cache 随之成为显存瓶颈。

现有压缩方法多用最近若干 post-RoPE query 的注意力分数估计 key 的重要性;但 query 经 RoPE 后随位置旋转,只有最近一小段仍保持当前朝向,可用样本有限,估计精度受限,对 reasoning 影响较明显。

RoPE 旋转(频率带 f,频率 \omega_f=\theta^{-2f/d}\theta=10000,位置 p

\begin{pmatrix}x'_{2f}\\ x'_{2f+1}\end{pmatrix}=\begin{pmatrix}\cos(\omega_f p) & -\sin(\omega_f p)\\ \sin(\omega_f p) & \cos(\omega_f p)\end{pmatrix}\begin{pmatrix}x_{2f}\\ x_{2f+1}\end{pmatrix}

旋转前的 Q/K 称为 pre-RoPE,旋转后为 post-RoPE。

TriAttention(ICML 2026)源于一个实验发现:pre-RoPE 空间中的 Q 与 K 高度集中于固定中心,几乎不随内容与位置变化。

论文标题:TriAttention: Efficient Long Reasoning with Trigonometric KV Compression
原文链接:https://arxiv.org/abs/2604.04921
Github地址:https://github.com/WeianMao/triattention
主页:https://weianmao.github.io/tri-attention-project-page

既然如此,重要性便可用一种近似直接估计:用中心点代表所有 Q 与 K,相当于假设各 token 的 pre-RoPE Q/K 彼此相同;再让这对代表向量走一遍正常的 attention 流程——先加 RoPE,再点乘。

RoPE 注意力 logit 的一般形式q 在位置 p_qk 在位置 p_k,距离 \Delta=p_q-p_k

\text{logit}(q,k)=\sum_{f}\|q_f\|\,\|k_f\|\cos(\omega_f\Delta+\phi_f),\qquad \phi_f=\arg(q_f)-\arg(k_f)

点乘结果代表了 query 对不同相对位置 key 的偏好,且该过程展开后正好是一个三角函数。

Q/K 中心近似 → 三角级数:pre-RoPE 空间中 Q/K 高度集中于固定中心,近似 q_f\approx\bar{q}_fk_f\approx\bar{k}_f 后,logit 退化为只依赖距离的三角级数

\text{logit}(\Delta)\approx\sum_{f}\underbrace{\|\bar{q}_f\|\,\|\bar{k}_f\|}_{\text{振幅}}\cos(\omega_f\Delta+\underbrace{\bar{\phi}_f}_{\text{相位}})=\sum_{f}\left[a_f\cos(\omega_f\Delta)+b_f\sin(\omega_f\Delta)\right]

TriAttention 重要性打分:以 Q 中心 \mathbb{E}[q_f] 代理未来 query,结合范数项并按集中度自适应加权

三角级数分数:

S_{\text{trig}}(k,\Delta)=\sum_{f}\|\mathbb{E}[q_f]\|\cdot\|k_f\|\cdot\cos(\omega_f\Delta+\phi_f)

范数分数(集中度 R_f=\|\mathbb{E}[q_f]\|/\mathbb{E}[\|q_f\|]R_f\to 1 表示高度集中):

S_{\text{norm}}(k)=\sum_{f}(1-R_f)\cdot\mathbb{E}[\|q_f\|]\cdot\|k_f\|

综合打分并跨未来偏移平均(\mathcal{D}=\{1,2,4,\ldots,2^{16}\},key 可能被任意未来位置查询):

S(k,\Delta)=S_{\text{trig}}(k,\Delta)+S_{\text{norm}}(k),\qquad \tilde{S}(k)=\frac{1}{|\mathcal{D}|}\sum_{\delta\in\mathcal{D}}S(k,\Delta+\delta)

\tilde{S}(k) 对缓存中的 key 排序,仅保留 top-B,实现 KV cache 剪枝。

以此打分构建的 KV cache 压缩方法,在长推理与视频生成两类任务上均取得明显收益。

目前 TriAttention 已合入 NVIDIA TensorRT-LLM 官方仓库,并被 NVIDIA 实时长视频生成框架 LongLive 采用:集成进 LongLive 因果推理管线后,local-attention 窗口内 KV 显存削减 50% 且无质量损失。

20260825小.png

8月25日(周二)晚8点​,青稞Talk 第148期,NVIDIA Research 研究科学家毛伟岸,将直播分享面向长上下文推理的三角级数式 KV Cache 压缩:TriAttention。

青稞介绍

毛伟岸,NVIDIA Research 研究科学家,前 MIT CSAIL 博士后研究员。研究聚焦大模型与生成式基础模型的效率与长上下文生成。已在 ICLR、ICML、CVPR、ICCV、ECCV 等顶级 AI 会议发表 10 篇论文,其中 7 篇为第一作者或共同第一作者,2 篇入选 ICLR Spotlight(接收率约 5%)。近期以共同第一作者完成的 TriAttention(ICML 2026)已合入 NVIDIA TensorRT-LLM 官方仓库,并被 NVIDIA 实时长视频生成框架 LongLive 采用。

主题提纲

TriAttention:面向长上下文推理的三角级数式 KV Cache 压缩

1、长上下文推理中,KV cache 为什么非压缩不可?
2、现有压缩方法介绍与缺陷
3、TriAttention:用三角函数为 KV 重要性打分
4、从长推理到视频生成任务上的实验验证
5、在 TensorRT-LLM、LongLive 上的集成应用
6、未来技术的探索 & AMA (Ask Me Anything)环节

直播时间

8月25日(周二)20:00 - 21:00

目录