TriAttention

TriAttention

三角函数KV缓存压缩的长推理加速

AI官网

应用介绍

让推理模型长时间思考,KV 缓存迅速撑爆显存,小显卡根本跑不动。TriAttention 是 MIT、NVIDIA 和浙大的工作,用三角函数方法压缩 KV 缓存,在长推理任务上压缩 10.7 倍、吞吐提升 2.5 倍且不掉精度。

它让 OpenClaw 等应用可以部署在显存有限的本地 GPU 上。

软件功能



KV 压缩:10.7 倍。

吞吐提升:2.5 倍。

无损精度:效果不变。

小显存部署:本地可跑。

应用截图