应用介绍
让推理模型长时间思考,KV 缓存迅速撑爆显存,小显卡根本跑不动。TriAttention 是 MIT、NVIDIA 和浙大的工作,用三角函数方法压缩 KV 缓存,在长推理任务上压缩 10.7 倍、吞吐提升 2.5 倍且不掉精度。
它让 OpenClaw 等应用可以部署在显存有限的本地 GPU 上。
KV 压缩:10.7 倍。
吞吐提升:2.5 倍。
无损精度:效果不变。
小显存部署:本地可跑。
它让 OpenClaw 等应用可以部署在显存有限的本地 GPU 上。
软件功能
KV 压缩:10.7 倍。
吞吐提升:2.5 倍。
无损精度:效果不变。
小显存部署:本地可跑。

