TurboQuant-GPU

TurboQuant-GPU

大模型推理KV缓存压缩5倍

AI官网

应用介绍

跑长上下文的大模型推理,KV 缓存占满显存,能处理的长度和并发都受限。TurboQuant-GPU 对大模型推理的 KV 缓存实现 5.02 倍压缩,任何 NVIDIA 显卡都能用。

它用随机正交旋转等方法做量化,提供 cuTile 内核和自动的 PyTorch 回退,可通过 PyPI 安装。

软件功能



5 倍压缩:KV 缓存大幅缩小。

通用显卡:支持任意 NVIDIA GPU。

自动回退:PyTorch 兼容实现。

PyPI:pip 安装。