绿软下载
软件
工具
标签
博客
价格
Switch language
Toggle theme
开始使用
搜索
TurboQuant-GPU
大模型推理KV缓存压缩5倍
2026/9/28
AI
官网
免费下载
应用介绍
跑长上下文的大模型推理,KV 缓存占满显存,能处理的长度和并发都受限。TurboQuant-GPU 对大模型推理的
KV 缓存实现 5.02 倍压缩
,任何 NVIDIA 显卡都能用。
它用随机正交旋转等方法做量化,提供 cuTile 内核和自动的 PyTorch 回退,可通过 PyPI 安装。
软件功能
5 倍压缩:
KV 缓存大幅缩小。
通用显卡:
支持任意 NVIDIA GPU。
自动回退:
PyTorch 兼容实现。
PyPI:
pip 安装。
应用截图
点击查看原图
点击查看原图
标签:
大语言模型
相关推荐
PersonaLive
ReconViaGen
daVinci-LLM
ASI-Evolve
miniclawd
AgenticSeek
FluxVLA Engine
RoboOS