flashtensors

flashtensors

单卡热切换上百个大模型

AI官网

应用介绍

一块显卡要服务好几个模型,每次切换都要等模型从硬盘慢慢加载,首个 Token 迟迟出不来。flashtensors 是一个极速的推理引擎,把模型从 SSD 加载到显存快 10 倍。

它能在单张 GPU 上热切换上百个大模型,对首 Token 延迟影响极小,基于 ServerlessLLM 的代码。

软件功能



极速加载:快 10 倍。

热切换:上百个模型。

低延迟:首 Token 快。

单卡:节省显卡。

应用截图