应用介绍
一块显卡要服务好几个模型,每次切换都要等模型从硬盘慢慢加载,首个 Token 迟迟出不来。flashtensors 是一个极速的推理引擎,把模型从 SSD 加载到显存快 10 倍。
它能在单张 GPU 上热切换上百个大模型,对首 Token 延迟影响极小,基于 ServerlessLLM 的代码。
极速加载:快 10 倍。
热切换:上百个模型。
低延迟:首 Token 快。
单卡:节省显卡。
它能在单张 GPU 上热切换上百个大模型,对首 Token 延迟影响极小,基于 ServerlessLLM 的代码。
软件功能
极速加载:快 10 倍。
热切换:上百个模型。
低延迟:首 Token 快。
单卡:节省显卡。

