AirLLM

AirLLM

4GB显卡跑70B大模型

AI官网

应用介绍

想在本地跑 70B 参数的大模型,却只有一张 4GB 显存的显卡。AirLLM 让单张 4GB 显卡也能推理 70B 大模型,无需量化、蒸馏或剪枝。

它逐层加载模型进行推理,大幅降低显存占用,支持 Llama、Qwen 等主流模型,也能在 Mac 上运行。

软件功能



低显存:4GB 跑 70B。

逐层推理:分层加载。

无需量化:保留精度。

多模型:Llama 与 Qwen。

应用截图