应用介绍
想在本地跑 70B 参数的大模型,却只有一张 4GB 显存的显卡。AirLLM 让单张 4GB 显卡也能推理 70B 大模型,无需量化、蒸馏或剪枝。
它逐层加载模型进行推理,大幅降低显存占用,支持 Llama、Qwen 等主流模型,也能在 Mac 上运行。
低显存:4GB 跑 70B。
逐层推理:分层加载。
无需量化:保留精度。
多模型:Llama 与 Qwen。
它逐层加载模型进行推理,大幅降低显存占用,支持 Llama、Qwen 等主流模型,也能在 Mac 上运行。
软件功能
低显存:4GB 跑 70B。
逐层推理:分层加载。
无需量化:保留精度。
多模型:Llama 与 Qwen。

