Flash-MoE

Flash-MoE

笔记本上跑3970亿参数大模型

AI官网

应用介绍

想在本地跑几千亿参数的大模型,通常得配一堆显卡。Flash-MoE 是一个纯 C 和 Metal 写的推理引擎,在 48GB 内存的 MacBook Pro 上跑起了 3970 亿参数的 Qwen3.5-397B-A17B,每秒 4.4 个 token 以上,还支持工具调用。

209GB 的模型文件直接从 SSD 流式读入,经过定制的 Metal 计算管线执行,没有 Python 也不依赖框架;作者还附了一篇记录 90 多次实验的论文。

软件功能



超大模型:在笔记本上运行 397B 参数的 MoE 模型。

SSD 流式加载:按需从磁盘读取专家权重。

纯 C/Metal:无 Python、无框架依赖。

工具调用:输出质量可用于实际任务。

应用截图