应用介绍
想在本地跑几千亿参数的大模型,通常得配一堆显卡。Flash-MoE 是一个纯 C 和 Metal 写的推理引擎,在 48GB 内存的 MacBook Pro 上跑起了 3970 亿参数的 Qwen3.5-397B-A17B,每秒 4.4 个 token 以上,还支持工具调用。
209GB 的模型文件直接从 SSD 流式读入,经过定制的 Metal 计算管线执行,没有 Python 也不依赖框架;作者还附了一篇记录 90 多次实验的论文。
超大模型:在笔记本上运行 397B 参数的 MoE 模型。
SSD 流式加载:按需从磁盘读取专家权重。
纯 C/Metal:无 Python、无框架依赖。
工具调用:输出质量可用于实际任务。
209GB 的模型文件直接从 SSD 流式读入,经过定制的 Metal 计算管线执行,没有 Python 也不依赖框架;作者还附了一篇记录 90 多次实验的论文。
软件功能
超大模型:在笔记本上运行 397B 参数的 MoE 模型。
SSD 流式加载:按需从磁盘读取专家权重。
纯 C/Metal:无 Python、无框架依赖。
工具调用:输出质量可用于实际任务。
应用截图
标签:本地模型

