应用介绍
万亿参数的大模型一般要一整机柜显卡才能跑,普通人只能调 API。kimi-k3-in-c 用可移植的 C99 写了一个推理引擎,在单个 CPU、峰值 8.24GB 内存下运行 2.78 万亿参数的 Kimi K3,没有 BLAS、没有框架、也不需要 GPU。
整个引擎只有 176KB,模型检查点在磁盘上按需读取;内存越大速度越快,普通 8GB 笔记本也能得到同样的答案,只是每个 token 慢一些。
极低内存:峰值 8.24GB 运行万亿级 MoE 模型。
零依赖:纯 C99,无 BLAS、框架和 GPU。
磁盘流式:1.56TB 检查点按需加载。
可移植:任何机器都能得出同样结果。
整个引擎只有 176KB,模型检查点在磁盘上按需读取;内存越大速度越快,普通 8GB 笔记本也能得到同样的答案,只是每个 token 慢一些。
软件功能
极低内存:峰值 8.24GB 运行万亿级 MoE 模型。
零依赖:纯 C99,无 BLAS、框架和 GPU。
磁盘流式:1.56TB 检查点按需加载。
可移植:任何机器都能得出同样结果。

