vMLX

vMLX

Apple Silicon上的MLX推理服务器

AI官网

应用介绍

在 Mac 上跑本地模型,想让各种工具都能调用,还得找一个兼容 OpenAI 接口的服务。vMLX 是一个自托管的 Apple Silicon 推理服务器,可以运行大语言模型、视觉语言模型和图像生成模型。

它同时兼容 OpenAI、Anthropic 和 Ollama 的 HTTP 接口,支持 KV 缓存压缩与复用、前缀缓存,以及类似 GGUF 的 JANGQ 量化格式,不需要任何第三方 API Key。

软件功能



多接口兼容:OpenAI、Anthropic、Ollama 风格 API。

多模态:文本、视觉和图像生成模型。

缓存优化:KV 缓存压缩、复用与前缀缓存。

MLX 原生:为 Apple Silicon 优化。