应用介绍
在 Mac 上跑本地模型,想让各种工具都能调用,还得找一个兼容 OpenAI 接口的服务。vMLX 是一个自托管的 Apple Silicon 推理服务器,可以运行大语言模型、视觉语言模型和图像生成模型。
它同时兼容 OpenAI、Anthropic 和 Ollama 的 HTTP 接口,支持 KV 缓存压缩与复用、前缀缓存,以及类似 GGUF 的 JANGQ 量化格式,不需要任何第三方 API Key。
多接口兼容:OpenAI、Anthropic、Ollama 风格 API。
多模态:文本、视觉和图像生成模型。
缓存优化:KV 缓存压缩、复用与前缀缓存。
MLX 原生:为 Apple Silicon 优化。
它同时兼容 OpenAI、Anthropic 和 Ollama 的 HTTP 接口,支持 KV 缓存压缩与复用、前缀缓存,以及类似 GGUF 的 JANGQ 量化格式,不需要任何第三方 API Key。
软件功能
多接口兼容:OpenAI、Anthropic、Ollama 风格 API。
多模态:文本、视觉和图像生成模型。
缓存优化:KV 缓存压缩、复用与前缀缓存。
MLX 原生:为 Apple Silicon 优化。


