xiaozhi-esp32

xiaozhi-esp32

AI语音助手

Loading…

应用介绍

#开源硬件 #ESP32 #小智AI #xiaozhi-esp32 #MCP #智能家居 #MIT开源

xiaozhi-esp32 是一个面向 ESP32 系列芯片打造的开源 AI 语音助手项目,可以把一块小小的开发板变成真正“能听、会说、还能控制设备”的 AI 硬件。项目采用 MIT 许可证开源,在 GitHub 已获得约 2.9 万 Stars,仓库覆盖大量开发板与发布变体,对想自己做 AI 音箱、桌面机器人、智能终端的人来说,省掉了不少从零拼语音链路的工作。

自己折腾过语音硬件就知道,唤醒、语音识别、大模型和语音合成分别接起来并不难,难的是让整套东西低延迟、稳定地连续工作。xiaozhi-esp32 已经把这条链路进行了整合,支持 ESP-SR 离线语音唤醒,可以配置自定义唤醒词,音频支持 Opus 编解码与流式传输,同时也能够连接实时端到端语音模型,让 ESP32 不只是“听命令执行”,而是可以进一步做自然的实时语音交互。

软件功能



AI 实时语音交互:围绕 ESP32 构建完整语音交互链路,可以完成语音输入、AI 处理以及语音输出,更适合制作 AI 音箱、语音机器人和桌面助手等硬件。

离线语音唤醒:支持 ESP-SR,在设备本地完成唤醒检测,不需要每次都把唤醒音频发送到服务器,并支持自定义唤醒词

流式音频:支持 Opus 音频编解码与流式传输,减少语音数据的传输压力,也能连接实时端到端语音模型,改善传统“ASR + LLM + TTS”串联方案容易产生的等待感。

MCP 设备控制:项目支持通过 MCP 协议扩展设备能力。ESP32 一侧可以操作扬声器、LED、舵机以及 GPIO 等硬件,进一步把 AI 的回答变成真实设备动作。

连接更多外部能力:通过服务端及 MCP 生态可以继续扩展智能家居、桌面操作、知识搜索、邮件等功能,让语音助手不只是陪聊,还能作为现实设备与网络服务之间的交互入口。

ESP32 多芯片支持:项目适配范围比较广,可覆盖 ESP32 以及 ESP32-C3、C5、C6、S3、P4 等不同系列,方便根据性能、成本以及外设需求选择硬件。

丰富的硬件适配:项目仓库已经包含大量开发板相关目录及不同发布变体,既可以参考现成硬件方案,也方便开发者基于自己的板子进行移植和二次开发。

多种联网方式:除了常见的 Wi-Fi,还可以根据对应硬件方案使用有线以太网、USB RNDIS、4G 模组等方式联网,应用场景不局限于普通无线网络环境。

多语言界面:项目提供丰富的界面语言支持,可用于面向不同地区用户制作 AI 语音硬件。

MIT 开源:代码采用 MIT License 发布,对个人学习、DIY、硬件产品原型以及二次开发都比较友好。以前大家习惯给手机安装一个 AI App,而 xiaozhi-esp32 更像是在给桌上的小盒子直接装上一个 AI“大脑”

应用截图