
小智ESP32 AI语音助手从裸板到喊一声你好小智的完整路径【免费下载链接】xiaozhi-esp32An MCP-based chatbot | 一个基于MCP的聊天机器人项目地址: https://gitcode.com/GitHub_Trending/xia/xiaozhi-esp32半夜想起来要关灯但你正端着一锅汤懒得放下锅去戳手机——这类手不方便但嘴方便的时刻正是 ESP32 AI 语音助手存在的意义。小智xiaozhi-esp32是一个跑在 ESP32 芯片上的开源 AI 语音聊天机器人固件离线唤醒、大模型对话、MCP 协议设备控制一体。这篇文章带你从编译烧录走到原理拆解最后给你几条进阶路子。先报几个数让你对规模有感觉维度现状芯片平台ESP32 / C3 / C5 / C6 / S3 / P4 / S31 全系板级适配138 个板级目录、171 个发布变体联网方式Wi-Fi、有线网口、USB RNDIS、ML307/EC801E/NT26 4GCat.1语言38 种界面语言语音提示部分语言可用协议设备端 MCP 控制 云端 MCP 扩展 第一次点亮20分钟烧录固件1. 备齐环境你只需要四样东西ESP-IDF v6.0.2官方推荐v5.5 仅留给老板子、CMake 3.16、Ninja、Python 3.8。装好后跑一下版本检查idf.py --version它能打印出版本号说明工具链就绪。提示Linux 下编译比 Windows 快驱动坑也少有条件就用 Linux。2. 拉源码git clone https://gitcode.com/GitHub_Trending/xia/xiaozhi-esp32 cd xiaozhi-esp32这一条命令把整个固件仓库拉到本地。3. 选板子、编译idf.py set-target esp32s3 idf.py menuconfigset-target声明你用的芯片menuconfig打开图形化配置菜单——在里面找到 XiaoZhi 的板型选项选你手里那块板每个芯片默认值不同比如 S3 默认是 bread-compact-wifi保存退出后执行idf.py build这条命令会下载依赖并产出固件首次编译大约 10~15 分钟取决于机器。4. 烧录并观察首次对话idf.py -p /dev/ttyUSB0 flash monitorLinux 上一般就是/dev/ttyUSBxWindows 则是COMx按实际情况改。烧完打开串口监视器预期看到三段日志Wi-Fi 关联成功 → 与服务器建立连接 → 提示可以唤醒。此时对着麦克风说你好小智几秒内应该听到回答。注意设备只支持 2.4GHz Wi-Fi5GHz 网络再强的信号也连不上这是最常见的第一次失败。⚙️ 它到底怎么工作三个环节说清把小智拆开看就是一段唤醒—上云—回传的流水线外加一个让它能动手的 MCP 通道。环节一离线唤醒。麦克风的声音先过音频 Codec变成 16kHz 单声道 PCM。唤醒检测WakeNet 模型来自乐鑫的 ESP-SR 语音框架完全跑在芯片里不联网也能被喊醒——这就是所谓离线唤醒。环节二上云对话。唤醒之后PCM 数据被 Opus 编码成小包经 WebSocket 或 MQTTUDP 两条可选通道之一流到云端云端按识别ASR→ 大模型Qwen / DeepSeek 均可对接→ 合成TTS的顺序处理语音再以 Opus 流式回传边说边播不用等整句生成完。带回声消除AEC能力的硬件还能做到全双工——它说话时也能听你插嘴。环节三MCP 让大模型动手。平时大模型只会动嘴MCPModel Context Protocol模型上下文协议让设备把自己变成一个工具服务器喇叭、LED、舵机、GPIO 都注册成工具大模型判断该关灯了时直接调用对应工具而不是让你自己念一串指令。芯片不同音频管线的档次也不同这直接决定你能拿到什么体验芯片档位音频引擎能力S3 / P4 / S31AfeAudioEngine唤醒 回声消除 VAD 共用一条 AFE 流水线支持全双工实时对话ESP32 / C3 / C5 / C6LiteAudioEngine独立 WakeNet 唤醒原始单声道 PCM 上云无 AEC想抠细节的话音频服务架构文档 里有完整的数据流图。 想玩深一点三条进阶路径路径一做一块自己的板子。仓库里每块板都是 main/boards/ 下的一个目录四个文件撑起一切config.h引脚定义、config.json板型标识与编译配置、xxx_board.cc板级初始化、README.md。完整步骤在 自定义开发板指南 里编译用python scripts/build.py 你的板子目录一条命令出固件。注意千万别直接改已有板子的配置。每块板有自己独立的 OTA 升级通道复用旧板型名字你的定制固件迟早被官方 OTA 刷回去。路径二换唤醒词和资产。项目内置的唤醒词、字体、表情、聊天背景都是可替换的——ESP-SR 支持自定义唤醒词训练资产文件放在 main/assets/ 下多语言语音提示按zh-CN、en-US这类目录分门别类存放。路径三扩展协议能力。设备端 MCP 的工具注册逻辑在 main/mcp_server.cc消息走 JSON-RPC 2.0 封装在 WebSocket/MQTT 里。想加一个设备能控制的工具或写自己的后端按顺序读这三份文档即可MCP 交互流程 → MCP IoT 控制用法 → WebSocket 协议 或 MQTTUDP 协议。 避坑速查症状 → 原因 → 对策症状大概率原因对策死活连不上 Wi-Fi连了 5GHz 网络切到 2.4GHz再确认 SSID/密码没拼错喊不破唤醒麦克风接线或增益不对核对 I2S 引脚定义调麦克风增益先在安静房间测对话断续、像卡顿上行带宽不足或路由器不稳换 5GHz 给手机、2.4G 给设备分不了流时换路由器或拉网线升级后编译报错一堆SDK 版本对不上对齐 ESP-IDF v6.0.2老板子兼容问题查 ESP-IDF 6.0 迁移指南OTA 后固件变回原厂定制板复用了已有板型名新板建独立目录 独立板型标识见上面引用块4G 板子注册失败APN 没配在对应板子的config.h里按运营商改 APN移动一般为 CMNET收尾小智的价值在于把大模型 语音硬件这件事的门槛压到了会敲三条命令固件管唤醒和网络云端管脑子MCP 管手。跑通第一次对话后板子适配、自定义唤醒词、MCP 工具扩展这三条路基本够你玩一个季度。中文 README板级源码目录自定义开发板指南MCP 协议交互流程MCP IoT 控制用法WebSocket 通信协议MQTTUDP 通信协议音频服务架构说明【免费下载链接】xiaozhi-esp32An MCP-based chatbot | 一个基于MCP的聊天机器人项目地址: https://gitcode.com/GitHub_Trending/xia/xiaozhi-esp32创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考