
AI Voice Assistant — 零成本搭建本地智能语音问答系统基于 Ollama Cherry Studio 自动发现 Windows 本地 TTS一行命令启动零配置接入大模型。项目地址https://download.csdn.net/download/qq_36963950/93246520视频地址https://live.csdn.net/v/538844项目简介AI Voice Assistant是一个轻量级的智能语音问答演示系统。你输入文字问题AI 用文字 语音双重方式回答你——全程在你自己的电脑上运行无需联网 API不花一分钱。核心理念自动发现、零配置、即开即用。如果你已经安装了 Cherry Studio系统会自动读取其中配置的 Ollama / 云端模型无需手动填写任何 API Key。功能特性特性说明多后端自动切换Cherry Studio Ollama → CherryIN → 阿里百炼 → DeepSeek → SiliconFlow → Groq → OpenAI按优先级自动发现本地 TTS 合成基于 Windows SAPI5支持多种音色慧慧中文女声 / Zira 英文女声等️语速调节0.5x ~ 2.0x 实时调节朗读速度多轮对话自动维护会话上下文最多保留 20 轮历史专业深色 UIGitHub 风格暗色主题响应式布局适配桌面端零配置启动自动读取 Cherry Studio 本地配置无需手动设置环境变量技术架构┌──────────────────────────────────────────────────┐ │ Browser (index.html) │ │ Chat UI Audio Playback │ └──────────────────────┬───────────────────────────┘ │ HTTP REST API ┌──────────────────────▼───────────────────────────┐ │ server.py (Flask) │ │ ┌─────────────┐ ┌──────────────┐ ┌────────┐ │ │ │ /api/ask │ │ /api/voice │ │/api/… │ │ │ └──────┬──────┘ └──────────────┘ └────────┘ │ │ │ │ │ ┌──────▼──────┐ ┌──────────────────┐ │ │ │ llm_client │ │ tts_worker.py │ │ │ │ 对话管理 │ │ (子进程 WAV合成) │ │ │ └──────┬──────┘ └──────────────────┘ │ └──────────┼───────────────────────────────────────┘ │ ┌──────────▼───────────────────────────────────────┐ │ config.py │ │ ┌─────────────────┐ ┌───────────────────┐ │ │ │ Cherry Studio │ │ 环境变量手动配置 │ │ │ │ LevelDB 自动发现 │ │ (多后端降级选择) │ │ │ └────────┬────────┘ └─────────┬─────────┘ │ └────────────┼──────────────────────┼──────────────┘ │ │ ┌──────▼──────┐ ┌─────────▼─────────┐ │ Ollama/WSL │ │ DeepSeek / Groq / │ │ (本地模型) │ │ SiliconFlow / ... │ └─────────────┘ └───────────────────┘模块职责config.py— 配置中心自动解析 Cherry Studio 的 LevelDB 数据提取已配置的 ProviderAPI Key、Host、Model。同时管理所有手动配置的后端按优先级检测可用后端。llm_client.py— LLM 客户端封装 Ollama 原生 API 和 OpenAI 兼容 API 的调用逻辑内建线程安全的会话历史管理内存存储重启重置。server.py— Flask 服务入口提供 REST API/api/ask、/api/health、/api/voices、/api/reset通过子进程调用tts_worker.py完成语音合成。tts_worker.py— TTS 子进程独立进程运行避免 pyttsx3 的 COM 线程冲突。接收命令行参数输出 WAV 二进制数据。后端自动发现优先级系统启动时按以下顺序检测可用的 LLM 后端1. Cherry Studio → Ollama (WSL/本地) ← 当前使用 2. CherryIN (Cherry Studio 免费服务) 3. Cherry Studio → 阿里百炼 (DashScope) 4. Cherry Studio → 硅基流动 (SiliconFlow) 5. 阿里百炼 (手动环境变量) 6. DeepSeek (手动环境变量) 7. SiliconFlow (手动环境变量) 8. Groq (手动环境变量) 9. Ollama 直连 (localhost:11434) 10. OpenAI (手动环境变量)当前项目自动检测到 WSL 中的qwen2.5:0.5b模型通过 Cherry Studio 配置发现直接运行在本地完全免费。快速开始环境要求Windows 10/11Python 3.10WSL2 Ollama可选用于本地模型Cherry Studio可选用于自动发现配置1. 克隆/下载项目gitclonerepo-urlai-voice-assistantcdai-voice-assistant2. 安装依赖pipinstall-rrequirements.txt3. 可选配置 WSL Ollama在 WSL Ubuntu 中# 安装 Ollamacurl-fsSLhttps://ollama.com/install.sh|sh# 下载模型ollama pull qwen2.5:0.5b# 启动服务ollama serve4. 启动项目python server.py浏览器打开http://127.0.0.1:8899即可开始使用。提示如果已安装 Cherry Studio 并配置了 Ollama 或其他模型系统会自动发现无需任何额外配置API 接口接口方法说明/GET前端页面/api/healthGET健康检查返回 LLM 后端状态/api/voicesGET获取可用 TTS 音色列表/api/backendGET获取当前 LLM 后端详细信息/api/askPOST核心接口提问 → LLM回答 → TTS语音/api/resetPOST重置对话历史/api/ask请求体{question:你好请介绍一下自己,conv_id:main,voice:0,speed:1.0}/api/ask响应{answer:你好我是 AI Voice Assistant...,audio:UklGRiQAAABXQVZFZm10IBAAAAABAAEARKwA...}为什么选择这个方案对比维度云端 API 方案本项目费用按 Token 计费完全免费隐私数据上传云端数据完全本地延迟网络往返 ~500ms-2s本地推理 ~200ms-1s离线可用❌✅ (Ollama 模式)配置复杂度需要注册、获取 Key零配置Cherry Studio 自动发现模型选择丰富受限于本地硬件本项目特别适合以下场景技术演示— 向团队展示 LLM TTS 的端到端集成个人助手— 离线可用的私有 AI 对话工具二次开发— 模块化设计可快速替换 LLM 后端或 TTS 引擎学习参考— 清晰的代码结构适合学习 Flask LLM 集成未来计划支持流式输出 (Server-Sent Events)实时显示 LLM 回答语音识别 (ASR) — 用语音输入代替文字输入多模态支持 — 图片识别 文件问答Docker 一键部署对话记录持久化存储 (SQLite)技术栈Python 3.10 Flask Web 服务 Ollama qwen2.5:0.5b LLM 推理 (WSL) pyttsx3 Windows SAPI5 TTS 语音合成 Cherry Studio LevelDB 配置自动发现 HTML5/CSS3 Vanilla JS 前端界面 (零框架)许可证MIT License写于 2026年8月 · 欢迎 Star ⭐