
LocalAI 完整指南在任意硬件上运行本地大模型、语音与图像推理【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI跑完那条docker run浏览器打开 http://localhost:8080LocalAI 的 WebUI 就立在眼前之后下载模型、对话、调 API 都在这个界面里完成。LocalAI 是一个开源的本地 AI 推理引擎语言、视觉、语音、图像、视频模型统一走 OpenAI 兼容 API 出结果纯 CPU 也能跑。是什么LocalAI 适合谁一句话说清LocalAI 是可组合的本地推理引擎——核心只是一个二进制或容器负责 OpenAI/Anthropic 兼容 API 和 WebUIllama.cpp、vLLM、whisper.cpp 这类推理后端是独立的 OCI 镜像你装哪个模型才拉哪个不用的不装。适合想在笔记本或工作站上本地跑 LLM 的人已有 OpenAI SDK 代码、想整体搬到本地不改业务逻辑的人数据必须留在自己机器上的团队。暂时不适合指望它替代云端大规模并发吞吐、又不愿意自己加 worker 机器的人分布式模式要自己备算力以及只想一键微调出新模型、不想碰环境配置的人。快速上手三步跑出第一次模型对话第 1 步启动核心。Docker 是官方推荐的安装方式纯 CPU 镜像一条命令docker run -ti --name local-ai -p 8080:8080 localai/localai:latest预期结果容器起来并打印启动日志浏览器打开 http://localhost:8080看到 WebUI 首页但 Installed 列表还是空的。不用 Docker 也行macOS 装 DMG 应用Linux 从 release 页拿对应架构的二进制直接执行。第 2 步装第一个模型。在 WebUI 进入 Models → Explore搜qwen3-4b小、吃内存少CPU 也能跑点 Install。预期结果页面顶部出现一行进度依次经过 Resolving files、Downloading、Verifying 等阶段失败时卡片上有 Retry 按钮成功后它出现在 Installed 列表里。命令行党可以直接local-ai run qwen3-4b它会先下载再启动。第 3 步拿到第一条回复。进 Chat 页从模型下拉框选qwen3-4b发一句话。预期结果几秒内出回复首次请求偏慢因为要把模型载入内存。有 GPU 的话第 1 步换成对应卡片的镜像NVIDIA CUDA、AMD ROCm、Intel、Vulkan 各有 tagLocalAI 会自动检测并拉取匹配的后端。跑起来之后选模型、调参数、看状态、接代码装模型模型库、Hugging Face 或 Ollama 三条路内置 Model Gallery 有数百个预配置模型按类型文本生成、TTS、图像生成、多模态、Embeddings 等和 tag 过滤后直接点安装下载字节数、阶段在页面上全程可见。库里没有的直接把 URI 指向来源huggingface://仓库/文件.gguf、ollama://gemma:2b、某个 YAML 配置的 URL 都认file://也可以但必须落在 models 目录内。模型一装配套后端自动跟下来。什么时候会用得上每次你想加一种新能力比如语音转写时先来这里查有没有现成的。调运行参数每个模型一份 YAML模型旁边有一份 YAML 配置name、backend、model 文件、context_size、threads、temperature 这些项改完即生效。量化档位里 Q4_K_M 是体积和质量的平衡点内存吃紧就降到 Q4_K_S。仓库里 gallery/llama3.2-instruct.yaml 这类文件就是现成模板拷一份到本地运行副本里改即可。什么时候会用得上默认行为不合意时——改上下文长度、线程数或者把层卸载到 GPUgpu_layers。看状态Activity 页与健康检查模型、后端的安装和卸载都在后台跑页面顶部有一条进度横幅Operate → Activity 页能看到全部进行中操作、失败项和最近 50 条记录支持取消和重试。快速体检curl http://localhost:8080/readyz看健康curl http://localhost:8080/v1/models列已加载模型日志信息不够时加DEBUGtrue或--log-leveldebug重启。什么时候会用得上下载中断、模型加载失败、想知道谁占着显存时先来这一页。接自己的代码OpenAI SDK 指向 localhostLocalAI 是 OpenAI API 的 drop-in 替代把客户端的 base_url 改成http://localhost:8080其余代码基本不用动Anthropic Messages API 同样支持。curl http://localhost:8080/v1/chat/completions \ -H Content-Type: application/json \ -d {model: qwen3-4b, messages: [{role: user, content: 你好}]}终端里local-ai chat --model qwen3-4b会开一个内置 agent能读文件、跑命令改状态的操作先问你。什么时候会用得上开始写业务代码或者想在终端里边聊边调试时。小案例数据不出机房搭一个内部问答原型你接了个需求给客户的内部文档做个问答原型但文档内容不能走云端 API。你在机房工作站上起了一个 LocalAI 容器从模型库装了qwen3-4b然后把现成的 OpenAI SDK 里 base_url 指到127.0.0.1:8080——业务代码只改这一行当天就出了个能跑的 demo。客户又问能不能说出来。你回模型库挑了个 TTS 模型请求/v1/audio/speech接口demo 就能把回答念出来顺手设了LOCALAI_API_KEY把接口挡在授权范围之外。整个过程中模型只有几个 GB全在本地磁盘。这个案例的重点不在性能而在迁移成本OpenAI 兼容意味着老代码改一行 base_url新项目也不必学一套新 API 概念。踩坑速查四个高频问题端口冲突连不上 8080。现象是启动即退出或 curl 报 Connection refused原因是端口被占。一步动作ss -tlnp | grep 8080确认占用Docker 改用-p 8090:8080二进制改local-ai run --address:8090。模型加载失败或被系统杀掉。现象是 OOM 或进程被 kill原因是模型或上下文超出内存。一步动作换更小量化Q4_K_S或调低context_size显存不够就加--max-active-backends1只保留一个常驻模型再配--enable-watchdog-idle让闲置模型自动卸载。404 model not found。现象是 API 报找不到模型原因是请求里的名字和实际安装 id 不一致。一步动作curl http://localhost:8080/v1/models对出真实 id再改请求。macOS 的 DMG 点不开。现象是 Gatekeeper 拦截较新发布已签名公证仍被拦时多为隔离属性残留。一步动作sudo xattr -d com.apple.quarantine /Applications/LocalAI.app日志看不明白时先用DEBUGtrue重跑一遍再对照官方排障文档 docs/content/getting-started/troubleshooting.md 按类查。卡住了去哪找答案仓库内文档是主入口docs/content/getting-started/ 覆盖安装与模型管理docs/content/faq.md 回答高频疑问。社区在 Discord 上很活跃提 issue 时附上版本、硬件和完整日志基本能一次说清问题。【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考