ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Text Generation Web UI完整指南:5分钟跑起私有本地大模型

Text Generation Web UI完整指南:5分钟跑起私有本地大模型 Text Generation Web UI完整指南5分钟跑起私有本地大模型【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgenText Generation Web UI 是一套用于本地运行大语言模型的开源工具可以在自己的电脑上完成多轮对话、图片理解、文件解读和工具调用同时对外暴露 OpenAI 兼容 API。全程离线运行、无遥测、不发起外部请求。如果你不想让数据离开自己的机器或者想在个人硬件上跑一个私有助手这是目前最成熟的方案之一。它解决什么问题适合三类场景隐私敏感100% 离线、零遥测、无外部资源和远程更新请求对话内容与模型文件全部留在本机。硬件差异大NVIDIA、AMD、Apple 芯片、纯 CPU 都有对应安装路径docker/ 下还按 GPU 类型提供了现成的 Dockerfile 和 compose 配置。需要集成加--api参数即可得到与 OpenAI/Anthropic 同构的接口现有 OpenAI 客户端改个 base_url 就能指向本机。后端覆盖 llama.cppGGUF、Transformers、ExLlamaV3、TensorRT-LLM切换后端和模型都无需重启服务。3分钟把界面跑起来便携包推荐先试到 release 页下载对应平台的便携版Linux/Windows/macOS含 CUDA、Vulkan、ROCm、纯 CPU 选项解压后双击textgen即可开窗依赖全部自带。源码安装需要 ExLlamaV3、Transformers 等后端或训练、图像生成功能时走这条路。Linux 下执行git clone https://gitcode.com/GitHub_Trending/te/text-generation-webui cd text-generation-webui ./start_linux.shWindows 和 macOS 改用start_windows.bat和start_macos.sh安装时按提示选 GPU 厂商完成后浏览器打开http://127.0.0.1:7860。不想跑脚本的话自建 venv 后两行也能起pip install -r requirements/portable/requirements.txt --upgrade python server.py --portable --api --auto-launch完整安装约占 10GB 磁盘、会下载 PyTorch脚本基于 Miniforge 建 Conda 环境无需管理员权限。最后一步是放模型把 GGUF 模型文件放进user_data/models/界面会自动发现。多文件模型16 位 Transformers、EXL3 等要在models下建子文件夹存放整个目录且必须完整安装。拿它实际能干什么把 ChatGPT 平移到本地Chat 页有三种模式instruct面向指令遵循模型chat面向基础模型和角色卡chat-instruct则是指令模板套角色对话的折中。提示词由 Jinja2 模板自动格式化加载模型时会从元数据自动识别模板。角色定义在user_data/characters/下按 YAML 管理历史对话支持在任意消息处分支、重命名、删除。让模型看图、读文件消息里直接附图片做视觉理解llama.cpp 后端需配 mmproj 文件也可以上传文本、PDF、docx针对内容提问。让模型调用工具每个工具就是一个 Python 文件user_data/tools/内置了计算器、网页搜索、抓取网页、掷骰子、获取时间五个示例。聊天时模型自行决定何时调用哪个工具也支持接入 MCP 服务器。微调自己的 LoRATraining 页支持在多轮对话或纯文本数据集上微调 LoRA中断后可以续训数据集放user_data/training/datasets/没有 GPU 也能用 CPU 训练只是很慢。当 OpenAI 兼容 API 用加--api启动后http://127.0.0.1:5000/docs列出全部端点参数命名与 OpenAI 对齐现有代码基本零改动接入。先调这两个参数显存不够再降级调参别硬上手用预设。Parameters 页的 Presets 菜单收录了社区盲测投票选出的组合日常聊天选 Mirostat 2 这类预设就够稳。想手动微调只需搞懂两个temperature控制随机性0 表示完全确定top_p控制候选词范围出现重复循环时调高repetition_penalty或启用 DRY 采样。三十多个参数的完整说明见 docs/03 - Parameters Tab.md。显存不够是最常见的墙按见效程度依次试调小ctx_sizeKV 缓存是预分配的这是最直接的一项。cache_type做缓存量化fp16→q8_0→q4_0省得多、掉点少。用gpu_layers减少 GPU 层数剩余部分落到 CPU。Transformers 后端勾上load_in_4bit和use_double_quant仍放不下时配合--cpu-memory、--disk把剩余层卸载到磁盘。多卡用户用tensor_split按比例切分模型。不出意外的故障排查启动报依赖错误、页面打不开。用对应硬件的清单重装pip install -r requirements/full/requirements.txt --upgradeAMD 卡用requirements_amd.txt纯 CPU 用requirements_cpu_only.txt。模型列表里没有刚下的模型。先确认文件确实在user_data/models/多文件模型平铺无效需要子文件夹且便携版不带这些后端要完整安装。生成长文本时显存爆掉。降低上下文长度和提示词截断阈值检查缓存量化是否生效再用--idle-timeout让空闲模型自动卸载把显存留给别的任务。局域网内其他设备访问不到。启动命令加--listen暴露到本地网络即可。Text Generation Web UI 把私有本地大模型从命令行搬到了双击即用的界面里装上模型就能开始使用。【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgen创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表