ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Sakura启动器怎么装:从零跑通本地AI翻译服务的完整指南

Sakura启动器怎么装:从零跑通本地AI翻译服务的完整指南 Sakura启动器怎么装从零跑通本地AI翻译服务的完整指南【免费下载链接】Sakura_Launcher_GUISakura模型启动器项目地址: https://gitcode.com/gh_mirrors/sa/Sakura_Launcher_GUI手上有一批待译的英文技术文档想在本地跑Sakura机翻Sakura启动器Sakura Launcher GUI就是为这件事做的图形化工具帮你下载模型、选对llama.cpp框架、启动本地翻译服务并把这个服务共享给局域网里的其他机器。下面按实际操作顺序走一遍。适用场景Sakura启动器主要面向三类情况各用几句话说清楚。做机翻翻译工作时传统做法要自己找模型下载地址、装依赖、背一串llama.cpp的命令行参数、处理驱动问题。用Sakura启动器这些动作变成从列表里选模型、点下载、点启动。局域网里有多人或多台机器需要翻译服务时在显存较大的那台机器上启动服务并开启共享功能其他机器不必重复部署直接复用已上线的翻译槽位。第一次接触本地大模型、不熟悉命令行的人也可以从这里入手下载模型、启动服务、调整参数全部在界面上完成不用记环境变量和参数顺序。快速上手从克隆到启动只需要四行命令前置条件只有 Python 3.x官方推荐 3.12git clone https://gitcode.com/gh_mirrors/sa/Sakura_Launcher_GUI cd Sakura_Launcher_GUI pip install -r requirements.txt python main.py启动后主流程三步在下载页选模型下载 → 在llama.cpp页下载对应显卡的框架 → 回到启动页点击启动。服务默认监听127.0.0.1:8080启动成功后翻译工具里填入该地址即可调用。核心功能程序共五个页面下载、llama.cpp、启动、共享、设置前四个与日常使用直接相关。 模型下载下载页内置六个 Sakura 模型均为 Qwen 底座、IQ4_XS 或 Q4_K_M 量化。7B 系列要求 8G 显存起14B 系列要求 10G 起文件下载后会做 SHA256 校验下载源同时提供 HuggingFace 与 hf-mirror 两个地址。选择要点8G 显存选 7B10G 以上再考虑 14B同规格模型按量化版本IQ4_XS / Q4_K_M在体积与质量之间取舍模型清单由 data.json 驱动程序启动时会尝试拉取远端更新llama.cpp 框架按显卡选llama.cpp 版本必须和显卡匹配下载页已备好现成安装包CUDANVIDIA 独显、HIP大部分 AMD 独显、Apple M 系列、Vulkan其他显卡兜底官方标注不推荐AMD 核显有单独的 ROCm 包同样标注不推荐。服务启动启动页负责选模型、选显卡、调参数。首次使用建议选完模型后直接点自动配置程序会按模型规格和你的显存算出上下文长度与线程数进阶选项包括 Flash Attention、--no-mmap、自定义命令模板以及一键性能测试自动运行 llama-batched-bench 并展示 S_TG 结果。模型共享共享页可以把本地启动的服务挂上共享网络上线后刷新在线槽位数量查看本地请求统计数据。共享的 APIsrc/sakura_share_api.py与 GUI 完全解耦另附带一个 CLI 工具可以脱离界面单独使用。参数配置速查下表收拢了启动页最常碰的几个参数默认值均为程序内置值参数作用默认值按显存的建议值上下文长度 (-c)模型单次可处理文本的长度上限20488G 用 2048–4096 足够16G 以上可试 8192并行线程 (-np)并行翻译任务数上下文会被线程均分17B8G 给 2 / 10G 给 4 / 16G 给 1614B10G 给 4GPU层数 (-ngl)放到 GPU 上计算的模型层数200全部上卡显存充裕保持 200出现 OOM 时下调主机端口本地服务监听地址127.0.0.1:8080端口被占用时改端口需局域网访问时改 host另外两条来自官方手册的硬性要求GalTransl 这类批量翻译工具每线程上下文不应小于 1536LunaTranslator 这类即时翻译工具不应小于 512。程序会把每个线程的实际上下文显示在界面上不足时会提示。避坑与调优以下几条是实际使用中最高频的问题按问题→原因→做法列出模型下载失败或中断多为网络波动。清理已下载的失败文件后重新下载或手动下载模型文件再在设置页模型搜索路径中指定存放目录。AMD 显卡错误启动到核显7000 系 AMD 平台容易识别错。在自定义命令填HIP_VISIBLE_DEVICESx %cmd%x 依次试 0、1指定独显N 卡多卡场景用CUDA_VISIBLE_DEVICESa,b %cmd%同理。显存溢出或启动失败通常是上下文或线程数开得过高。先跑一次自动配置拿到基准值再手动下调 -np 和 -c 逐项排查。线程加上去速度反而变慢线程会均分上下文单线程上下文低于 1536 时质量和速度都会受损注意看 UI 显示的每线程上下文。GPU 层数不知道设多少保持默认 200。它是层数而不是百分比显存不够时再往下调。进阶想改代码或做二次开发关键模块如下src/ ├── section_download.py # 模型与 llama.cpp 下载页 ├── section_run_server.py # 服务启动、GPU选择、性能测试 ├── section_share.py # 模型共享 ├── sakura.py # 模型清单与显存推荐计算 └── llamacpp.py # llama.cpp 版本与下载管理启动出来的服务是标准 llama-server对外提供 OpenAI 兼容 API基础地址http://127.0.0.1:8080各类翻译工具填入地址即可调用。要改参数逻辑或新增功能从 section_run_server.py 和 setting.py 入手即可。写在最后更完整的参数说明和故障排查见仓库根目录的《Sakura Launcher GUI 用户手册.md》。Sakura启动器的定位是命令行与使用者之间的一层翻译把模型与框架的下载、显存适配、多机共享都放到界面上让翻译工作本身重新成为重点。【免费下载链接】Sakura_Launcher_GUISakura模型启动器项目地址: https://gitcode.com/gh_mirrors/sa/Sakura_Launcher_GUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表