ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

llamafile 怎么用 --bench 跑 LocalScore 基准测试评估本机 LLM 推理性能?

llamafile 怎么用 --bench 跑 LocalScore 基准测试评估本机 LLM 推理性能? llamafile 怎么用 --bench 跑 LocalScore 基准测试评估本机 LLM 推理性能【免费下载链接】llamafileDistribute and run LLMs with a single file.项目地址: https://gitcode.com/GitHub_Trending/ll/llamafile如果你想搞清楚自己的机器跑 LLM 到底能到什么速度llamafile 内置的 LocalScore 可以直接给出量化结果用--bench参数跑一轮基准测试得到 prompt 处理速度、生成速度和首 token 延迟并合并成一个 LocalScore 分值。LocalScore 支持 CPU、NVIDIA GPU、AMD GPU 和 Apple Silicon运行在 Windows、macOS 和 Linux 上。LocalScore 测量什么分数怎么读LocalScore 评估三个指标Prompt Processing Speed系统处理输入文本的速度tokens/秒Generation Speed系统生成新文本的速度tokens/秒Time to First Token首个响应出现前的延迟毫秒。三者通过几何平均合并为单个 LocalScore 值score 10 · ∛(avg_prompt_tps · avg_gen_tps · 1000 / avg_ttft_ms)文档给出的分数参考general guideline1,000 以上excellent250 左右对大多数人 acceptable to good100 左右relative poor。这个参考区间就是你判断本机性能档位的依据跑完--bench后把输出的分值对照上面三档即可。用 --bench 跑基准测试两种主路径前提条件只有一条版本要求llamafile v0.9.2 才内置 LocalScore 命令。低于该版本的老 llamafile 不能用--bench。路径一使用内置模型的 llamafile 文件最短路径下载一个 llamafile 文件模型已打包在内赋予执行权限后直接加--bench运行。MacOS/Linux 上文档给出的示例# 下载一个 llamafile文档示例命令 curl -O https://huggingface.co/Mozilla/Llama-3.2-1B-Instruct-llamafile/resolve/main/Llama-3.2-1B-Instruct.Q4_K_M.llamafile # 赋予执行权限并跑基准测试 chmod x Llama-3.2-1B-Instruct.Q4_K_M.llamafile ./Llama-3.2-1B-Instruct.Q4_K_M.llamafile --benchWindows 上下载一个小于 4GB 的 llamafile 直接运行Llama-3.2-1B-Instruct.Q4_K_M.llamafile.exe --bench路径二单独安装的 llamafile 指定 GGUF 模型如果你已经安装了 llamafile例如从 release 页面获取的二进制文件用-m传入你的 GGUF 模型文件。下面命令中的path/to/model.gguf需要替换为你自己模型文件的实际路径Windows 路径使用反斜杠# MacOS/Linux llamafile --bench -m path/to/model.gguf# Windows llamafile.exe --bench -m path\to\model.gguf如果手头是独立的 localscore 二进制而非 llamafile运行方式相同./localscore -m path/to/model.gguf。常用参数说明--bench进入的 LocalScore CLI 支持以下选项摘自 localscore/README.md 的 usage 文本参数用途-m, --model filename指定要基准测试的模型独立运行时的模型来源-c, --cpu禁用 GPU 加速等价于--gpudisabled用于单独测量 CPU 性能-g, --gpu auto\|amd\|apple\|nvidia\|disabled指定 GPU 后端默认auto-i, --gpu-index i按索引选择 GPU默认 0--list-gpus列出可用 GPU 后退出跑测试前先确认设备识别情况-o, --output csv\|json\|md输出格式默认md-v, --verbose开启详细输出-y, --send-results不询问确认直接提交结果到公开数据库-n, --no-send-results禁用结果提交-e, --extended跑 4 轮重复等价--reps4--long跑 16 轮重复等价--reps16--reps N自定义重复轮数文档给出的两个典型用法# 只用 CPU 跑 ./localscore -m path/to/model.gguf --cpu # 自动提交结果 ./localscore -m path/to/model.gguf -y需要更稳定数值时可用-e或--reps N增加重复轮数多轮数据能反映波动默认轮数下的单次结果只作参考。结果读取与数据提交输出格式由-o决定默认 Markdown也可导出 CSV 或 JSON方便自己归档或对比不同机器、不同后端的成绩。使用-y提交结果到 localscore.ai 的公开数据库时文档说明会收集以下非个人身份信息CPU 型号与配置、GPU 型号与配置、操作系统与版本、内存容量、基准性能指标。不想提交结果时保持默认即可或用-n显式禁用。限制与常见问题Windows 4GB 限制大于 4GB 的 llamafile 在 Windows 上无法直接运行此时改用独立 LocalScore 工具并传入 GGUF 格式模型即上面的路径二。单 GPULocalScore 目前只支持单 GPU 配置。macOS Apple Silicon需要安装 Xcode Command Line Tools用 zsh 运行遇到问题时改用sh -c ./llamafile该 bug 在 zsh 5.9 已修复。遇到 developer cannot be verified 提示时到 System Settings 的 Privacy Security 里允许运行或按 localscore/doc/troubleshooting.md 中的sudo spctl --master-disable流程处理后记得--master-enable恢复。Linux 报run-detectors/WINE 相关错误按 troubleshooting 文档注册 APE binfmt需要sudo下载并写入/proc/sys/fs/binfmt_misc/register见 localscore/doc/troubleshooting.md 中的 Linux 一节。WSL2 用户同样参考该文档中 WSL2 一节的 systemd 服务与 binfmt 配置文档也提到 Windows 上 LocalScore 性能低于 Linux 属于当前预期行为。早期开发文档明确 LocalScore 处于相对早期阶段遇到偶发问题时应在 GitHub 提 issue。验证方式一轮--bench跑完后的判断方法输出中会给出 prompt/生成的 tokens/秒、time to first token毫秒以及合并后的 LocalScore 分值。把分值对照 1,000 / 250 / 100 三档参考区间定位本机水平如果数值明显低于预期先用--list-gpus确认 GPU 是否被识别再用-c跑一次纯 CPU 结果作对照即可区分是 GPU 路径还是整机的问题。更多故障分支WSL2、Linux binfmt、macOS 信任提示的完整处理见 localscore/doc/troubleshooting.md。【免费下载链接】llamafileDistribute and run LLMs with a single file.项目地址: https://gitcode.com/GitHub_Trending/ll/llamafile创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表