
如何看懂free-coding-models的Stability Scorep95延迟、抖动与可用性的新手完整指南【免费下载链接】free-coding-modelsFind, benchmark and install in CLI 170 FREE coding LLM models across 15 providers in real time项目地址: https://gitcode.com/gh_mirrors/fr/free-coding-modelsfree-coding-models是一个在 CLI 中实时发现、基准测试并安装 170 免费编码 LLM 模型的工具覆盖 15 提供商。它的核心能力之一是Stability Score稳定性分数0–100通过并行 ping 每个模型把 p95 延迟、抖动jitter、尖峰比例和可用性合成一个数字告诉你哪个免费模型现在又快又稳而不只是上次 ping 运气好。一句话理解平均分会骗人Stability Score 不骗人。为什么平均延迟不够看Stability Score 解决什么想象两个免费编码模型模型 A平均 250ms但时不时飙到 6 秒模型 B平均 400ms每次都稳稳在 650ms 以内单看平均值A 更快但在实际写代码时A 会随机卡死你的 IDE 或 Agent。free-coding-models 的官方文档就明确写道一个平均 250ms 却随机飙到 6 秒的模型体感上比稳定的 400ms 模型更慢。所以 Stability Score 回答的问题是这个模型到底有多一致、多可预测 详细定义见 docs/stability.mdStability Score 计算原理4 个信号 权重分数由 4 个归一化到 0–100 的信号加权合成权重公式见 src/core/utils.js组成成分权重衡量什么归一化方式p95 延迟30%最慢的 5% 请求耗时尾部延迟100 × (1 - p95 / 5000)抖动 σ30%ping 耗时的标准差100 × (1 - 抖动 / 2000)尖峰率20%超过 3000ms 的 ping 占比100 × (1 - 尖峰数 / 总 ping 数)可靠性20%HTTP 200 的 ping 占比直接就是可用性百分比Stability 0.30 × p95 分数 0.30 × 抖动分数 0.20 × 尖峰分数 0.20 × 可靠性分数官方示例模型 Aavg 250ms、p95 6000ms得分约30 分模型 Bavg 400ms、p95 650ms得分约85 分——真实使用中B 反而感觉更快因为它不会随机卡顿。三个核心指标逐个拆解新手重点p95 延迟95% 的请求都比它快p95 把全部 ping 耗时排序后取第 95 百分位的值回答95% 的请求都快于这个值吗。p95 低 响应一贯快p95 高 存在尾部延迟尖峰。它只统计可测量的 pingHTTP 200/401计算逻辑见 src/core/utils.js。抖动Jitter / σ延迟波动有多大抖动就是 ping 耗时的标准差。低抖动 响应时间可预期高抖动 时快时慢、难以预测。至少需要 2 次可测量 ping 才能计算1 个点无法算方差实现见 src/core/utils.js。可靠性Up%成功率有多高即所有 ping 中返回 HTTP 200 的比例。比如 85% 表示 85% 的 ping 成功。这个指标专门用来揪出那些技术上在线但其实时好时坏的模型。一个技巧在 TUI 中按B可直接按 Stability 列排序按U按 Up% 排序两者结合筛选最稳的模型列说明见 docs/stability.md。分数与颜色如何在 TUI 里一眼读懂TUI 中 Stability 列按颜色分级扫一眼就知道靠不靠谱颜色分数区间含义 绿色≥ 80非常稳定放心用 青色60–79稳定偶有波动 黄色40–59一般建议观察 红色 40不稳定谨慎选择Web 仪表盘的展示方式略有不同进度条 数值≥70 为高分色组件见 web/src/components/atoms/StabilityCell.jsx。如果还没有成功 ping分数显示为 —属于正常现象。Stability Score 与 Verdict 健康标签的关系Stability 分数不直接显示在Verdict健康判定列但两者共用同一套底层数据。Verdict 会把平均快但 p95 尖的模型从 Perfect 降级为 Spiky只要 ≥3 次可测量 ping 且 p95 3000ms 即触发判定优先级逻辑见 src/core/utils.js。完整对照表标签含义 Perfect平均 400ms 且 p95/抖动稳定 Normal平均 1000ms响应一致 Spiky平均不错但尾部延迟失控p95 远大于平均值 Slow / Very Slow平均 1000–2999ms / 3000–4999ms Overloaded服务端返回 429/503限流或容量打满 Unstable之前在线、现在超时或平均 5000ms⏳ Pending首个可用延迟样本还没拿到新手决策口诀先看 Verdict 排除 Overloaded/Unstable再按 Stability 从高到低排序选分最高且 Up% ≥ 90% 的模型。✅安装与上手30 秒跑起来克隆仓库git clone https://gitcode.com/gh_mirrors/fr/free-coding-models进入目录后按仓库说明安装依赖并启动默认进入TUI 交互终端在 TUI 中按B按 Stability Score 排序观察绿色≥80模型选中目标模型后FCM 会把它写入你的编码工具配置并直接启动——从选哪个模型到开始写代码不到 10 秒各操作模式的完整说明见 README.md 和 docs/tui.md。常见问题 FAQQ为什么两个平均分相同的模型Stability 差很多A因为分数更看重 p95 和抖动合计权重 60%。一个稳定慢的模型得分往往高于偶尔快的模型。QStability 显示 — 或分数很低是模型坏了吗A先别下结论。— 表示还没有可测量的 ping分数低可能是限流429、网络波动或你的本地网络问题。建议多观察几轮 ping或结合 Up% 一起判断。QStability 分数多久更新一次A它是实时滚动计算的基于启动以来的可测量 ping 窗口TUI 会持续刷新此外还有一个共享的 24h 探测缓存供 TUI 与 Web 仪表盘复用。Q能在 Web 仪表盘里看吗A可以。运行 Web 模式后每个模型行都有 Stability 进度条并且支持分享带筛选条件的 URL 深链接细节见 docs/web-dashboard.md。小结Stability Score 把 p9530%、抖动30%、尖峰率20%、可用性20%压缩成一个 0–100 的数字。记住一件事——选免费编码模型选稳比选快更重要。现在打开 TUI按B排序把绿色模型用起来吧【免费下载链接】free-coding-modelsFind, benchmark and install in CLI 170 FREE coding LLM models across 15 providers in real time项目地址: https://gitcode.com/gh_mirrors/fr/free-coding-models创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考