
总结本地推理性能已能匹敌甚至超越 Claude Code但关键不在模型本身而在 harness 的选择。Opencode 与 OMP 是最稳定的通用方案Qwen3.8 Flash Next Strata 是速度之王而 swift‑1.5‑qwen3.8‑27B‑Q6_K 是单卡 5090 上最稳健的高质量模型。⭐ 1. 作者的核心贡献本地模型 本地 harness 的系统性基准作者长期测试本地模型与不同 harness 在真实任务上的表现包括基础数学视觉电脑使用读邮件、逛商店编码任务并建立了一个公开排行榜airbench.ai排行榜同时衡量能力成功率 %速度完成任务所需时间⭐ 2. 本地性能可以匹敌 Claude Code Opus 5.5Claude Code Opus 5.5100%14m26s本地可达zcode 4×RTX6000 GLM‑5.3‑Flash‑NVFP4100%31m13sQwen3.8‑Flash‑Next‑IQ3_XXS Strata96%7m41sopencode同模型在 OMP94%11m31s速度甚至超过 Claude Code7m41s vs 14m26s。⭐ 3. 关键发现Harness 影响力与模型同等重要作者强调同一模型 同一显卡5090不同 harness 得分可从 22% 到 96%这意味着Harness 决定了模型能否发挥真实能力。测试数据显示opencode(94%) omp(91%) pi(71%) hermes(67%) openclaw(56%)。⭐ 4. 单卡 RTX 5090 的最佳模型作者在单卡 5090 上测试多模型结论如下 最稳健高成功率swift‑1.5‑qwen3.8‑27B‑Q6_K在 pi / omp / opencode 分别得分96 / 94 / 92%在 5 个 harness 上平均82%所有模型中最高 最快qwen3.8‑flash‑next‑iq3_xxs‑strataopencode96%7m41somp94%11m31s 高质量但极慢qwen3.8‑27B‑NVFP4可达 96%但耗时1h40m–1h50m对 harness 极度敏感37%–96%❌ 会伤害表现的因素MTPNVFP4‑MTP 平均仅 52%而非 MTP 为 70%swift 在 pi 上从 96% 掉到 55%65K 长上下文成绩掉到 45–61%Gemma‑4‑26B虽然快但最高只有 47%⭐ 5. 最佳 Harness 排名基于三模型在同一 5090 上的平均分作者对五个 harness 做了公平对比Harness平均成功率备注Opencode94%最稳定、最快之一OMP91%与 opencode 并列最佳PI71%对某些模型很好对某些模型极差Hermes67%可能得分高但非常慢1h20m–2hOpenClaw56%不稳定只有 Opencode 与 OMP 在所有模型上都能保持 85%。⭐ 6. 作者给出的最终推荐单 RTX 5090可靠性优先swift‑1.5‑qwen3.8‑27B‑Q6_K opencode / omp速度优先qwen3.8‑flash‑next‑iq3_xxs‑strata opencode / omp⭐ 7. 社区讨论亮点✔ DH harness 表现强劲用户反馈 DHDeepHermes在 vision 修复、任务执行上表现接近 frontier 模型✔ MTP 是否影响质量多名用户讨论 MTP 是否会改变输出有人认为不会改变质量理论上验证 token有人指出在某些情况下确实会改变输出接受阈值问题有人提醒检查是否使用“relaxed acceptance”而非严格拒绝采样✔ DeepSeek harness 可能更强多名用户建议测试 deepseek harness社区反馈很好⭐ 8. 作者邀请大家提交测试作者希望更多人提交本地测试到 airbench.ai以扩展排行榜数据https://www.reddit.com/r/LocalLLaMA/comments/1wy5bmy/which_model_which_harness_i_have_data_for_you/