
Harvey LAB SWEEP_MATRIX完整配置指南快速掌握模型扫描矩阵【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labsHarvey LAB 是面向法律场景的大模型智能体基准测试项目其核心配置项SWEEP_MATRIX定义了模型扫描矩阵——一组模型与推理强度reasoning effort的组合清单。本指南带你快速读懂这份矩阵的每个字段并学会用它批量评测不同大模型完成法律任务的能力。什么是 SWEEP_MATRIXSWEEP_MATRIX是扫描sweep工具的核心数据源定义在 utils/sweep.py。它本质上是一个**模型 × 推理强度的组合表**每一项都是一个字典常见字段如下字段含义示例model模型标识可省略厂商前缀自动路由claude-sonnet-5、gpt-5.6-solreasoning推理深度档位None表示不支持思考模式low/medium/high/maxtemperature可选采样温度仅个别条目显式指定0.7扫描工具运行时会把「矩阵条目 × 任务」做笛卡尔积生成所有待执行的组合这就是矩阵扫描名字的由来。矩阵里都有哪些模型当前矩阵覆盖 5 家厂商、20 多个模型按厂商分组一目了然Anthropic 系列claude-opus-4-8与claude-sonnet-5各跑 5 档推理强度low/medium/high/xhigh/max用于对比思考越多是否表现越好claude-haiku-4-5-20251001非推理模型reasoning为None见 utils/sweep.pyOpenAI 系列gpt-5.6-sol4 档low~maxgpt-5.6-terra与gpt-5.6-luna各 3 档对应不同能力/成本层级Google 系列gemini-3.1-pro-preview3 档、gemini-3.5-flash含minimal档、gemini-3.1-flash-lite无推理档位Mistral 与 Fireworks 托管模型mistral-medium-3.5默认配置 一个high推理档显式设置temperature: 0.7见 utils/sweep.pyFireworks 网关托管的kimi-k2p6、glm-5p1、glm-5p2、nemotron-3-ultra-nvfp4各含 4 档配置 这种同一模型多档位的设计正是基准测试的关键固定任务、扫描推理强度才能看清模型的成本—质量曲线。如何筛选自己想测的模型命令行通过--models传关键词即可过滤矩阵匹配逻辑在 matches_filter既支持直接子串匹配如sonnet、gpt也内置厂商别名——过滤词实际匹配anthropic所有claude模型openai所有gpt模型google所有gemini模型fireworkskimi、glm、nemotron开头模型还可以叠加--reasoning high只保留某一档推理强度实现厂商 × 档位两级过滤。配置 ID 与结果目录是怎么生成的每次运行都会生成确定性的配置标识方便断点续跑与结果归档make_config_id生成任务路径/模型短名-推理档位无推理档时记为disabledmake_run_id再追加时间戳形成完整运行 IDfind_latest_run查找该配置最近一次已完成运行——已完成的组合会自动SKIP中断重跑不会浪费已有结果三步跑完一次完整扫描 扫描流程分为三个阶段智能体执行 → 评审打分 → 报告生成详见 utils/sweep.py 的main函数。官方入口是utils/sweep.py也可用兼容包装脚本 scripts/run_model_sweep.py。第一步先 dry-run 预览组合数uv run python -m utils.sweep --task real-estate --models sonnet --dry-run第二步正式扫描支持并行uv run python -m utils.sweep --task all --models opus gpt --parallel 8第三步只重跑评审或只重出报告uv run python -m utils.sweep --task real-estate --eval-only uv run python -m utils.sweep --task real-estate --report-only⚠️ 扫描前会自动执行预检run_preflight校验配置 ID 无冲突、任务可加载、task.json中存在评分标准rubric任一失败即中止避免白烧 API 费用。新手避坑清单评审模型独立于被测模型--judge-model默认claude-sonnet-4-6不在矩阵内见 evaluation/run_eval.py超时保护单个智能体运行超时 7200 秒、评审超时 1800 秒超时即终止并计入失败评审并发受限评审阶段并发自动压到 4全量模式 8防止触发 API 限流--task支持四级粒度all/ 整个业务领域 / 嵌套工作流 / 单个任务完整流程可对照官方教程 docs/tutorial.md 的Run A Sweep章节架构细节见 docs/architecture.md小结SWEEP_MATRIX用一份简洁的矩阵清单就把测哪些模型、开到多深、怎么命名结果、如何断点续跑全部约定好。理解它的三个字段model / reasoning / temperature与两级过滤--models--reasoning你就能像配置实验矩阵一样系统化地比较各家大模型在真实法律任务上的表现。【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考