
DeepEval 快速指南三步跑通 LLM 评估的完整路径【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval改完 prompt、换了模型之后你往往要先回答一个问题RAG 返回的答案还可信吗逐条人工看既不现实凭感觉也不可靠。DeepEval 是一个开源的 LLM 评估框架把这种判断变成可执行的测试用一个更强的模型当评委LLM-as-a-judge用 40 个指标给输出打分用 pytest 的方式验证模型质量。下面从最小可运行的用例讲起走到接入生产。DeepEval 是什么用更强的模型当评委给输出打分DeepEval 是一个开源 LLM 评估框架思路和 pytest 一致写测试用例、跑测试、按分数判定通过与否。它兼容 LangChain、OpenAI、Anthropic 等框架构建的 LLM 应用既能评估单轮问答也能评估 agent 的完整执行轨迹。核心机制是LLM-as-a-judge把任意 LLM 配置为评委让它按预设标准对输出打分产出 0–1 的分数分数低于阈值测试用例即失败。部分指标ExactMatch、Toxicity 等由本地 NLP 模型驱动完全不消耗 API token。除内置指标外你还可以注册自定义指标复用整套数据流仓库里也附带了 10 行以内跑 MMLU、HumanEval 等基准的脚本。全部指标的源码在 deepeval/metrics/ 目录。三步跑通第一次 LLM 评估安装。要求 Python 3.9pip install -U deepeval写最小用例。新建test_chatbot.py内容是一个LLMTestCase加一个指标下一节第一个示例可直接复制。用例文件就是普通 Python 文件无需任何额外配置DeepEval 会自动收集结果并输出控制台报告。配置 Key 并运行。设置评委模型 Key然后跑测试export OPENAI_API_KEYyour-key deepeval test run test_chatbot.py评委模型和被评估的模型可以完全不同用更强的模型给更弱的模型打分是 LLM-as-a-judge 的标准用法。能力深潜跑评估、多指标组合与 G-EvalLLM 输出质量怎么评估这个问题可以拆成三层先能跑再能覆盖最后能自定义。如何跑一次评估assert_test 与阈值判定解决单条输出好不好靠人眼看的问题把判定变成一条断言。from deepeval import assert_test from deepeval.metrics import AnswerRelevancyMetric from deepeval.test_case import LLMTestCase test_case LLMTestCase( input如果鞋子不合适怎么办, actual_output你可以在 30 天内申请全额退款。, expected_output购买后 30 天内可全额退款。, ) assert_test(test_case, [AnswerRelevancyMetric(threshold0.7)])每个指标输出 0–1 分任一项低于阈值assert_test抛出AssertionError用例失败控制台会实时打印各指标得分与通过情况可直接挂进 pytest 或 CI。多指标组合RAG 评估指标怎么一起跑解决单一指标覆盖不了全部失败模式的问题——检索错了、答案编造了、答非所问可以分别量化。from deepeval.test_case import LLMTestCase from deepeval.metrics import AnswerRelevancyMetric, FaithfulnessMetric test_case LLMTestCase( input退货政策是什么, actual_output购买后 30 天内可全额退款。, retrieval_context[客户可在购买后 30 天内申请全额退款。], ) assert_test(test_case, [AnswerRelevancyMetric(threshold0.7), FaithfulnessMetric(threshold0.8)])FaithfulnessMetric会把答案拆成若干声明逐条与retrieval_context对账真实 RAG 项目里这两个指标常成对出现同时锁住检索质量与生成质量。G-Eval 自定义评估标准怎么配现成指标描述不了你关心的质量语气、合规、格式时G-Eval 用一句自然语言标准直接产出分数。from deepeval.metrics import GEval from deepeval.test_case import SingleTurnParams tone_metric GEval( name语气, criteria评估回答是否专业、克制是否使用了礼貌的表达。, evaluation_params[SingleTurnParams.ACTUAL_OUTPUT, SingleTurnParams.INPUT], threshold0.6, ) assert_test(test_case, [tone_metric])G-Eval 内部把标准分解成思维链让评委模型逐步打分标准用自然语言维护换标准时不用改代码。把评估接入 CI/CD 与生产监控assert_test基于 pytest接 CI 只需在流水线里加一步deepeval test run任一指标低于阈值构建即失败prompt 与模型的每次变更都被锁定为LLM 回归测试。上线后用 DeepEval 的 tracing 能力采集线上每轮对话的输入、输出与检索链路沉淀成数据集反哺评估评估平台还提供线上 trace 与评估结果的回归对比视图让你在用户投诉之前看到分数下滑。该视图把同一测试用例的两轮运行并排对比各指标得分与通过状态一目了然。选型与避坑怎么选、怎么校准如果你对评估成本敏感那么先用本地 NLP 指标ExactMatch、PatternMatch、Toxicity 等做初筛只把需要语义判断的样本交给评委模型token 开销可以压到最低。如果你有数据隐私要求医疗、金融场景那么把评委模型换成本地部署如 Ollama或只用纯本地指标组合prompt 与用户数据不出本机。如果你不确定评估本身可不可信那么抽一批人工标注数据与评委模型打分做一致性对齐再定阈值也可用强弱两个模型各评一遍同一批数据做交叉校验。如果你想抓住 prompt 变更引发的回归那么把输入与期望输出固化成数据集用evaluate()批量跑每次改动前后对比分数而不是靠抽样抽查。如果你在评估 agent 而非单轮问答那么在端到端输出之外补上TaskCompletionMetric、ToolCorrectnessMetric这类指标把工具调用与步骤轨迹也纳入评分范围。值得深入的项目路径官方文档与教程docs/可运行的完整示例含 RAG 与 agent 评估examples/40 指标的完整源码deepeval/metrics/tracing 与框架埋点代码deepeval/tracing/基线一旦建立后续的每次变更都有了可以对照的数字。【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考