ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Learned-Rule-Augmented Large Language Model Evaluators

Learned-Rule-Augmented Large Language Model Evaluators 文章总结与翻译一、主要内容本文聚焦于扩展大型语言模型(LLMs)作为通用评估器的应用范围,解决现有LLM评估方法依赖人工设计评估原则、泛化能力弱且与数据和人类判断存在错位的问题。核心提出了一种规则增强的评估范式,包含两大核心阶段:规则蒸馏阶段:通过LLM辅助的蒙特卡洛树搜索(MCTS)从标注数据中自动提取结构化、可解释的评分规则,避免人工设计的高成本和低泛化性,同时改善与数据的对齐度。该阶段定义了规则的结构(含评估维度和评分标准),并通过MCTS的状态、动作、模拟、选择扩展和回溯机制高效生成规则。规则应用阶段:提出两种策略让LLM有效运用学到的规则:规则链(CoR):将蒸馏的规则注入提示词,无需训练即可实现结构化评估,简单且可扩展;规则增强LLM评估器(RuAE):基于强化学习(RL)训练,采用组合奖励函数(兼顾绝对得分准确性和相对排序一致性),通过组相对策略优化(GRPO)算法提升模型推理与规则的对齐度。实验在四类任务(论文评分、文献相关性评估、产品评分预测、摘要质量评估)上开展,结果表明CoR在不同规模模型上均有性能提升,RuAE在复杂任务中优于更大规模的推理模型,且学到的规则具有可解释性和人类对齐性。二、创新点提出了一种可扩展的规则学习方法:通过LLM辅助的MCTS从数据中蒸馏可解释的评分规则,避免人工设计成本,同时降低搜索复杂度(规则级搜
返回列表