ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Prompt perturbation and fraction facilitation sometimes strengthen Large Language Model scores

Prompt perturbation and fraction facilitation sometimes strengthen Large Language Model scores 文章核心总结与翻译一、主要内容该研究聚焦大型语言模型(LLMs)对期刊文章研究质量的评分任务(采用1*-4*四级评分标准),通过170万次Gemma3 27b模型查询(基于2780篇健康与生命科学领域文章、58个相似提示词),结合ChatGPT 4o-mini、Llama4 Scout等其他5个模型的验证,探索提示词设计对评分效果的影响,核心结论如下:有效提示词策略:(1)测试语义等效的提示词变体;(2)对语义等效提示词的评分结果取平均;(3)允许给出分数值;(4)避免强调输入文本(仅标题和摘要)的不完整性。模型差异性:最优提示词因模型而异——ChatGPT 4o-mini的最优提示词与Gemma3几乎相反,Llama4 Scout和Magistral的提示词效果弱相关,Qwen3 32b和DeepSeek R1 32b受提示词影响极小。关键发现:分数提示词能增加评分多样性和模型置信度表达;语义等效提示词取平均可降低无评分输出的概率,且是所有模型的通用有效策略;LLMs普遍存在回避1*(最低分)的倾向。二、创新点首次系统验证了“语义等效提示词变体+结果平均”策略在文本质量评分任务中的普适性,解决了单一提示词可能导致的评分偏差问题。拓展了分数提示词的应用场景,证实即使目标评分为整数,允许分数输出仍能提升模型与人类判断的相关性,揭示分数可释放模型对答案的置信度信息。
返回列表