
文章主要内容和创新点主要内容本文聚焦多模态大型语言模型(MLLMs)在基于图像的回归任务(如图像质量评估、美学评估、AI生成图像质量评估等)中的应用,指出当前方法的局限性:现有方法通过预设输出词汇(如“优秀”“良好”)和通用任务提示(如“如何评价这张图像?”)微调MLLMs,假设其能模拟人类评分行为,但实际性能与仅用图像训练的模型相当,未能利用文本输入的语义理解能力。针对这一问题,本文提出基于Transformer分类的回归(RvTC)方法,通过灵活的“分箱(bin)”策略替代词汇约束的分类,并证明数据特定提示(含图像语义信息的文本)能显著提升模型性能。实验表明,在AVA数据集上,加入图像相关的“挑战标题”(如“三分法则”“户外微距拍摄”)后,模型相关性从0.83提升至0.90,创最新纪录。同时,通过控制实验区分了语义理解与统计偏差的影响,证实性能提升主要来自跨模态理解而非数据集固有偏差。创新点提出RvTC方法:用基于分箱的分类替代词汇约束的分类,通过增加分箱数量(而非复杂的分布建模)减少离散化误差,仅用图像输入就在4个基准数据集上达到或刷新当前最优性能。强调数据特定提示的价值:证明通用任务提示无法发挥跨模态能力,而含图像语义信息的数据特定提示(如AVA数据集的“挑战标题”)能显著提升回归性能,揭示MLLMs跨模态理解的潜力。区分语义理解与统计偏差:通过AVA和AGIQA-3k数据集的控制实验,证实性能提升主要源于跨模态语