
文章主要内容与创新点总结一、主要内容研究背景:多模态大语言模型(MLLMs)在视觉文档理解任务中应用广泛,但针对日语竖排文本的处理能力研究较为匮乏。日语文档常包含竖排形式,其阅读顺序(自上而下、从右至左)与横排文本(自左至右、自上而下)存在显著差异,现有OCR基准测试多侧重横排文本,忽视了竖排文本的评估需求。数据集构建:合成数据集JSSODa:通过LLM生成日语文本,渲染为包含1-4列布局的横排/竖排图像,共22,493张,按8:1:1划分为训练集、验证集和测试集,用于模型微调与评估。真实场景数据集VJRODa:从日本真实PDF文档中提取含竖排文本的页面,经筛选、转录和人工校正得到100张图像,用于模拟真实场景下的模型评估。实验设计:选取Qwen2.5-VL、InternVL3、Gemma 3等开源模型及GPT-4.1、GPT-5等闭源模型,通过字符错误率(CER)和BLEU值评估其横排/竖排日语文本识别能力,并验证JSSODa数据集的微调效果。核心发现:现有MLLMs处理竖排日语文本的准确率显著低于横排文本,部分模型存在阅读顺序混淆问题。基于JSSODa的微调能大幅提升原本不擅长竖排文本处理的模型性能(如Qwen2.5-VL-7B),但对已初步掌握竖排阅读规则的模型提升有限。真实场景数