ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

学习日记47:Enhanced Contrastive Learning with Multi-view Longitudinal Data for Chest X-ray Report Gener

学习日记47:Enhanced Contrastive Learning with Multi-view Longitudinal Data for Chest X-ray Report Gener 摘要大多数放射学报告自动生成法主要集中于单一或固定视角的图像来建模当前的疾病状况这限制了诊断的准确性并忽略了疾病的进展。尽管一些方法利用纵向数据来跟踪疾病进展但它们仍然依赖于单张图像来分析当前的情况。本文提出了基于多视角纵向数据的增强对比学习方法以促进胸片报告生成命名为MLRG该方法集成了当前多视图图像的空间信息和纵向数据的时间信息并可以灵活地处理缺失的患者特异性先验知识使模型能够根据可用的先验知识生成更准确的放射学报告。方法背景在临床实践中放射科医生通常使用来自当前访问的多视图图像进行综合评估并纳入患者病史(即纵向数据)来跟踪疾病进展并集成患者特定的先验知识来辅助诊断和报告生成。然而现在大多数的反射性报告生成方法在生成报告时只专注于单张图像并且难以有效地区分视图如后前位( PA )、前后位( AP )、侧位或左前斜位。此外一些患者可能由于首次就诊或数据存储不当而缺乏指征、先前报告或先前图像。这种可变性对灵活使用可用数据以生成准确的报告提出了挑战。为了解决上述问题作者提出了用于胸部X射线报告生成的两阶段MLRG在阶段1中使用类CLIP的结构让 AI 看懂「X 光影像 ↔ 报告病灶描述」的对应关系学会区分拍摄角度、看懂病情时序变化。stage2利用stage1训练出的对齐能力加入文本生成模块训练缺失先验信息时的输出能力。方法stage1:overview:首先确定数据格式图像编码器由DINOv2构成没啥特别的文本编码器这边首先使用FSE对诊断文本进行提取事实然后得到只保留客观病灶描述的文本输入文本编码器。然后利用CLIP结构进行多正例对比学习提升同一病例多张影像视觉特征的一致性。这块和上上篇的Phrase-grounded Fact-checking for Automatically Generated Chest X-ray Reports一样都是多个正例。为了区分不同视图设计了一个可学习的视图位置嵌入E在注意力计算时加入计算模型自己算出的图像相似度概率q是模型预测的相似度概率p是真实标签概率分布真值使用这个计算得到交叉熵损失MLF(多视角纵向融合网络):由于当前多视角图像的数量变化以及部分患者先前图像的缺失为了灵活地整合这些信息作者提出了这个多视角纵向融合网络MLF首先是选取最近的胸片的其中一张作为锚点然后只使用患者最近一次历史影像做时序建模不堆叠全部历史数据减少冗余计算具体就是选取的一张最近的锚点胸片作为Q其余的之前的作为VK输出网络中括号代表特征拼接 concat跨模态对齐:通过前面讲的 MLF 融合网络把「本次多视图图像 历史既往图像」融合成一份时空视觉特征,这份特征里同时自带本次多角度空间病灶 新旧片时序变化和报告里的时序文字信息维度匹配。经过 SEA 提纯后的报告事实序列化文本本身包含病灶随时间变化的描述用 “时空视觉特征 ↔ 带时序信息的报告文本” 成对约束训练让视觉、文本两种表征统一学习时空对应关系从根源减少幻觉。建立文本-图像相似度矩阵然后计算真值分布公式遍历批次内所有B份报告统计所有和第i份报告文字完全一致的报告总数S对于影像i所有文字一模一样的报告j均分权重1/S然后计算损失Stage2:overview:在 Stage1 完成视觉 - 文本预训练后搭建完整放射报告生成流水线核心解决「临床先验信息指征、既往报告缺失 / 存在兼容问题」最终输出完整胸片诊断文本。对于模型可能缺失的检查指征和既往报告文章提出Tokenized Absence Encoding标记化缺失编码统一建模「信息存在 / 信息缺失」两种情况即定义两个专属占位符号没有哪个就用哪个占位把清洗后的指征文本、提纯后的既往报告拼接成一段连贯输入叠加segment 分段嵌入 分段嵌入会给「指征部分」「既往报告部分」打上不同标识向量模型能区分两段文字的不同临床作用不会混淆就诊原因和历史病灶。将处理完成的临床先验文本特征与 Stage1 输出的时空视觉特征送入多模态融合网络 网络由自注意力 交叉注意力堆叠而成自动学习文字先验和 X 光影像之间的关联比如 “心衰复查” 指征对应心胸增大影像特征融合得到统一多模态特征送入文本生成头。实验基础信息主实验消融实验模块逐层消融实验表控制变量消融实验
返回列表