
文章主要内容总结本文介绍了一种名为SCHEMORA的模式匹配(schema matching)框架,旨在解决异构数据源整合和数据集发现中的关键挑战。该框架基于现成的大型语言模型(LLMs),通过多阶段推荐和元数据增强技术,无需依赖标注训练数据或 exhaustive 的 pairwise 比较,即可高效识别候选匹配。SCHEMORA的核心流程分为两个阶段:索引阶段:对目标模式的列进行元数据富集(通过LLM生成语义丰富的列名变体)、预处理(清洗文本)、向量索引生成(使用FAISS)和全文检索索引生成(使用BM25),构建支持混合检索的数据库。查询阶段:对源模式的列执行与索引阶段相同的富集和预处理,通过向量搜索和全文搜索获取候选匹配,再经LLM筛选相关表并排序,最终输出匹配结果。实验表明,SCHEMORA在MIMIC-OMOP基准数据集上实现了新的最先进性能,HitRate@5提升7.49%,HitRate@3提升3.75%,且是首个开源的基于LLM的模式匹配方法,为后续研究提供了可复现的基础。创新点无需标注数据:完全基于提示驱动(prompt-based),无需标注训练数据,可在多领域通用部署。混合检索架构:首次结合向量语义搜索与BM25词汇检索,捕获互补的语义和词汇信号。高效元数据增强: