行业资讯
β多样性分析:从相异性指数到PCoA排序的群落差异量化指南
1. 从“有什么”到“差多少”理解β多样性的核心价值在生态学、环境科学乃至微生物组研究领域多样性分析是理解一个系统复杂性的基石。我们最常接触的是α多样性它回答的是“一个特定区域内有多少种生物”的问题比如一片森林里有多少种树或者一个肠道样本里有多少种微生物。α多样性指标如Shannon指数、Simpson指数能告诉我们一个“点”的丰富度和均匀度是评估局部生态健康状况的常用标尺。然而当我们想回答“这片森林和那片草原的物种组成差异有多大”、“上游和下游的河流微生物群落有多相似”或者“健康人群与患病人群的肠道菌群结构究竟有何不同”这类问题时α多样性就力不从心了。这时我们需要一个能衡量“差异”的指标这就是β多样性。β多样性简单来说就是衡量不同群落或样本之间物种组成差异程度的指标。它不关心单个样本内部有多“热闹”而是专注于比较样本与样本之间的“距离”。这个“距离”可以是物种有无的差异也可以是物种相对丰度的差异。理解并正确应用β多样性分析是进行群落比较研究、识别环境梯度影响、追踪群落演替、乃至在医学上寻找生物标志物的关键一步。无论是生态学家评估人类活动对生物多样性的影响还是生物信息学家分析高通量测序数据β多样性都是一个绕不开的核心工具。2. β多样性的两大基石相异性指数与排序分析β多样性分析并非一个单一的数值而是一套方法体系。其核心由两部分构成一是用于量化差异的相异性指数二是用于可视化与解释差异的排序分析。理解这两者是掌握β多样性分析的关键。2.1 相异性指数如何定义“距离”相异性指数或称距离指数是计算两个群落样本间差异的数学公式。选择不同的指数意味着我们关注差异的不同侧面。主要分为两大类2.1.1 基于物种有无存在/缺失的指数这类指数只关心一个物种在样本中“有”还是“没有”忽略其数量多少。适用于关注物种更替Turnover的研究。Jaccard 指数最直观的指数之一。其计算公式为1 - [C / (A B - C)]。其中A是样本A的物种数B是样本B的物种数C是两个样本共有的物种数。这个值越接近1表示两个样本差异越大越接近0则越相似。它衡量的是共有物种比例。Sørensen 指数与Jaccard类似但对共有物种赋予了更高权重。公式为1 - [2C / (A B)]。在生态学中应用非常广泛。注意基于有无的指数计算简单但对稀有物种非常敏感。一个只在某个样本中出现一次的稀有物种会像在另一个样本中出现一万次的优势物种一样对结果产生同等影响。因此在物种检出深度不均或关注群落结构而不仅是物种列表时需谨慎使用。2.1.2 基于物种丰度的指数这类指数同时考虑了物种的有无和它们的相对丰度如测序得到的序列数能更精细地反映群落结构差异。Bray-Curtis 相异性这是生态学和微生物组分析中最常用的丰度型指数。其公式为1 - [2 * Σ min(NiA, NiB) / (Σ NiA Σ NiB)]。其中NiA和NiB是物种i在样本A和B中的丰度。它计算的是两个样本在所有物种上“不匹配”的丰度比例。Bray-Curtis对优势物种的变化更敏感且结果介于0到1之间解释直观。UniFrac 距离这是一个更强大的指数它不仅考虑物种丰度还引入了物种间的系统发育关系。其核心思想是两个样本若在进化树上共享的长分支越多则越相似。未加权UniFrac只考虑物种有无但通过进化树加权。加权UniFrac同时考虑物种有无、丰度和进化树。如果两个样本的微生物在进化树上关系很近但丰度差异巨大加权UniFrac也能捕捉到这种差异。这使得它特别适合微生物群落分析因为微生物中很多是近缘种但功能可能不同。实操心得在实际项目中我通常会同时计算Bray-Curtis和加权UniFrac距离。Bray-Curtis作为通用且稳健的基准而加权UniFrac则提供进化视角的深度洞察。如果两者结论一致那么结果的可靠性就非常高。如果出现分歧就需要深入思考是哪些物种可能是进化上相近但功能分化导致了这种差异这本身可能就是一个有趣的发现。2.2 排序分析将“距离”可视化计算出所有样本两两之间的相异性矩阵一个N x N的距离表格后我们需要将其可视化以观察整体模式。排序分析就是将高维度的距离数据投射到二维或三维平面上的技术。主坐标分析这是与β多样性距离矩阵最匹配、最直接的排序方法。PCoA不关心原始物种数据而是直接基于我们计算好的相异性矩阵如Bray-Curtis矩阵进行降维。它寻找能最大程度保留样本间实际距离的坐标轴。在PCoA图中两个样本点越近说明它们的群落组成越相似。非度量多维标定NMDS也是一种基于距离矩阵的排序方法。与PCoA追求精确距离不同NMDS只要求保持距离的排序关系即如果A与B的距离小于A与C的距离那么在图上A-B的点距也应小于A-C的点距。这使得它对距离指数的类型和异常值不那么敏感在数据分布复杂时可能更稳健。典型对应分析与冗余分析CCA/RDA是约束性排序。它们在排序的同时可以检验环境因子如pH、温度、治疗方案等对群落差异的解释程度。如果你有假设驱动的环境变量用CCA/RDA可以直接检验这些变量是否能显著影响群落分布。一个常见的误解很多人直接用PCA主成分分析来做群落数据的排序。PCA是基于欧氏距离的而欧氏距离对于物种丰度数据来说通常不是最佳选择它对双零即两个样本都缺失某物种的情况处理不当。因此对于群落数据优先使用基于生态学相异性指数如Bray-Curtis的PCoA或NMDS。3. 从数据到洞见β多样性分析的完整工作流理解了核心概念后我们来看一个基于高通量测序数据如16S rRNA基因测序的β多样性分析标准流程。这里以QIIME 2和R语言为例展示从原始数据到得出生物学结论的完整链条。3.1 数据准备与核心距离矩阵计算假设我们已完成测序数据的质控、去噪、生成特征表Feature Table即物种/OTU/ASV表和系统发育树构建。在QIIME 2中计算距离矩阵# 计算Bray-Curtis距离矩阵 qiime diversity beta --i-table feature-table.qza --p-metric braycurtis --o-distance-matrix bray_curtis_distance.qza # 计算加权UniFrac距离矩阵需要之前生成的系统发育树 qiime diversity beta-phylogenetic --i-table feature-table.qza --i-phylogeny rooted-tree.qza --p-metric weighted_unifrac --o-distance-matrix weighted_unifrac_distance.qza在R中使用phyloseq和vegan包进行类似操作library(phyloseq) library(vegan) # 假设ps是一个phyloseq对象包含了OTU表、样本数据和进化树 # 计算Bray-Curtis距离 dist_bray - distance(ps, method bray) # 计算加权UniFrac距离 dist_wunifrac - distance(ps, method wunifrac) # 也可以使用vegan包的vegdist函数计算其他指数 dist_jaccard - vegdist(otu_table(ps), method jaccard, binary TRUE) # binaryTRUE表示使用有无数据3.2 可视化PCoA绘图与解读有了距离矩阵下一步就是可视化。在R中生成并美化PCoA图# 进行PCoA分析 pcoa_bray - ordinate(ps, method PCoA, distance dist_bray) pcoa_wunifrac - ordinate(ps, method PCoA, distance dist_wunifrac) # 使用ggplot2绘制PCoA图并按分组例如“Treatment”着色 library(ggplot2) plot_bray - plot_ordination(ps, pcoa_bray, color Treatment) geom_point(size 3) stat_ellipse(level 0.68) # 添加68%置信区间椭圆类似于1个标准差 theme_bw() labs(title PCoA based on Bray-Curtis Dissimilarity, x paste0(PCoA 1 (, round(pcoa_bray$values$Eigenvalues[1]/sum(pcoa_bray$values$Eigenvalues)*100, 1), %)), y paste0(PCoA 2 (, round(pcoa_bray$values$Eigenvalues[2]/sum(pcoa_bray$values$Eigenvalues)*100, 1), %))) print(plot_bray)解读PCoA图的关键点轴解释率关注坐标轴标签括号里的百分比如PC1: 25.3%。这代表该轴能解释的总群落变异比例。微生物数据通常很嘈杂PC1能解释10%-30%的变异就算不错了。样本聚集相同颜色同一处理组的样本点是否聚集在一起聚集越紧密说明组内重复样本的群落结构越一致。组间分离不同颜色的点群是否明显分开分离程度越大说明处理间的差异越大。椭圆置信区间椭圆有助于直观判断组间的分离是否具有统计意义。如果椭圆重叠严重则需谨慎下结论。3.3 统计检验差异是否显著可视化看到了分离但我们需要统计检验来确认这种差异不是偶然发生的。这里最常用的是置换多元方差分析。# 使用vegan包的adonis2函数进行PERMANOVA分析 # 检验“Treatment”分组对Bray-Curtis距离的解释是否显著 adonis_result_bray - adonis2(dist_bray ~ Treatment, data sample_data(ps), permutations 9999) print(adonis_result_bray)输出解读你会得到一个包含R2和Pr(F)的表格。R2值表示“Treatment”这个因子能解释多少比例的群落变异类似于回归中的R-squared。Pr(F)就是p值小于0.05通常认为组间存在显著差异。重要注意事项PERMANOVA的假设与局限PERMANOVA的一个关键假设是组内离散度同质。也就是说不同组内部的样本变异程度应该差不多。如果某个组的样本点在其内部就非常分散而另一个组非常集中即使它们的中心位置没分开PERMANOVA也可能给出显著结果因为它检测的是分布差异。因此必须同时进行组间离散度同质性检验。# 使用betadisper函数检验组间离散度同质性对Bray-Curtis距离 dispersion - betadisper(dist_bray, group sample_data(ps)$Treatment) anova(dispersion) # 检验离散度差异是否显著 permutest(dispersion, permutations 9999) # 置换检验更稳健 plot(dispersion) # 可视化离散度如果离散度检验也显著p0.05说明组内变异不同此时PERMANOVA的结果需要谨慎解释或者考虑使用考虑离散度的分析方法如adonis2中的by “margin”参数或使用manyglm等模型。4. 进阶策略与常见陷阱让分析更严谨掌握了基础流程后一些进阶策略和常见陷阱能帮助你做出更可靠的分析。4.1 数据标准化与转化不可忽视的前置步骤原始测序数据是“组成型数据”即每个样本的总序列数不同。直接计算距离可能会受到测序深度不均的严重影响。总和标准化将每个样本的计数除以该样本的总序列数转化为相对丰度百分比。这是最常用的方法。在QIIME 2中qiime feature-table relative-frequency命令可实现在R的phyloseq中可用transform_sample_counts(ps, function(x) x/sum(x))。CSS标准化累积和标度标准化对稀疏数据含大量零值更稳健常用于微生物数据。中心对数比转换一种更严格的用于组成型数据的转换方法能将数据从“单纯形”空间映射到欧几里得空间但解释性稍复杂。实操心得对于大多数探索性分析我首选总和对数转换先相对丰度化再对每个值做log10(x1)转换。这既缓和了测序深度的影响又削弱了极端高丰度物种的支配效应使分析更关注整体群落结构。可以在不同标准化方法下重复关键分析如果结论一致则结果非常稳健。4.2 处理混淆因素当样本不止一个差异时在实际研究中样本可能同时属于多个分组如不同地点、不同时间点、不同处理。我们想知道的可能是“在控制了地点变异的影响后处理间的差异是否仍然显著”# 使用adonis2的公式界面控制协变量 # 模型距离 ~ 协变量 主要关注变量 adonis_result_controlled - adonis2(dist_bray ~ Location Treatment, data sample_data(ps), permutations 9999, by margin) # ‘by “margin”’ 表示顺序检验每个变量 print(adonis_result_controlled)在这个例子中Location先进入模型Treatment的效应是在排除Location影响后检验的这更接近我们想要的因果推断。4.3 β多样性分解差异来自物种更替还是嵌套β多样性总差异可以进一步分解为两个部分物种更替一个样本中的物种被另一个样本中完全不同的物种所替代。嵌套性一个样本的物种组成是另一个样本物种组成的子集即只有物种丢失没有新物种替代。使用betapart等R包可以进行这种分解帮助我们理解群落差异产生的生态过程是环境过滤导致物种完全替换还是扩散限制导致物种丢失。4.4 常见陷阱总结忽略离散度检验如前所述不做betadisper就直接相信PERMANOVA的结果是危险的。过度解读不稳定的排序轴如果PC3及以后轴的解释率极低如5%那么在这些轴上观察到的任何模式都可能是噪音不应过度解读。用错距离矩阵对丰度数据使用Jaccard或对关注系统发育的数据不使用UniFrac都可能丢失关键信息或引入偏差。样本量不足PERMANOVA的效力随样本量增加而增加。每组少于5个样本时统计检验的效力很低阴性结果不显著需谨慎对待。未校正多重检验当同时比较多个分组如A vs B, A vs C, B vs C时需要进行p值校正如FDR校正。β多样性分析是一个从多维数据中提取生态学洞察的强大工具。从选择合适的相异性指数到严谨的统计检验每一步都需要基于具体的生物学问题和数据特性做出判断。没有“一刀切”的最佳方法最好的策略往往是多角度验证用不同的距离矩阵、不同的标准化方法、结合统计检验和可视化当所有线索都指向同一个结论时你的发现才坚实可靠。记住β多样性告诉你“差多少”和“是否显著不同”而结合α多样性局部多样性和后续的差异物种分析如LEfSe、DESeq2才能完整地讲述群落变化的故事。
郑州网站建设
网页设计
企业官网